由发光图像画框与像素粒子组成的文生图评测视觉
01TEXT TO IMAGE

文生图评测

为准确掌握生图功能在业界真实水平,建立公平、可量化、可复用的评测体系,系统比较不同模型在文生图与图片编辑方面的能力。

指令遵循画面质量创造性原图保持视觉质量

EVALUATION FRAMEWORK

文生图评测体系

文生图 × 图生图 × 多模型横向对比

建立公平、可量化、可复用的评测体系,系统比较不同模型在文生图与图片编辑方面的能力,覆盖 120 条文生图数据与 79 条图生图数据。

01

指令遵循

INSTRUCTION ALIGNMENT

核验生成图像是否准确还原 Prompt 中的主体、场景、风格、数量关系与环境要求;主体缺失、场景偏差或风格不符均需记录。

02

画面质量

IMAGE QUALITY

综合评估清晰度、构图、光影、色彩统一性与主体细节,同时检查模糊、噪点、压缩感、畸变及低质纹理。

03

创造性

CREATIVITY

判断生成结果的丰富度、想象力和视觉表现力,关注画面是否在满足指令的前提下呈现独特视角或艺术张力。

04

原图保持(图生图)

SOURCE PRESERVATION

评估编辑前后原图主体、结构和风格的一致性,确保修改限定在指令范围内,未越界改动无关区域。

05

视觉质量(图生图)

EDIT QUALITY

检查编辑区域的融合自然度、边缘处理和整体协调性,关注融合不自然、目标选择错误与编辑越界等问题。

PROBLEM TAGS

具体问题标签

·

光影偏差

·

色彩失真

·

结构比例错误

·

构图不当

·

编辑越界

·

目标选择错误

·

融合不自然

SCORING STANDARD

分档 Rubric 评分

完全符合

指令还原准确,画面质量优秀,创造性与原图保持均达到预期。

基本符合

存在轻微偏差或局部质量问题,但不影响整体理解与使用。

明显不符合

核心主体、指令遵循或画面质量存在严重问题,影响结果可用性。

EVALUATION WORKFLOW

从构建到验收的全流程

01

小规模构建

按 Prompt 长度、主体数量、环境复杂度划分简单、中等、困难三级,初步构建测试集。

02

试评测

开展小批量试评测,验证维度可操作性,调整 Rubric 并对齐评分尺度。

03

全量构建

形成 120 条文生图数据与 79 条图生图数据,覆盖多类型多难度任务。

04

双盲评分

采用双盲独立评分、组内拉齐与逐条全检机制;争议数据注明争议维度并打回重估。

05

验收与输出

输出可比较结果与问题分布分析,为模型选型、任务分配与采购接入提供决策依据。

评测方式

分档 Rubric + 双盲独立评分 + 组内拉齐 + 逐条全检

项目产出

覆盖 199 条任务的多模型评测体系、可比较结果、问题分布分析与案例库