指令遵循
INSTRUCTION ALIGNMENT核验生成图像是否准确还原 Prompt 中的主体、场景、风格、数量关系与环境要求;主体缺失、场景偏差或风格不符均需记录。

为准确掌握生图功能在业界真实水平,建立公平、可量化、可复用的评测体系,系统比较不同模型在文生图与图片编辑方面的能力。
EVALUATION FRAMEWORK
建立公平、可量化、可复用的评测体系,系统比较不同模型在文生图与图片编辑方面的能力,覆盖 120 条文生图数据与 79 条图生图数据。
核验生成图像是否准确还原 Prompt 中的主体、场景、风格、数量关系与环境要求;主体缺失、场景偏差或风格不符均需记录。
综合评估清晰度、构图、光影、色彩统一性与主体细节,同时检查模糊、噪点、压缩感、畸变及低质纹理。
判断生成结果的丰富度、想象力和视觉表现力,关注画面是否在满足指令的前提下呈现独特视角或艺术张力。
评估编辑前后原图主体、结构和风格的一致性,确保修改限定在指令范围内,未越界改动无关区域。
检查编辑区域的融合自然度、边缘处理和整体协调性,关注融合不自然、目标选择错误与编辑越界等问题。
PROBLEM TAGS
SCORING STANDARD
指令还原准确,画面质量优秀,创造性与原图保持均达到预期。
存在轻微偏差或局部质量问题,但不影响整体理解与使用。
核心主体、指令遵循或画面质量存在严重问题,影响结果可用性。
EVALUATION WORKFLOW
按 Prompt 长度、主体数量、环境复杂度划分简单、中等、困难三级,初步构建测试集。
开展小批量试评测,验证维度可操作性,调整 Rubric 并对齐评分尺度。
形成 120 条文生图数据与 79 条图生图数据,覆盖多类型多难度任务。
采用双盲独立评分、组内拉齐与逐条全检机制;争议数据注明争议维度并打回重估。
输出可比较结果与问题分布分析,为模型选型、任务分配与采购接入提供决策依据。