GENERATIVE MEDIA / QUALITY EVALUATION

图像与视频
生成效果评测

围绕用户指令,评估夸克生成图片与视频的质量。

范晨 · AI 训练师夸克 · 图像与视频生成
INPUT用户指令与输入素材
OUTPUT图片 / 视频生成结果
EVALUATION评分、标签与证据

01 · CONTEXT

评估生成结果,
是否真正满足需求。

检查图片与视频在指令执行、内容合理性和视觉质量上的实际表现,定位影响使用的具体问题,为生成效果分析与后续优化提供支持。

文生图图像编辑视频生成质量评测

02 / EVALUATION DIMENSIONS

评测维度

图片与视频按各自的生成方式和质量特征评估。文生图、图像编辑与视频生成分别展开。

03 个评测维度

检查单张画面的内容与质量

从文字描述生成新图,重点判断需求是否被准确表达,以及画面本身是否合理、自然。

01

指令遵循度

检查主体、动作、关系、风格和指定文字是否符合用户要求。区分核心目标、关键限定与细节,判断是否遗漏、错解或增加无关内容。

02

物理合理度

核对人体与物体结构、比例透视、光影、材质和交互是否合理,判断画面呈现的动作是否符合基本物理规律。

03

美观度

观察清晰度、色彩层次、构图焦点与主体表现,判断画面是否自然、协调,并能表达所需风格与氛围。

03 / SCORING

评分机制

采用 0–3 分四档评分。选择任务类型与分值,查看对应的质量要求和可用性边界。

文生图 / OVERALL QUALITY3/ 3

优质满足

“这正是我想要的!”

这一档的判定条件

  • 指令完全遵循。
  • 人体结构、运动轨迹、光源透视、比例、交互和材质正确。
  • 画面清晰,色彩、构图、主体、真实感、风格与创意表现好,无明显 AI 油感。

评分与标签分开:总体得分概括整体效果,问题标签定位原因;不按“一个问题扣一分”机械计算。

合规单独标记:常规质量评分中,合规问题只打标;多轮直接判 0 等专项规则另见下方边界说明。

统计方法与同题比较

平均表现

均值得分

(n₁ + 2n₂ + 3n₃) / N

反映本批纳入样本的整体得分水平。

高质量占比

优质率

n₃ / N

只计入 3 分样本,观察优质满足的比例。

实际可用占比

可用率

(n₂ + n₃) / N

2 分与 3 分均纳入可用样本。

严重失败占比

0 分率

n₀ / N

不等于全部不可用率,因为 1 分也不可用。

N 为本批纳入统计的结果数;n₀—n₃ 为对应档位数量。先明确任务、版本、纳入范围与计数单位,再比较指标。

问题分布另看分母:标签可联动、多选;按“含该标签的样本数 / N”统计时,各标签比例之和可能超过 100%。按“标签出现次数 / 总标签次数”统计是另一种口径,不能混在同一张分布图中。质量分、多样性与 GSB 分别记录。

GOOD / SAME / BAD

同题比较模型 A 与模型 B

Good:A 更好。Same:效果相近。Bad:A 更差。

胜平率 = (Good + Same) / 比较总数;Bad 比例 = Bad 数 / 比较总数。Same 可能是“两者都好”,也可能是“两者都不好”,必须结合绝对质量解读。

同一场景 / 相同输入
模型 Avs模型 B
质量得分 + GSB 相对结论

04 / ERROR TAXONOMY

从“有问题”,到具体的问题标签。

按任务查看完整问题分类与定义。标签之间的联动、替代和豁免条件,保留在对应条目中。

3 个一级维度 · 32 个问题标签

01指令遵循度12 项

核心指令丢失

生成图完全忽略或错解了指令中最关键、最本质的需求,导致生成图需求完全偏离。
(注:如果以下细化的指令遵循标签作为了核心指令,需把核心指令与细化的指令遵循标签都打上)

关键性限定未遵循

围绕主体的描述内容作为关键性限定,关键性限定被遗漏或忽略。
(注:如存在对应细化的指令遵循标签,将不打该标签)

细节描述未遵循

除去核心需求与关键性限定外的描述未遵循
(注:如存在对应细化的指令遵循标签,将不打该标签)

指令动作未遵循

有动作要求时,未按要求的动作生成

对象定位错误

生成图对指令中描述对象的空间位置定位错误,导致指令执行在其他对象上。

多对象关系错位

当指令涉及多个对象时,生成图对它们之间的相对关系、互动关系进行了错误处理。

IP 理解错误

生成图对指令中提到的IP,知名人物理解错误,缺少IP典型特征。

风格匹配错误

生成图未能按照指令要求的艺术风格或模仿特定艺术家风格进行创作。

生成无关内容

生成图擅自添加了指令中未提及的新对象、人物或背景元素。

文字内容生成错误

生成图对指令中要求生成或修改文字的需求处理错误,出现乱码、字符错误、语义不通或根本无法辨认的情况。

常识性错误

违背生活常识。
生活常识层面:女生在自拍,手机正面没朝向自己

负向指令未遵循

指令明确说不要的元素被生成

02物理合理度9 项

人体结构错误

呈现出不符合正常人体构造的形态。出现多肢/缺肢、关节错位(肢体关节出现反向或不可能的弯曲)、五官错位/缺失等问题。

运动轨迹错误

违背了基本的物理运动规律。
物理层面:例如水向上流

光源与透视错误

存在多个矛盾的光源与透视错误,出现阴影错误(方向/有无)、光源矛盾、透视变形、反射/折射错误的问题。

比例协调性错误

存在不合常理的比例问题。

物体交互错误

物与人/物与物之间的互动关系不符合物理逻辑,但并未发生穿模。

多主体互动穿模

两个或多个的主体(如人与人/人物)的身体部分发生了不应有的重叠或互相穿透。

物体完整性破坏

物体本身在结构上存在不完整、断裂、无故多出一部分或形态扭曲等问题。

人体四肢崩坏

指手/脚部崩坏,肢体融合等。

材质表现错误

材质与其应有的属性不符。

03美观度11 项

模糊低清

分辨率低下、画面模糊、缺乏应有的细节,整体观感质量差。

色彩搭配不足

整体色彩不协调,颜色搭配冲突、刺眼,或色彩过暗、单一、缺乏层次感。

构图混乱

画面中元素的排布杂乱无章、缺乏明确的视觉焦点、主体不突出。元素之间相互遮挡或堆砌。多用于海报等生产力。

人物表现差

生成的人物在美学上存在问题,如面部特征不符合大众审美、出现四肢崩塌等物理合理性错误;以及如双人互动时视线交错,导致画面违和不合理等问题。
(注:当出现【人体四肢崩坏】或【人物AI 感重】必定联动要打该标签)

主体表现差

核心主体动物或物体等缺乏美感。

人物AI 感重

当人物存在AI 感,例如如皮肤细节过于平滑或被涂抹,丢失纹理细节,形成一种类似油画颜料未干的“油腻”观感。

非人物AI 感重

画面中非人物部分给人一种虚假、不自然的“塑料感”。通常表现为物体表面过于光滑缺乏纹理,给人一种“假”的印象。

多人物相似度高

生成的多人物中,有两张或两张以上的人脸完全一致

风格与创意低

在指令相对虚幻的情况下(如:氛围感、生活感),生成的图像缺乏想象力和艺术性。

文字瑕疵失真

生成图像中指令要求之外的文字形式的内容出现了乱码、扭曲变形、无法辨认等假文本。

整体美学不足

生成图像整体美观度不足,不符合大众审美。
当由于具体的人物表现差/主体表现差时,打细化标签,不联动该标签

容易混淆的边界

整体结构错误 vs 局部手指问题多手指/脚趾占比不大或不明显时可为 2 分;多手/多脚不论占比按 0/1 分处理。

主体一致性 vs 主体还原度一致性关注视频内部及相对输入素材的身份/特征变化;还原度对照输入主体,判断是否找对人或物、外观是否匹配。用户明确要求改变的特征优先按指令核对。

图片交互 vs 视频交互图片规则区分未穿透的交互错误与多主体穿模;视频“交互动作错误”定义包含手穿过物体,不直接照搬图片标签的排他关系。

指令里的文字 vs 画面附带文字要求生成或修改的文字错误,归指令遵循;未要求的背景假文字,归文字瑕疵或视频文字表现。

主体保持 vs 指令要求改变原图一致度只检查应保留的部分。未强制保持不变的内容,不打原图一致度标签,也不因此扣分;人物生成成另一个人仍需打标。

人物 AI 感 vs 整体真实感“AI 油感”特指皮肤失真;头发显假也会影响人物真实感。人体四肢崩坏或人物 AI 感重,需联动“人物表现差”;已有具体人物/主体问题,不再联动“整体美学不足”。

补充 / SPECIAL CONDITIONS

专项判定规则

多轮和多图使用不同的判定逻辑,不能把所有任务都套进同一张扣分表。

多轮生成与编辑6 类问题 · 4 类直接判 0

每轮单独判断效果,后续轮次增加多轮问题标签。先区分“理解或承接错误”与“理解正确但模型执行失败”。

命中后直接 0 分

意图理解错误

未理解指令意图。

意图理解正确、执行出现错误,为模型本身问题;意图理解错误、执行出现错误,为多轮问题;意图理解正确且多轮改写正确、但无法执行,为模型本身问题。

命中后直接 0 分

未承接多轮

出现上一轮生成结果在下一轮未延续的情况。
注意:只核对上一轮已编辑的图片、视频结果,不考虑跨轮等情况;即使上轮生成的有误,下轮也需要在上轮图片的基础上继续编辑,否则即为未承接多轮。
无法确定是否为指令转写问题时,先记录问题,再交由复核确认。

第四轮中 3:4 的比例生成了白边(有误),下一轮没有延续,依旧算未承接多轮。

命中后直接 0 分

过度承接上文

伪多轮情况下,模型连带伪多轮首轮的前轮内容进行了延续生成。

例如:同一个 session 中出现伪多轮情况,生成内容还包含伪多轮前轮提到的内容,则称作过度承接上文。

命中后直接 0 分

目标对象有误

模型没有准确识别用户指定的目标对象。
如用户 指令 为“第三张图换个风格”,那么目标图片为“上一轮的第三张图”。

用户指明要在上上轮的基础上修改,模型借鉴了前两轮,识别错了“上上轮”所指对象,算目标对象有误。

只记录,不作为扣分项

需求澄清缺失

在用户需求模糊、信息不充分、反馈待完善时,未通过举例等方式推动用户明确目标,导致后续对话难以精准响应。

可以贴 badcase,但是不作为扣分项。

只记录,不作为扣分项

未生成结果

包含所有未生成情况,例如响应超时、返回文字但未返回图片、返回空白或返回 chat 错误等。

可以贴 badcase,但是不作为扣分项。

上下文边界:“未承接多轮”检查上一轮结果是否延续;“目标对象有误”检查指向是否正确。用户明确引用更早轮次时,需要核对其指定对象,不能把所有任务都限定为上一轮。

多图润色与指令拆解8 类问题

先逐图核对指令与输入是否对应,再区分整条指令、部分内容和部分图片的丢失;多图融合只有在用户要求时才算正确执行。

指令错位

指令拆解与图片内容不对应,发生错位。

指令全部丢失

所有图片的指令均缺失。

指令部分丢失—指令维度

指令能够正确拆解,但部分指令内容不完整,有缺失。

指令部分丢失—图片维度

部分图片的指令能够正确拆解,但部分图片的指令有缺失。

指令部分多余

相关指令能够正确拆解,但存在部分多余指令。

指令解析有误

指令存在错误解析,描述有误,与原 指令 意图不符。

指令未拆解

多图同指令或多图多指令时,未按用户需求逐图拆解生成提示词,而是将完整原始需求直接作为输出提示词。

多图融合

输出图将多张输入图进行了图片融合处理,未准确执行指令。