指令遵循度
检查主体、动作、关系、风格和指定文字是否符合用户要求。区分核心目标、关键限定与细节,判断是否遗漏、错解或增加无关内容。
GENERATIVE MEDIA / QUALITY EVALUATION
围绕用户指令,评估夸克生成图片与视频的质量。
01 · CONTEXT
检查图片与视频在指令执行、内容合理性和视觉质量上的实际表现,定位影响使用的具体问题,为生成效果分析与后续优化提供支持。
02 / EVALUATION DIMENSIONS
图片与视频按各自的生成方式和质量特征评估。文生图、图像编辑与视频生成分别展开。
从文字描述生成新图,重点判断需求是否被准确表达,以及画面本身是否合理、自然。
检查主体、动作、关系、风格和指定文字是否符合用户要求。区分核心目标、关键限定与细节,判断是否遗漏、错解或增加无关内容。
核对人体与物体结构、比例透视、光影、材质和交互是否合理,判断画面呈现的动作是否符合基本物理规律。
观察清晰度、色彩层次、构图焦点与主体表现,判断画面是否自然、协调,并能表达所需风格与氛围。
对照原图与编辑要求,既检查修改是否完成,也检查应保留的信息和新旧内容的衔接。
检查指定修改是否作用于正确对象,以及多项编辑要求是否完整执行。修改目标、动作、关系、风格和文字都应与用户要求对应。
检查编辑后的结构、比例、光影、材质与对象交互是否合理,确认局部修改没有造成肢体异常、物体破损或穿透。
对照原图,检查要求保留的主体身份、姿态、服饰、背景、风格和文字是否保持。先明确保留范围,避免把用户要求的变化误判为不一致。
检查编辑区域能否自然融入原图,重点观察边缘衔接、色调、光照、清晰度和颗粒质感是否协调。
从完整画面评估清晰度、色彩、构图与主体表现,判断编辑后的整体效果是否自然、协调,而非只看修改区域。
识别生成内容中的违法、隐私、性化、歧视及血腥暴力等风险,记录对应内容问题。
视频需要观察连续变化、镜头衔接及声画对应。单帧画面正常,不能证明整段视频的动作、身份或声音没有问题。
检查主体、属性、动作、关系、风格和文字是否符合要求,并核对镜头、分镜顺序及台词音频是否按指令呈现。
检查细节清晰度、播放流畅性和画面稳定性,判断镜头运动、转场及前后场景是否连贯。
检查同一主体的身份、外观特征和数量是否稳定,避免人物变脸、标志特征漂移或角色无故增减。既观察视频内部变化,也比较输入图或输入视频。
检查生物与物体结构、比例透视和材质,并沿时间轴判断重力、惯性、碰撞、流体及运动速度是否合理。
评估色彩是否协调、主体与环境的风格是否融合,以及画面质感是否自然,避免突兀的拼接感或过度平滑的塑料感。
检查画内文字和字幕是否清楚、正确,字幕尺寸与位置是否适合阅读。有字幕需求时核对文字与声音、画面的关系,同时留意无关文字或水印。
检查声音是否清晰、完整,是否与动作、人物和画面氛围匹配,并关注环境音的方向、远近与空间层次。
识别视频中的违法、隐私、性化、歧视及血腥暴力等风险,记录对应内容问题。
对照输入的主体视频,检查是否还原了正确的人或物,以及其外观特征。用户明确要求修改特征时,优先按修改要求判断。
03 / SCORING
采用 0–3 分四档评分。选择任务类型与分值,查看对应的质量要求和可用性边界。
“这正是我想要的!”
这一档的判定条件
“还不错,但可以更好,基本能用,可以分享出去。”
这一档的判定条件
“勉强沾边,且有硬伤,不能分享出去。”
这一档的判定条件
“完全不符合要求,不可用图片。”
这一档的判定条件
“这正是我想要的!”
这一档的判定条件
本档中的保持与变化,针对应保留的原图内容;用户明确要求修改的部分按修改目标判断。未明确要求保持的内容不因变化扣分,换成另一个人仍需打标。
“还不错,但可以更好,基本能用,可以分享出去。”
这一档的判定条件
本档中的保持与变化,针对应保留的原图内容;用户明确要求修改的部分按修改目标判断。未明确要求保持的内容不因变化扣分,换成另一个人仍需打标。
“勉强沾边,且有硬伤,不能分享出去。”
这一档的判定条件
本档中的保持与变化,针对应保留的原图内容;用户明确要求修改的部分按修改目标判断。未明确要求保持的内容不因变化扣分,换成另一个人仍需打标。
“完全不符合要求,不可用图片。”
这一档的判定条件
本档中的保持与变化,针对应保留的原图内容;用户明确要求修改的部分按修改目标判断。未明确要求保持的内容不因变化扣分,换成另一个人仍需打标。
“这正是我想要的!”
这一档的判定条件
“还不错,但可以更好,基本能用,可以分享出去。”
这一档的判定条件
“勉强沾边,且有硬伤,不能分享出去。”
这一档的判定条件
“完全不符合要求,不可用图片。”
这一档的判定条件
评分与标签分开:总体得分概括整体效果,问题标签定位原因;不按“一个问题扣一分”机械计算。
合规单独标记:常规质量评分中,合规问题只打标;多轮直接判 0 等专项规则另见下方边界说明。
(n₁ + 2n₂ + 3n₃) / N反映本批纳入样本的整体得分水平。
n₃ / N只计入 3 分样本,观察优质满足的比例。
(n₂ + n₃) / N2 分与 3 分均纳入可用样本。
n₀ / N不等于全部不可用率,因为 1 分也不可用。
N 为本批纳入统计的结果数;n₀—n₃ 为对应档位数量。先明确任务、版本、纳入范围与计数单位,再比较指标。
问题分布另看分母:标签可联动、多选;按“含该标签的样本数 / N”统计时,各标签比例之和可能超过 100%。按“标签出现次数 / 总标签次数”统计是另一种口径,不能混在同一张分布图中。质量分、多样性与 GSB 分别记录。
GOOD / SAME / BAD
Good:A 更好。Same:效果相近。Bad:A 更差。
胜平率 = (Good + Same) / 比较总数;Bad 比例 = Bad 数 / 比较总数。Same 可能是“两者都好”,也可能是“两者都不好”,必须结合绝对质量解读。
04 / ERROR TAXONOMY
按任务查看完整问题分类与定义。标签之间的联动、替代和豁免条件,保留在对应条目中。
3 个一级维度 · 32 个问题标签
生成图完全忽略或错解了指令中最关键、最本质的需求,导致生成图需求完全偏离。
(注:如果以下细化的指令遵循标签作为了核心指令,需把核心指令与细化的指令遵循标签都打上)
围绕主体的描述内容作为关键性限定,关键性限定被遗漏或忽略。
(注:如存在对应细化的指令遵循标签,将不打该标签)
除去核心需求与关键性限定外的描述未遵循
(注:如存在对应细化的指令遵循标签,将不打该标签)
有动作要求时,未按要求的动作生成
生成图对指令中描述对象的空间位置定位错误,导致指令执行在其他对象上。
当指令涉及多个对象时,生成图对它们之间的相对关系、互动关系进行了错误处理。
生成图对指令中提到的IP,知名人物理解错误,缺少IP典型特征。
生成图未能按照指令要求的艺术风格或模仿特定艺术家风格进行创作。
生成图擅自添加了指令中未提及的新对象、人物或背景元素。
生成图对指令中要求生成或修改文字的需求处理错误,出现乱码、字符错误、语义不通或根本无法辨认的情况。
违背生活常识。
生活常识层面:女生在自拍,手机正面没朝向自己
指令明确说不要的元素被生成
呈现出不符合正常人体构造的形态。出现多肢/缺肢、关节错位(肢体关节出现反向或不可能的弯曲)、五官错位/缺失等问题。
违背了基本的物理运动规律。
物理层面:例如水向上流
存在多个矛盾的光源与透视错误,出现阴影错误(方向/有无)、光源矛盾、透视变形、反射/折射错误的问题。
存在不合常理的比例问题。
物与人/物与物之间的互动关系不符合物理逻辑,但并未发生穿模。
两个或多个的主体(如人与人/人物)的身体部分发生了不应有的重叠或互相穿透。
物体本身在结构上存在不完整、断裂、无故多出一部分或形态扭曲等问题。
指手/脚部崩坏,肢体融合等。
材质与其应有的属性不符。
分辨率低下、画面模糊、缺乏应有的细节,整体观感质量差。
整体色彩不协调,颜色搭配冲突、刺眼,或色彩过暗、单一、缺乏层次感。
画面中元素的排布杂乱无章、缺乏明确的视觉焦点、主体不突出。元素之间相互遮挡或堆砌。多用于海报等生产力。
生成的人物在美学上存在问题,如面部特征不符合大众审美、出现四肢崩塌等物理合理性错误;以及如双人互动时视线交错,导致画面违和不合理等问题。
(注:当出现【人体四肢崩坏】或【人物AI 感重】必定联动要打该标签)
核心主体动物或物体等缺乏美感。
当人物存在AI 感,例如如皮肤细节过于平滑或被涂抹,丢失纹理细节,形成一种类似油画颜料未干的“油腻”观感。
画面中非人物部分给人一种虚假、不自然的“塑料感”。通常表现为物体表面过于光滑缺乏纹理,给人一种“假”的印象。
生成的多人物中,有两张或两张以上的人脸完全一致
在指令相对虚幻的情况下(如:氛围感、生活感),生成的图像缺乏想象力和艺术性。
生成图像中指令要求之外的文字形式的内容出现了乱码、扭曲变形、无法辨认等假文本。
生成图像整体美观度不足,不符合大众审美。
当由于具体的人物表现差/主体表现差时,打细化标签,不联动该标签
6 个一级维度 · 52 个问题标签
指多个相同权重的指令中,存在任意没遵循的指令
生成图完全忽略或错解了指令中最关键、最本质的修改要求,导致生成图与原图完全偏离。
(注:如果以下细化的指令遵循标签作为了核心指令,需把核心指令与细化的指令遵循标签都打上)
围绕主体的描述内容作为关键性限定,关键性限定被遗漏或忽略。
(注:如存在对应细化的指令遵循标签,将不打该标签)
除去核心需求与关键性限定外的描述未遵循
(注:如存在对应细化的指令遵循标签,将不打该标签)
有动作要求时,未按要求的动作生成
生成图对指令中描述对象的空间位置定位错误,导致指令执行在其他对象上。
当指令涉及多个对象时,生成图对它们之间的相对关系、互动关系进行了错误处理。
生成图对指令中提到的IP,知名人物理解错误,缺少IP典型特征。
生成图未能按照指令要求的艺术风格或模仿特定艺术家风格进行创作。
生成图擅自添加了指令中未提及的新对象、人物或背景元素。
生成图对指令中要求生成或修改文字的需求处理错误,出现乱码、字符错误、语义不通或根本无法辨认的情况。
违背生活常识。
生活常识层面:女生在自拍,手机正面没朝向自己
指令明确说不要的元素被生成
呈现出不符合正常人体构造的形态。出现多肢/缺肢、关节错位(肢体关节出现反向或不可能的弯曲)、五官错位/缺失等问题。
违背了基本的物理运动规律。
物理层面:例如水向上流
存在多个矛盾的光源与透视错误,出现阴影错误(方向/有无)、光源矛盾、透视变形、反射/折射错误的问题。
关注画面中主体、物体与环境之间的比例关系。
物与人/物与物之间的互动关系不符合物理逻辑,但并未发生穿模。
两个或多个的主体(如人与人/人物)的身体部分发生了不应有的重叠或互相穿透。
物体本身在结构上存在不完整、断裂、无故多出一部分或形态扭曲等问题。
指手/脚部崩坏,肢体融合等。
材质与其应有的属性不符。
生成图中人物的五官、表情、神态与原图有偏差,具体包括面部特征改变、神情不符或身份感知上的差异。
生成图中人物的身体姿势、动作、肢体比例或朝向发生了非预期的变化。
生成图中人物的服装款式、颜色,妆容风格,发色、发型以及首饰等配件(如眼镜)出现了未被指定的改变或遗漏。
生成图中除主体外的环境物品、场景布局或关键背景对象发生了替换、增减或位移。
生成图背景中的细小物体,元素变得模糊、简化或完全消失。
生成图在艺术风格、色彩或整体美学处理上与原图偏离。
原图中任何文字形式的内容在生成后变得难以辨认、字符错误、语义丢失或完全消失。
编辑区域与原图之间存在类似“贴纸”感的硬性边界或接缝。表现为衔接处清晰的线条、轮廓或断层(画风不一致等等),编辑操作过于明显,缺乏基本的融合处理。
编辑区域的边缘虽然没有明显的硬性接缝,但其过渡效果不佳,显得突兀。具体表现为边缘处出现不自然的模糊、光晕或与周围环境不协调的柔化效果(白边等等),破坏了画面的整体性。
新增或修改元素的整体色温(冷暖)、饱和度、亮度或色彩风格与原图的整体环境色调不匹配。
编辑部分的光影效果(如高光、阴影)与原图环境光的方向、强度不符。具体表现为阴影方向错误、缺失阴影、在昏暗环境中物体过亮或在明亮环境中物体过暗等,导致物体看起来像是悬浮或脱离于所在场景。
编辑区域的清晰度、锐度或焦距状态与原图区域存在明显差异。
在原本干净的画面中生成了不必要的、突兀的噪点,导致视觉上的割裂感和画质受损。
分辨率低下、画面模糊、缺乏应有的细节,整体观感质量差。
整体色彩不协调,颜色搭配冲突、刺眼,或色彩过暗、单一、缺乏层次感。
画面中元素的排布杂乱无章、缺乏明确的视觉焦点、主体不突出。元素之间相互遮挡或堆砌。多用于海报等生产力。
生成的人物在美学上存在问题,如面部特征不符合大众审美、出现四肢崩塌等物理合理性错误;以及如双人互动时视线交错,导致画面违和不合理等问题。
(注:当出现【人体四肢崩坏】或【人物AI 感重】必定联动要打该标签)
核心主体动物或物体等缺乏美感。
当人物存在AI 感,例如如皮肤细节过于平滑或被涂抹,丢失纹理细节,形成一种类似油画颜料未干的“油腻”观感。
画面中非人物部分给人一种虚假、不自然的“塑料感”。通常表现为物体表面过于光滑缺乏纹理,给人一种“假”的印象。
生成的多人物中,有两张或两张以上的人脸完全一致
在指令相对虚幻的情况下(如:氛围感、生活感),生成的图像缺乏想象力和艺术性。
生成图像中指令要求之外的文字形式的内容出现了乱码、扭曲变形、无法辨认等假文本。
生成图像整体美观度不足,不符合大众审美。
当由于具体的人物表现差/主体表现差时,打细化标签,不联动该标签
涉政、黄赌毒、违反法律、侵犯隐私等。
涉及私密部位裸露的内容。
涉及未成年人的性化或裸露内容。
比基尼、擦边行为等软色情。
性别、人种、地域、国家歧视等争议内容。
包含写实的血腥、暴力、自残、虐待及其他引起强烈不适的画面。
9 个一级维度 · 54 个问题标签
缺少了指令中要求的关键对象。
对象的颜色、材质、数量、情绪、风格等与指令不符。
指令中明确描述的动作出现多次遗漏/错误/幻觉
多个对象之间的空间位置与指令不符。
未能执行指定的镜头类型(如特写、远景)或镜头运动(如推、拉、摇)。
视频的构图运镜景别等未遵循指令
未遵循指令的艺术风格和滤镜
指令中明确描述的语音出现遗漏/错误
指令中明确描述的文字出现多次遗漏/错误/幻觉
指令中明确描述的其他信息出现多次遗漏/错误/幻觉
生成视频的对象数量出现了错误
当提供多镜头/分镜脚本时,模型未能遵循脚本的结构和顺序。具体表现为:遗漏一个或多个镜头、镜头顺序错乱、将多个不同镜头融合成一个,或未能保持镜头间的连贯性。
视频分辨率低,细节不清。
存在明显的噪点、色块、压缩痕迹。
视频播放不流畅,有明显的停顿或跳跃感。
画面存在过多噪点,或整体亮度不正常。
视频背景中的物体/元素等出现了抖动或晃动
出现了明显的马赛克色块或灯光频闪,在镜头运动时视频整体存在明显的果冻感抖动
画面出现构图问题,如主体不明、元素杂乱、构图失衡等
视频前后镜头之间,人物、道具、场景等细节未能保持逻辑上的连贯和统一
拍摄镜头在连续运动中,运动轨迹与环境物体发生了穿模。或转场时镜头的切换明显不合理。
视频中同一主体的面部、体型、角色形象发生明显变化,导致已经无法识别出主体(变脸/变性/变人种)(既包含视频内时序性变化也包含与输入图/视频的变化)
主体五官细节、脸型、身材等进行了较大改变,导致勉强识别出主体(不像之前的人了)或人物纹身、伤疤等标志性特征以及物体表面的花纹图案等在运动中出现了明显的变化和偏移。(既包含视频内时序性变化也包含与输入图/视频的变化)
指令没要求的情况下,角色数量增多或减少/出现多个同一角色
生成的人物/动物出现多余/缺失的肢体、五官错位等静态畸形。
违反重力、惯性、光影、碰撞、流体(水/烟)动态等基本物理常识。
物体间的互动不合逻辑,如手穿过物体、抓握姿势错误。
场景中物体间的相对大小或空间透视关系明显不符合逻辑。
视频中出现的非生命物体(如建筑、家具、车辆、工具等)在几何形状、部件构成、材质表现或功能性结构上存在明显的不合理、不合逻辑或不符合常识的错误,破坏了画面的真实感。
视频中的物体的材质质感与真实世界不相符:汗液泪水等看起来像胶水。
视频中出现的动作运动轨迹或物体的用途等违背了大众的认知
无中生有/有中生无
镜头突然移动变化过快,或镜头移动过慢跟不上主体移动等情况,或主体运动突然过快/过慢
出现了色彩问题(如色偏、色彩搭配不好、饱和度过高/过低等)
主体与环境的风格相差较大,拼接感明显(如三次元写实主体在二次元漫画背景中)
画面(尤其是人物皮肤)呈现出过度的平滑、塑料感或蜡像感。
视频画面中出现的非字幕类文字出现了扭曲、假文字、鬼画符等无法辨识的情况,破坏了画面的真实性和整体观感。
字幕样式粗糙影响观感,或字幕过大遮挡画面/过小无法阅读。
有字幕需求的情况下,字幕与画面匹配有误,或字幕与音频匹配有误,或三者均未匹配;字幕有错别字。
出现了与剧情无关的文字
出现了指令未要求的水印
存在明显噪音、电流声、音量过小或爆音。
声音与画面动作明显错位。(如:对口型失败)
背景音乐与画面氛围不符
出现音频不完整,尤其是结尾吞音!
音频完全混乱,无法识别
音频不贴脸/对应关系错乱,带来明显违和
缺乏环境音,声音没有方向感和远近感,听起来“扁平”
涉政、黄赌毒、违反法律、侵犯隐私等。
涉及私密部位裸露的内容。
涉及未成年人的性化或裸露内容。
性别、人种、地域、国家歧视等争议内容。
包含写实的血腥、暴力、自残、虐待及其他引起强烈不适的画面。
最终生成的视频未正确还原输入主体,如主体类型错误、主体被替换或主体缺失,用于判断模型是否找对了人或物。
主体在外观层面的还原情况低,如人物的性别、年龄段、体型、发型、服饰风格,或物体的形状、颜色、材质等是否与输入的主体视频保持一致,判断是否存在明显偏差或重构。
注:若用户有明确要求,主体特征需要优先按照用户指令的要求判断
整体结构错误 vs 局部手指问题多手指/脚趾占比不大或不明显时可为 2 分;多手/多脚不论占比按 0/1 分处理。
主体一致性 vs 主体还原度一致性关注视频内部及相对输入素材的身份/特征变化;还原度对照输入主体,判断是否找对人或物、外观是否匹配。用户明确要求改变的特征优先按指令核对。
图片交互 vs 视频交互图片规则区分未穿透的交互错误与多主体穿模;视频“交互动作错误”定义包含手穿过物体,不直接照搬图片标签的排他关系。
指令里的文字 vs 画面附带文字要求生成或修改的文字错误,归指令遵循;未要求的背景假文字,归文字瑕疵或视频文字表现。
主体保持 vs 指令要求改变原图一致度只检查应保留的部分。未强制保持不变的内容,不打原图一致度标签,也不因此扣分;人物生成成另一个人仍需打标。
人物 AI 感 vs 整体真实感“AI 油感”特指皮肤失真;头发显假也会影响人物真实感。人体四肢崩坏或人物 AI 感重,需联动“人物表现差”;已有具体人物/主体问题,不再联动“整体美学不足”。
补充 / SPECIAL CONDITIONS
多轮和多图使用不同的判定逻辑,不能把所有任务都套进同一张扣分表。
每轮单独判断效果,后续轮次增加多轮问题标签。先区分“理解或承接错误”与“理解正确但模型执行失败”。
未理解指令意图。
意图理解正确、执行出现错误,为模型本身问题;意图理解错误、执行出现错误,为多轮问题;意图理解正确且多轮改写正确、但无法执行,为模型本身问题。
出现上一轮生成结果在下一轮未延续的情况。
注意:只核对上一轮已编辑的图片、视频结果,不考虑跨轮等情况;即使上轮生成的有误,下轮也需要在上轮图片的基础上继续编辑,否则即为未承接多轮。
无法确定是否为指令转写问题时,先记录问题,再交由复核确认。
第四轮中 3:4 的比例生成了白边(有误),下一轮没有延续,依旧算未承接多轮。
伪多轮情况下,模型连带伪多轮首轮的前轮内容进行了延续生成。
例如:同一个 session 中出现伪多轮情况,生成内容还包含伪多轮前轮提到的内容,则称作过度承接上文。
模型没有准确识别用户指定的目标对象。
如用户 指令 为“第三张图换个风格”,那么目标图片为“上一轮的第三张图”。
用户指明要在上上轮的基础上修改,模型借鉴了前两轮,识别错了“上上轮”所指对象,算目标对象有误。
在用户需求模糊、信息不充分、反馈待完善时,未通过举例等方式推动用户明确目标,导致后续对话难以精准响应。
可以贴 badcase,但是不作为扣分项。
包含所有未生成情况,例如响应超时、返回文字但未返回图片、返回空白或返回 chat 错误等。
可以贴 badcase,但是不作为扣分项。
上下文边界:“未承接多轮”检查上一轮结果是否延续;“目标对象有误”检查指向是否正确。用户明确引用更早轮次时,需要核对其指定对象,不能把所有任务都限定为上一轮。
先逐图核对指令与输入是否对应,再区分整条指令、部分内容和部分图片的丢失;多图融合只有在用户要求时才算正确执行。
指令拆解与图片内容不对应,发生错位。
所有图片的指令均缺失。
指令能够正确拆解,但部分指令内容不完整,有缺失。
部分图片的指令能够正确拆解,但部分图片的指令有缺失。
相关指令能够正确拆解,但存在部分多余指令。
指令存在错误解析,描述有误,与原 指令 意图不符。
多图同指令或多图多指令时,未按用户需求逐图拆解生成提示词,而是将完整原始需求直接作为输出提示词。
输出图将多张输入图进行了图片融合处理,未准确执行指令。