MULTI-TURN SFT
多轮对话 SFT
数据质量与规范
梳理 12 类高频错误并统一标注规范,通过案例复盘在 1 周内将标注一致性从 60% 提升至 90%。
用户需求匹配上下文信息衔接内容一致性错误分类口径
范晨 · AI 训练师阿里巴巴集团任职期间 · 项目经理
12 类高频错误类型
60% → 90%标注一致性
1 周一致性提升周期
01 / CONTEXT
项目背景
多轮对话训练数据存在错误分类标准不统一、同类问题判断有分歧的情况,需要结合上下文进行质量判断,并建立统一的分类与复核标准。
CONSISTENT ANNOTATION
相同的问题,需要一致的判断口径。
针对错误分类标准不统一、同类问题判定存在分歧的情况,明确判定条件与分类口径,将争议样本讨论和规则说明结合起来。
02 / MY ROLE
我的职责
- 01
负责多轮对话训练数据的质量判定、错误类型标注和回复修订。
- 02
检查回答与用户需求的匹配、上下文信息衔接和内容一致性,定位问题并修改。
- 03
梳理 12 类高频错误,制定《标注规范》,组织典型错误案例复盘和争议样本讨论。
03 / PROCESS
从判断到交付
- 01
结合上下文判断
检查回答是否匹配用户需求、信息是否衔接、内容是否一致。
- 02
标注与修订
定位问题,标注错误类型,并完成对应回复修改。
- 03
建立分类规范
梳理 12 类高频错误,明确各类问题的判定条件与分类口径,制定《标注规范》。
- 04
案例复盘与规则对齐
组织典型错误案例复盘,将争议样本讨论与规则说明结合,提高团队执行一致性。
04 / DELIVERY
交付与成果
1 周内将标注一致性由 60% 提升至 90%,为多轮对话监督微调提供高质量训练数据。
- 质量判定及错误标注结果
- 修订后的对话回复
- 覆盖 12 类高频错误的《标注规范》
- 典型与争议样本复盘