前期试标
集中整理容易混淆的意图、边界样本和高频错误,与算法团队每日对齐判定标准,持续更新标注规范和示例。

为 RAG 系统构建百万级精排训练数据,覆盖 12 类用户意图,帮助模型从召回结果中筛选出与用户问题和图片信息最相关的内容。
ANNOTATION FRAMEWORK
为 RAG 系统构建高质量的精排训练数据,帮助模型从召回结果中筛选出与用户问题和图片信息最相关的内容,覆盖 12 类用户意图,数据规模达百万级。
QUALITY WORKFLOW
集中整理容易混淆的意图、边界样本和高频错误,与算法团队每日对齐判定标准,持续更新标注规范和示例。
按数据规模和难度将任务拆分成多个批次,采用试标—校准—批量标注—抽检—问题回流的方式推进,避免错误口径在大批量数据中扩散。
对接并培训 3 家外部供应商,通过规则讲解、正反例演示和现场答疑帮助标注人员理解 12 类意图。
建立分阶段质量检查机制,对高风险意图和易混淆样本提高抽检比例,及时将规则争议反馈给算法团队确认。
针对抽检发现的问题整理 Bad Case,分析错误原因,组织复盘和二次培训,形成闭环优化。
PROJECT RESULTS
覆盖 12 类用户意图的精排训练数据
按期完成全量交付,达到项目要求
优化任务拆分、培训与质量控制流程
全程对接培训与质量管理