人声描述
VOICE DESCRIPTION固有属性
人物首次出现时说明,后续无需重复。
年龄与性别人物身份/职业人物关系语言与口音场景/节目类型
可变属性
依据当前语句的实际听感补充。
声线特质语气情绪音量语速与节奏音质与副语言

从声音内容、音色质感、情绪表现与节奏变化出发,将听觉体验转化为准确、清晰、可复核的结构化描述。
ANNOTATION GUIDE
将音频拆分为人声、配乐与音效三类信息,先识别可听事实,再按属性、变化和时序组织描述,确保 Caption 能准确还原声音内容。
角色 / 人物+固有属性+可变属性+“说话内容”
核心原则:仅阅读 Caption,也能在脑海中还原对应的人声与表达状态。人物首次出现时说明,后续无需重复。
依据当前语句的实际听感补充。
出现明确、有调的主旋律且持续时间不少于 3 秒时,按以下维度描述。
可识别的台词全部使用双引号包裹,避免错别字。
明显停顿处使用逗号等标点,疑问、感叹与句尾语气保持一致。
口误、转折或未说完的内容使用省略号等对应符号标注。
切分优先保证语义完整;时间误差约 ±1–2 秒、少量字词偏差需复核确认。