发音准确性
PRONUNCIATION考察模型对字、词、句的发音是否标准,涵盖多音字、中英混杂与复杂数字等场景。

与国内三款常用 TTS 模型在多场景下进行横向评测,从发音准确性、语义清晰度与情感表达力三大维度评估语音生成效果。
EVALUATION FRAMEWORK
与国内三款常用 TTS 模型在多场景下进行横向评测,从三大维度评估语音生成效果,为准确定位模型短板并提供优化方向提供高置信度数据支持。
考察模型对字、词、句的发音是否标准,涵盖多音字、中英混杂与复杂数字等场景。
考察信息传递与语义理解的有效性,涵盖标点控制语义、长文本无标点断句与歧义断句。
考察模型是否能精准找到触发情感的核心关键词,覆盖新闻联播、睡前故事、电商带货等多场景。
SCORING METHODS
1 = 正确识别发音 / 0 = 错误发音
1 = 语义表达明确 / 0 = 发音正确但语义不符
2 = 非常满意 / 1 = 满意但偏平淡 / 0 = 无情感色彩
QUALITY WORKFLOW
基于三大维度撰写规则文档,每条规则对应一个案例;按多维度、不同难度梯度自构建评测集。
采用双盲标注,两组独立评测;产生分歧引入第三方复核;收集 Bad Case 作为答疑样本集拉齐颗粒度。
培养标注同学撰写基础结论以发现理解偏差;增加自抽检轮次;要求质检同学收集 Case 保证数据一致性。
结构化输出评测报告(评测信息、评分标准、评测结果、核心结论、具体案例),对比各模型表现并附加 Bad Case。