播客、有声书、角色配音,标准各不同;搞清主观和客观两条评估路线,才不会只靠耳朵做决定。
AI 配音的质量不是单一维度的"好听/不好听"。同一段语音,放在信息播报里合格,放在角色对白里可能不合格;一个音色读新闻清晰自然,换成带情感的台词就垮。质量评估实际上要同时看两层:主观听感对应"人听了舒服不舒服",客观指标对应"信号层面有没有问题"。前者贴近真实体验,后者可复现、可横向比较、可用于自动化测试。
业界最通用的是 MOS(Mean Opinion Score) 五分制:1 分极差,5 分极好。给一批听众放同一组样本,取平均分,就是这段语音的 MOS。标准的 MOS 测试遵循 ITU-T P.800 流程:样本随机化、双盲、至少 15 名听音人、安静环境、统一播放设备。
针对 TTS 有几个更细的变种:
主观评估的坑主要在样本设计:测试集必须覆盖多种句式、长度、标点,还要混入真实人声作为锚点,否则分数会偏移。对小团队来说,如果做不了正式 MOS,至少应该固定 3-5 名同事做盲听对比,用同一套文本集,比纯靠感觉靠谱得多。
客观指标不依赖听感,直接从波形和频谱算出来,适合放进 CI 做回归测试。
| 指标 | 含义 | 局限 |
|---|---|---|
| PESQ | 感知语音质量评估,1–4.5 分,模拟人耳对失真的敏感度 | 对高码率合成区分度下降 |
| POLQA | PESQ 的升级版,支持超宽带和全频带 | 商用授权昂贵 |
| STOI / ESTOI | 短时客观可懂度,衡量能否听清 | 对音色相似度不敏感 |
| VISQOL | 基于频谱时间相似度的质量评估 | 对音乐比对语音表现更好 |
针对音色克隆,还要看合成音与目标音色的相似度。常见做法是提取说话人嵌入(如 ECAPA-TDNN、x-vector),算余弦相似度;更严格的是做 ABX 测试,让听音人判断两段样本是否来自同一人。韵律层面可以比对基频曲线(F0 contour)、能量包络、音素时长的 DTW 距离,判断合成的节奏感是否自然。
评估标准要随用途调整,不能一刀切。
评估体系不需要一开始就完美,但一定要建立。有数据,才能判断是模型不行还是文本不行;有留档,才能在下一次改版时不走回头路。