如何评估 AI 配音质量:主观听感与客观指标

播客、有声书、角色配音,标准各不同;搞清主观和客观两条评估路线,才不会只靠耳朵做决定。

为什么评估必须分两层

AI 配音的质量不是单一维度的"好听/不好听"。同一段语音,放在信息播报里合格,放在角色对白里可能不合格;一个音色读新闻清晰自然,换成带情感的台词就垮。质量评估实际上要同时看两层:主观听感对应"人听了舒服不舒服",客观指标对应"信号层面有没有问题"。前者贴近真实体验,后者可复现、可横向比较、可用于自动化测试。

主观评估:MOS 评分与它的变种

业界最通用的是 MOS(Mean Opinion Score) 五分制:1 分极差,5 分极好。给一批听众放同一组样本,取平均分,就是这段语音的 MOS。标准的 MOS 测试遵循 ITU-T P.800 流程:样本随机化、双盲、至少 15 名听音人、安静环境、统一播放设备。

针对 TTS 有几个更细的变种:

主观评估的坑主要在样本设计:测试集必须覆盖多种句式、长度、标点,还要混入真实人声作为锚点,否则分数会偏移。对小团队来说,如果做不了正式 MOS,至少应该固定 3-5 名同事做盲听对比,用同一套文本集,比纯靠感觉靠谱得多。

客观指标:信号层面的量化

客观指标不依赖听感,直接从波形和频谱算出来,适合放进 CI 做回归测试。

音质类

指标 含义 局限
PESQ 感知语音质量评估,1–4.5 分,模拟人耳对失真的敏感度 对高码率合成区分度下降
POLQA PESQ 的升级版,支持超宽带和全频带 商用授权昂贵
STOI / ESTOI 短时客观可懂度,衡量能否听清 对音色相似度不敏感
VISQOL 基于频谱时间相似度的质量评估 对音乐比对语音表现更好

相似度与韵律类

针对音色克隆,还要看合成音与目标音色的相似度。常见做法是提取说话人嵌入(如 ECAPA-TDNN、x-vector),算余弦相似度;更严格的是做 ABX 测试,让听音人判断两段样本是否来自同一人。韵律层面可以比对基频曲线(F0 contour)、能量包络、音素时长的 DTW 距离,判断合成的节奏感是否自然。

不同场景的评估侧重点

评估标准要随用途调整,不能一刀切。

给创作者的落地建议

  1. 固定一个内部评测集:选 20–30 句代表性文本(含疑问、感叹、长句、短句、带数字的句子),每次换音色或换模型都跑一遍,留档。
  2. 至少做一次 ABX:把真人录音混进候选样本里做盲听,如果 AI 合成被明显挑出来,说明还没到能上线的水准。
  3. 看指标但别迷信:PESQ 高不等于听感好,客观指标用来排雷,最终拍板要靠耳朵。
  4. 把"能用"门槛分清楚:配音魔方里 144+ 音色各有适用场景,有些音色适合旁白不适合角色,用对场景比追求单一最高分更重要。
  5. 建立 A/B 归档习惯:同一段台词用不同音色或不同参数生成,按时间归档,半年后回头看能明显听出平台进步,也方便定位回归。

评估体系不需要一开始就完美,但一定要建立。有数据,才能判断是模型不行还是文本不行;有留档,才能在下一次改版时不走回头路。