AI 配音在多音字和人名地名上容易"读错",掌握校正方法才能让成品经得起推敲。
中文多音字是 AI 语音合成最常见的"翻车点"。一个"行"字,在"银行"里读 xíng,在"行李"里也读 xíng,但在"一行字"里读 háng。TTS 模型靠上下文概率判断读音,大部分时候能猜对,但遇到低频搭配或歧义句就会出错。比如"重孙"的"重"应读 chóng,模型却常按 zhòng 处理;"参差"应读 cēn cī,模型可能读成 cān chā。
出错的高频场景有三类:
根据你使用的工具不同,校正手段从轻到重排列如下。
最简单的办法是避开多音字本身。把"银行"改成"银杭"不可取,但可以把"朝代"改成"历代"来规避"朝"的 zhāo/cháo 歧义。对有声书而言,适当改写不影响原意的句子,是最省事的做法。
多数 TTS 引擎支持 SSML 或自定义注音标签。你可以把容易读错的词用拼音显式标注:
<speak>他去<phoneme alphabet="pinyin" ph="yin2 hang2">银行</phoneme>办理业务。</speak>
如果引擎不支持 SSML,可以在文本里直接插入括号拼音,如"重庆(chóng qìng)",部分模型会拾取拼音提示。这种方法粗糙但有效。
有时读错不是字音问题,而是分词问题。"还需要朝南方走"中"朝"读 cháo,但模型可能把"朝南"当成"朝南(方向)"而读对,也可能把"朝"误判为 zhāo。通过在"朝"后面加逗号——"还需要朝,南方走"——虽然语句不自然,但在预处理阶段插入停顿标记能让模型重新分词。更实际的做法是在脚本里用标点控制节奏,让上下文更明确。
如果生成的音频整体满意,只有几个字读错,可以用音频编辑软件做"字级替换":把正确读音的片段剪过来覆盖错误片段。配音魔方的多角色配音功能支持按句重新生成,你可以单独对出错的句子重新合成,调整文本后再拼回去。
人名、地名、品牌名的读音没有规律可循,需要建立一套处理流程。
| 步骤 | 操作 | 说明 |
|---|---|---|
| 1 | 建立读音表 | 把脚本中所有专有名词列出,标注正确拼音 |
| 2 | 首次合成 | 用原始文本跑一遍 TTS |
| 3 | 逐词核对 | 对照读音表,标记读错的位置 |
| 4 | 注音重跑 | 对错误词加拼音标注后重新合成 |
| 5 | 人工抽查 | 专有名词集中段落反复听 |
对于反复出现的人名,建议在脚本预处理阶段统一替换为带拼音的写法。比如角色"纪晓岚"中"纪"作姓氏应读 jǐ,你可以在脚本里写成"纪(jǐ)晓岚",合成后再做文本清理。
做长篇内容时,维护一份"易错词读音表"能大幅减少后期返工。清单格式如下:
这份清单在系列内容中可以复用。有声书做续集时,直接套用上一次的读音表,省去重新校对的功夫。
多音字校正看起来琐碎,但它直接决定听众对内容专业度的感知。一篇文章读错三处人名,读者会怀疑你的内容质量;读对每一处,专业感自然建立。