一条跨越三百年的技术线索,理清 AI 配音今天为什么能做到"以假乱真"。
语音合成的起点远比计算机早。18 世纪,匈牙利工程师沃尔夫冈·冯·肯佩伦制造了"说话机器",用风箱驱动气流,通过控制哨孔和共振腔的形状发出元音和辅音。这套装置的思路惊人地现代——它已经抓住语音产生的核心:气流激励 + 声道滤波。
此后一百多年里,机械合成逐步精细化,但始终无法解决一个问题:机械结构难以快速切换共振形态,合成的语音速度慢、音色生硬。真正的转折要等到电子时代。
20 世纪 50 年代,贝尔实验室的 Homer Dudley 等人提出共振峰合成。核心想法是把人声拆成几个带通滤波器,每个对应一个共振峰频率(F1、F2、F3……),再用一个激励源模拟声带振动。通过手动或半自动地调参,可以"拼"出还算像人的语音。
这个阶段的代表系统是 MIT 的 DECtalk,它在 80 年代被广泛用于无障碍辅助设备,科幻作家斯蒂芬·霍金使用的就是它的改进版。共振峰合成的瓶颈在于:参数空间太大,人工调参无法覆盖自然语言中微妙的协同发音和情感变化,听感"机械感"明显。
到 90 年代,思路从"造规则"转向"用数据",出现两条主流路线。
拼接合成(Concatenative Synthesis) 的做法是录制大量真人语音,切成音素或半音节碎片,合成时按文本从语料库里挑最合适的片段拼起来。代表系统包括 AT&T Natural Voices 和早期的科大讯飞引擎。拼接合成音质高,但有两个硬伤:语料库只覆盖固定语调和语速,灵活性差;拼接边界容易出现不自然跳变。
HMM 参数合成 则用隐马尔可夫模型对语音参数(频谱、基频、时长)建模,再通过一个声码器从参数恢复波形。代表系统是 HTS(HTS-2007)。它的优势是灵活:可以改语速、调语调、做情感迁移;代价是音质比拼接合成闷一些,听感略"糊"。
2016 年 DeepMind 发表 WaveNet,是整条线索里最大的拐点。WaveNet 用因果膨胀卷积直接逐采样点预测波形,第一次让神经网络合成的语音在自然度上超过拼接合成。但 WaveNet 太慢——生成一秒音频要几分钟,无法商用。
接下来的两三年,研究重心变成"如何让神经声码器又快又好"。几个关键节点:
| 系统 | 年份 | 关键改进 |
|---|---|---|
| WaveNet | 2016 | 逐样本自回归,质量天花板 |
| Parallel WaveNet | 2017 | 从概率蒸馏出发,实现并行生成,速度提升约 1000 倍 |
| WaveGlow / FloWaveNet | 2018 | 基于流模型的非自回归生成,推理更快 |
| WaveNet vocoder + Tacotron2 | 2018 | 声学模型与声码器解耦的端到端范式 |
| HiFi-GAN | 2020 | 生成对抗网络,推理快且音质接近 WaveNet,成为当前主流 |
| VITS | 2021 | 把声学模型和声码器联合训练,真正的端到端 |
| IndexTTS / CosyVoice 类系统 | 2024+ | 支持零样本音色克隆与细粒度情感控制 |
理解今天的 TTS,关键是看懂"两段式"分工。第一段是声学模型(Tacotron、FastSpeech、VITS encoder 等),输入文本或音素序列,输出中间表示(通常是 mel 频谱);第二段是声码器(HiFi-GAN、WaveNet 等),把中间表示还原成波形。FastSpeech 系列把自回归换成非自回归 transformer,解决了 Tacotron 训练对齐不稳定、推理慢的问题,是工程上的关键一步。
最近两年,大模型路线把这两段合并为单一神经网络(如 VITS、NaturalSpeech、CosyVoice),并引入扩散模型或流匹配做更细的韵律控制。与此同时,零样本音色克隆只需要几秒参考音频,就能让模型在新音色上合成——这正是配音魔方这类平台能在生产环境里给创作者提供上百种影视角色音色的技术前提。
技术演进到今天,创作者能拿到的工具已经远超十年前的录音棚:单段配音不用约棚,多角色对话能一键编配,自定义音色库让系列内容保持声线一致。但越强的能力越要会用——理解声学模型决定"说什么",声码器决定"听感好不好",有助于在选音色、调标点、处理停顿时做出更好的判断。后续文章会展开这些具体技巧。