从源头避免到后期清理,一套能落地的降噪工作流,把 AI 配音从"能用"推到"能发布"。
AI 配音的噪声和真人录音不太一样,主要分四类:
对症下药比盲目套降噪插件重要得多。先听一遍原始合成,判断噪声类型,再选工具,否则容易越降越脏。
最划算的降噪是"不用降"。源头治理有三件事必做:
选干净的参考音频。做音色克隆或自建音色库时,优先选底噪低于 -60 dB、没有明显混响、没有突发喷麦的录音。配音魔方的影视角色音色在入库前已经做过筛选,自建音色一定要自己做这一步。一段 5–10 秒的干净参考音,比 30 秒带噪参考音效果好得多。
控制生成参数。部分引擎允许调采样率、降噪强度、静音阈值。降噪强度拉太高会削掉气声和齿音,听感发闷;静音阈值设太低会让停顿段残留嗡声。建议默认值跑一遍,在 20–30 秒测试段上微调,而不是直接拉满。
分句生成再拼接。长文本一次性生成容易在中间出现韵律漂移或噪声累积。拆成单句生成、统一响度后再拼接,每段都是干净起点,问题集中度更低。
当合成已经带噪,后期就是必经环节。下面是按"先轻后重"排序的工具链,不要跳级用。
很多"噪声"其实是静音段没清干净。用 Audacity 或 ffmpeg 的 silenceremove 滤镜把低于 -50 dB 的片段压成纯静音,立刻能去掉一大部分嗡声。再对整段做 -16 LUFS(播客)或 -14 LUFS(短视频)响度归一,为后续处理打好底。
RNNoise、Audacity 的 Noise Reduction、Adobe Podcast 的 Enhance Speech 都属于这一类。核心思路是采样一段纯噪声"指纹",再用它从整段信号里减掉。关键操作:
如果降噪后听感发闷,用轻度的多段压缩(2:1 比率,阈值 -18 dB)让中频更聚焦,再用一点高频搁架提升(+1.5 dB @ 8 kHz)恢复空气感。这一步是补救措施,不要在没降噪之前做,否则会把噪声也放大。
配音魔方多角色编配出来的成品,角色间音量和音色差异天然存在。降噪之前先按角色分组,分别做响度归一和降噪,最后再混合,避免某个角色带噪把整体拉下去。
加背景音乐时,音乐轨单独做 -20 LUFS 左右的压限,人声轨比音乐轨高 6–9 dB,再用侧链压缩让人声盖过音乐峰值。这样既不需要把人声推到失真,也能保持音乐存在感。如果人声轨有残留噪声,音乐铺上去通常能盖住一部分,但不应该把"靠音乐盖噪"当成主要手段——噪声超过 -45 dB 的时候,音乐是盖不住的,必须先清理。
把降噪当成"最后兜底"是误区,最有效的降噪发生在选参考音和调生成参数那一步。源头干净了,后期轻松一半;源头脏了,再强的插件也救不回来。