课程系列:AI 配音实战教程 · 等级 L1-B(入门到进阶) 教程编号:L1B-06 难度等级:进阶(建议先学 L1B-01,配合 L1B-03 / L1B-04 效果更佳) 适用人群:纯小白、自媒体创作者、有声书朗读者、播客主理人、想把内容"有声化"的内容运营 预计阅读:40–55 分钟 更新日期:2026 年 8 月 前置课程:L1B-01(必需);建议同时学 L1B-03(多角色剧本)、L1B-04(多角色配音)
读完这篇教程并跟着动手,你将能够:
这篇教程解决什么问题:L1B-01 教你"把一段文字变成声音",L1B-04 教你"分角色配一部剧"。但现实中你往往需要一口气做几十万字的有声书、或者两个声音来回对谈的播客,还要把它们修得像"正式产品"。本篇就是把前面学的东西组装成真正的、能发布的有声内容。
有声内容不是一个东西,而是三条差异很大的"生产线"。很多人上来就猛做,结果发现"讲书的"和"闲聊播客"完全是两码事。我们先分清三种形态,你的工作量和工具选择会完全不同。
| 形态 | 核心特征 | 典型时长 | 核心难点 | 对应本教程章节 |
|---|---|---|---|---|
| 有声书 | 一个人声朗读,长文本、强叙事 | 每章 15–60 分钟 | 文本长、音色一致性、节奏 | 第二章 |
| 播客(对谈) | 两个人(或多)来回说话,强对话感 | 每期 20–60 分钟 | 双音色、衔接、情绪、即时感 | 第三章 |
| 音频后期 | 声音之外的一切处理 | — | 噪声、响度、包装 | 第四章 |
一个直觉:有声书是"一个人安静地把故事讲完",播客是"两个人有来有回的聊天"。前者考验文本与时长,后者考验互动与情绪。把这两个搞混,是做不出好作品最常见的错误。
把每一步都画出来,你才知道钱和时间花在哪。
【有声书】长文本生产链路
文稿整理 → 分章拆分 → 章节内分段(按段落/标点)
→ 逐段 TTS 生成(固定同一音色)
→ 每章检查音色与停顿
→ 全章拼接 → 后期(降噪/响度/加片头)
→ 导出发布
【播客】对谈生产链路
选题与提纲 → 写"分角色对白稿"(主持/嘉宾)
→ 双音色分配 → 逐句生成
→ 拼接成对话流 → 处理衔接停顿与情绪
→ 后期(降噪/响度/背景音乐)
→ 导出发布
【后期】贯穿前两者的收尾链路
拿到素声 → ① 降噪去底噪 → ② 响度统一
→ ③ 剪辑修停顿 → ④ 加片头片尾 → ⑤ 整体导出
关键认知:后期不是"可选的加分项",而是"必选项"。再好的 TTS 素声,直接扔出去都会显得"裸";加上降噪、响度统一和片头片尾,才是听众认可的作品。后期投入的时间一般占总制作的 20%–35%,新手可以更多。
如果你是第一次做,建议不要一上来就挑战 30 万字的长篇小说。推荐这样热身:
为什么先播客?因为对话稿短、反馈快、双音色带来的"新鲜感"最容易建立信心。有声书的难点在于"长",前期容易在重复劳动中失去耐心。
有声书的本质是:把一本书或一篇文章,用同一个、稳定的人声,一段一段地读完。它的工作量不在"生成一次",而在"生成几十次还不走样"。
一个最常见的坑是:有人把整章两万字一次性丢给 TTS。结果要么超出工具单次字数上限被截断,要么生成的音频又长又乱、出错只能整段重来。分块不是图省事,而是可控性:
第一步:先分"章",再分"段"。 以一本书为例:
一级单位:整本书
└── 二级单位:章(以书的章节标题为界)
└── 三级单位:段(以自然段落为界,每段 100–300 字)
└── 四级单位(生成单元):段内部的 1–3 个长句(100–400 字 / 次生成)
建议的生成单元大小:单次生成控制在 100–400 字。太短(如 50 字)会增加生成次数和拼接缝;太长(如 800 字以上)容易超出限制、也难修改。中文大约 每 100 字 ≈ 25–35 秒 的音频,你可以据此估算每段时长。
分块真相:分块生成的听感损失很小,因为 TTS 会自己处理句间停顿;真正的问题出现在"跨字段落"时——上一段结尾和下一段开头如果衔接生硬,就得多做后期。所以宁可多分几块,也不要贪大。
这里给一个"不写代码"也能做的笨办法,以及一个"会复制粘贴"的脚本办法。
笨办法(手工,适合几千字):
脚本办法(适合几万字,提到 L1B-07 会有更系统的做法):
这里给一个能直接跑的 Python 脚本思路(你可以先手动把文本存成 book.txt,再让脚本按段落切分并编号):
# split_into_chunks.py —— 把长文本切成"段"级别的生成单元(请先手动分好章)
with open('book.txt', 'r', encoding='utf-8') as f:
text = f.read()
# 按空行切分出自然段落
paragraphs = [p.strip() for p in text.split('\n\n') if p.strip()]
# 太长的一次生成不行,再按句号切成更小的单元
import re
units = []
for para in paragraphs:
# 按句末标点切成句子
sents = re.split(r'(?<=[。!?])', para)
sents = [s for s in sents if s.strip()]
# 每 1–3 句凑成一个单元(约 100–400 字)
cur = ''
for s in sents:
if len(cur) + len(s) > 400 and cur:
units.append(cur.strip())
cur = ''
cur += s
if cur.strip():
units.append(cur.strip())
with open('units.txt', 'w', encoding='utf-8') as f:
for i, u in enumerate(units, 1):
f.write(f'=== 段{i} ===\n{u}\n\n')
print(f'共切出 {len(units)} 个生成单元')
跑完之后你会在 units.txt 里看到一段一段带编号的文本,把它们逐条复制进 TTS 工具生成即可。不要纠结脚本写得好不好,能用就行。
分块解决了"能生成",断句与节奏解决"好不好听"。这是有声书和"AI 念课文"的分水岭。
TTS 会根据标点自动停顿,但中文标点使用混乱时,AI 就会"乱停"。三件事:
。最长停顿,,中等停顿,、几乎没有停顿,……?`表达语句与情绪。检查你的文稿标点是否规范。节奏自检法:生成后按"每 3–5 个句子停顿一次"的规律去听。如果你觉得"一口气听完很累",说明停顿太少;如果"老觉得卡",说明停顿太多。目标是"舒服的呼吸感",像真人给朋友读故事。
这是有声书生产里最重要的部分,也是"为什么不直接一把梭"的核心原因。长篇里,如果第 3 章音色和第 1 章明显不一样,整本书就"破功"了。下面是 5 个让音色"稳住"的要点。
绝不要每次生成时"随便挑个音色"。凡是支持音色 ID / Voice ID 的工具,把选定的音色保存下来,每段生成都复用同一个 ID。
最常见的翻车:中途手滑换了音色,或克隆音色时换了参考样本。长期项目建议把音色信息记在一张"音色速查表"里(见下)。
如果你用的是声音克隆,参考音频从头到尾只用同一个文件,别一会用 A 样本、一会用 B 样本。样本时长、录音环境、语气不同,克隆出的"声音性格"就不一样。
把语速、音调、情感倾向、停顿设置等参数写下来,而不是记忆。这样即使隔一周再续更,你用的还是同一套参数。
音色速查表模板(建议每部作品一份):
| 参数项 | 我的设置 | 备注 |
|---|---|---|
| 音色 ID / 名称 | 主讲-男-温润 | 全按此书 |
| 参考音频 | voices/host.wav | 固定这一份 |
| 语速 | 0.95 | 偏舒缓 |
| 音调 | 0(默认) | 不变调 |
| 情感模式 | 叙述型 | 平稳为主 |
| 单次字数 | ≤400 字 | 分块标准 |
集中一段时间把一章/一批的所有段落连续生成完,减少中途切换工具、切换账号、切换音色的机会。生成完先别急着拼接,先做"音色抽查"(见要点 5)。
每一章生成完成后,挑开头 10–15 秒 和结尾 10–15 秒 连续听一遍,和上一章的对应位置对比。如果感觉"不是同一个人",立刻回查本段用的是不是同一音色/参数。
一致性终极心法:把"音色一致性"当成一项每次都要做的检查,而不是一项"设定一次就完事"的配置。长篇有声书做到第 10 章、第 20 章,一致性检查就是你的生命线。
播客的难点不是"一个声音读得长",而是"两个(或多个)声音要像真人一样有来有回、有情绪、有衔接"。它其实最接近 L1B-04 里的多角色配音,只不过"角色"通常只有主持人和嘉宾,而且更强调"对谈感"。
AI 对谈最大的坑是各说各的、像访谈朗读,而不是聊天。一个好的对谈稿,要有一个"你来我往"的结构。
① 开场打招呼(建立关系,短)
↓
② 引入主题(主持人抛出本期聊什么)
↓
③ 主体:3 个左右的话题块(你来我往)
每个话题块 = 主持人提问 → 嘉宾展开 → 主持人回应/补充 → (可加)嘉宾追问
↓
④ 情绪高点/金句(让听众记住的一句话)
↓
⑤ 收尾(总结、预告下一期)
↓
⑥ 结束(互道再见、呼吁关注)
主体部分是最容易写得像"两条平行线"的地方。记住一个口诀:"问 → 答 → 应 → (追问)"。
对谈稿示例(片段,可据此扩展):
【主持】:欢迎来到《三位聊AI》,我是主持人阿远。今天请到的嘉宾是做了三年有声书的出品人小林。小林,先给大家打个招呼吧?
【嘉宾】:大家好,我是小林,做了三年有声书,主要做悬疑类。
【主持】:做悬疑题材最难的地方是什么?我听说恐怖氛围特别难用声音营造?
【嘉宾】:对,最难的是"节奏"。悬疑的东西不能一直快,也不能一直慢,氛围全靠停顿和留白。
【主持】:停顿和留白?能举个例子吗,听众可能不太理解。
【嘉宾】:比如主角推开门之前,那半秒钟的沉默,比任何音效都吓人。我原来也是拿 BGM 堆,后来才发现最吓人的其实是安静。
【主持】:这句话说得真好——"最吓人的其实是安静",这句我记下了。
注意上面:主持的每次发言都不是干巴的"提问",嘉宾的每次回答都有细节,而且有 "氛围全靠停顿""最吓人的是安静"这样的金句,适合剪出来做短视频切片。
双人播客的核心是两个音色要"分得开、对得上",不能两个听起来像同一个人。
| 分工 | 建议音色特征 | 为什么 |
|---|---|---|
| 主持人 | 中正、稳定、节奏感强、亲和 | 承担控场和引导,要"压得住" |
| 嘉宾 | 内容各有特色,可与主持形成反差 | 差异化才显得"在对话",不是一人分饰 |
| (可选)第三位/多人 | 再找一个明显不同的音色 | 区分度越高越清晰 |
双音色分配检查表:
主流"多角色"工具通常有两种做法,你选一种:
【主持】、【嘉宾】 这样的标签区分角色,工具自动把 A 标签对音色 A、B 标签对音色 B。适合整期几十句的情况,效率高。通用建议:写对白稿时,从一开始就用
【主持】/【嘉宾】这样的标头。这样无论你后来用逐段法还是标签法,都能直接复用稿子。这也是为什么上面示例稿都写了标头——它天然兼容两种做法。
双人对谈要"像真人",功夫一半在衔接,一半在情绪。
分段生成的对白,拼接后最常见的毛病是每句都各自停顿,像照本宣科。三个技巧:
衔接的黄金法":宁紧勿松。 两句话之间 0.3 秒一般比 1 秒更接近真人聊天。你可以先做成 0.5 秒,再逐点微调到舒服。
TTS 默认是"平静朗读",这对对谈是灾难。情绪处理分两个层面:
把"干读"变"聊"的文本对比:
【干读版】:
主持:你觉得这个想法怎么样?
嘉宾:我觉得很好,但也有很多挑战。
【有情绪版】:
主持:这个想法……你觉得靠谱吗?(迟疑、探询)
嘉宾:说实话,我觉得方向没问题!(兴奋)但真要落地,挑战可不少——第一个就是成本。
你看,加了括号里的状态提示、口语词和感叹号,AI 读出来的语气就"活"了。写对白稿的时候,就想着"这句话说出去是什么表情"。
音频后期帮你把"素声"变成"作品"。本篇用 Audacity(免费开源)和剪映(免费易用,手机/电脑都有) 来讲解通用步骤——这些步骤换到任何工具(包括 Adobe Audition、Reaper 等)都成立。
后期开始前,先明确"输入":
注意事项:后期处理的是已生成好的音频文件,不是回到 TTS 里改文字。所以先确认 TTS 生成结果满意,再进后期。后期修的是"声音干净度、响度、包装",不负责帮你改错字(那要回 TTS 重新生成)。
剪映里的做法:选中音频轨道 → 打开「音频」面板 → 找到「降噪」开关,打开即可。剪映的降噪是"一键式"的,直接勾上听效果,不行就关掉。
降噪铁律:够用就好,别把声音削"死"。 降噪过度会让人声发闷、失去细节。宁可留一点点底噪,也不要听出明显"塑料感"。
不同段落、不同音色、甚至同一音色的不同句,响度都可能不一致。听众最烦的就是"上一句很小,突然炸一下耳朵"。响度统一的目的,就是让整条音频从头到尾响度平稳。
剪映里的做法:选中音频 →「音量」手动调整各段;剪映也提供「自动统一音量」之类的功能(不同版本位置不同,一般在音频面板或声音优化里),可以先用自动挡,再手动微调。
响度统一金句:目标是"整条音频响度稳、峰值不爆"。做完后从头到尾完整听一遍,重点听"会不会突然刺耳"。
片头片尾是作品的"包装",让你的音频有品牌感,也让听众知道"这是谁、什么节目"。
片头片尾的"音乐":不建议用未授权的商业音乐,尽量用剪辑软件自带的无版权背景音乐(剪映/Audacity 素材库里有大量免费 BGM),或你自己用 TTS/合成器生成。字幕里标注来源更稳妥。
片头片尾的自查":片头要"抓人",片尾要"留人"。 片头 3 秒内要让听众知道"这是什么内容";片尾别拖太长,别在听众想关掉时还在絮叨。
任何一期作品发布前,照着这个清单过一遍:
下面把前三章串起来:跟着这个例子,你可以把一段几千字的文稿完整做成一条带片头片尾、响度统一、双音色对谈的播客样片。这是一个可复制的模板。
示例设定:我们要把一篇科普文章"AI 如何改变有声行业",做成一条 3 分钟的双人对谈播客样片。
把科普文章拆成问答,套用第三章的"骨架 + 问→答→应→追问",写成标好 【主持】/【嘉宾】 的对白稿(300–500 字即可,别贪长)。用第二节的"音色速查表"记下:主持人用音色 A(女、明亮)、嘉宾用音色 B(男、沉稳)。
把导出的句子按顺序排进 Audacity 或剪映的时间线:主持、嘉宾、主持、嘉宾…… 顺序对了。这一步先把"逻辑顺序"拼起来,先不处理细节。
科普文章
→ 改写对谈稿(带【主持】【嘉宾】标头)
→ 双音色分段生成(音色 A / B)
→ 按序拼接
→ 衔接与停顿微调
→ 降噪
→ 响度统一(-14 LUFS)
→ 加背景音乐(可选)
→ 加片头片尾(淡入淡出)
→ 导出质检
→ 发布 ✅
复用提示:把上面这条管线做成你自己的"标准作业流程",以后每期节目照模板走。做熟之后,单条 3 分钟样片从文稿到成片可以在 30–60 分钟内完成——难点只在第一次建立模板。
尽量不要。单次生成受字数/时长上限约束,且出错无法定位,长文本请一律分章分块(见第二章)。分块带来的听感损失很小。
八成是中途换了音色或换了参考音频。对照第二章要点 3 的音色速查表,确认所有段用同一音色 ID 和同一份参考;生成完做"开头/结尾抽查"(要点 5)。如果确实是参考音频不同导致的,重新用同一份参考把出问题的段重生成。
选差异大的两个音色(音调/性别/气质拉开),克隆音色就把两份不同的参考样本分开,固定各用各的。参看第三章 3.2 的双音色分配检查表。
问题多半在稿子和衔接,不在工具。稿子上用"问→答→应→追问"结构、加情绪语;衔接上把"接话"空隙收紧到 0.3 秒左右、剪掉句末拖音。参看第三章 3.1 和 3.3。
不会,反而会让人声发闷、出现塑料感。降噪"够用就好",宁可留一点底噪也不要削得太死(第四章 4.2 铁律)。
现代主流平台普遍推荐整体响度在 -14 LUFS ~ -16 LUFS,短视频平台多在 -14 上下,播客同理。核心是"稳"和"不爆峰值",不必死磕精确数值(第四章 4.3)。
有版权风险。优先用剪辑软件自带的无版权 BGM,或自己合成/AI 生成,并在需要时标注来源。参看第四章 4.4。
能。第二章给了"笨办法"(手工按段拆分)也能做几千字;几十万字才需要脚本,那套脚本思路"复制粘贴改一下路径"就能用,而且 L1B-07 会教你更系统的批量做法。先用手工把流程跑通再说。
建议先做短的双人对谈(2–3 分钟),再做有声书短章(5–8 分钟),最后挑战长篇。理由见第一章 1.3。
看你所在平台的规则与当地法规要求。稳妥做法是:在作品简介或发布说明里标注"本音频由 AI 配音"。涉及真实人物声音克隆时,务必取得授权(可回看 L1B-01/L1B-04 的合规部分)。这是诚信与合规底线,不要省略。
到这里,你已经把"从文字到声音"升级成了"从文字到作品":
你现在拥有的,不再是一条条孤立的音频,而是一条能持续产出作品的流水线。
给有声内容配上"到底用哪个音色、怎么分配"这类问题,建议同时参考本系列的《AI 配音工具使用规范》一节,那里有更细的工具选择与合规边界。
恭喜你,已经掌握了"内容生产"这一层。但到这里,手动一条条点生成、一条条拼接的瓶颈就出现了——当你想一次做十期、或把一套流水线交给机器跑,就得进入工程化阶段。
下一课 L1B-07 语音进阶与工程化:从手动点到批量流水线,将教你:
把这一课的"手工管线"交给机器,就是下一课要解决的工程问题。带上你已经跑通的"从文稿到成片"流程,我们下一篇见。