适用人群:零基础小白、自媒体创作者、有声内容从业者、对 AI 语音感兴趣的所有人 难度等级:⭐(入门级,无需任何技术背景) 预计阅读时长:25–35 分钟 内容时效:截至 2026 年 8 月,以市面主流工具与公开技术为准 教程系列:AI 创作教程 · L1(基础篇)
读完这篇教程后,你将能够:
| 项目 | 说明 | 是否必须 |
|---|---|---|
| 一台电脑或手机 | Windows / macOS / Android / iOS 均可 | ✅ 必须 |
| 网络 | 能正常访问互联网即可 | ✅ 必须 |
| 一段文字 | 100–500 字的中文文本,用于练习 | ✅ 必须 |
| TTS 工具账号 | 推荐先用免费版,见下方推荐 | ✅ 必须 |
| 耳机或音箱 | 用于试听生成效果 | 🟡 建议有 |
以下是截至 2026 年 8 月,在中文创作场景中使用者较多的几款工具。本教程不绑定任何特定工具,你掌握的原理和流程在所有工具间通用。
| 工具 | 特色 | 是否支持中文 | 是否支持声音克隆 | 适合场景 |
|---|---|---|---|---|
| ElevenLabs | 情感表现力强,多语言覆盖 | ✅ | ✅(15 秒样本) | 有声书、播客、角色配音 |
| 微软 Azure TTS | 预置音色丰富,SSML 控制精细 | ✅ | ✅(企业版) | 口播、客服、应用内嵌 |
| 阿里云 CosyVoice | 开源可自建,中文效果优秀 | ✅ | ✅ | 技术用户自建、批量生产 |
| Google Cloud TTS | 多语言稳定,集成方便 | ✅ | ❌(仅预置) | 国际化内容 |
| 字节火山引擎 TTS | 中文音色多,语速自然 | ✅ | ✅ | 短视频配音、国内项目 |
| OpenAI TTS | 接入简单,音质干净 | ✅ | ❌(仅预置) | 快速生成、API 调用 |
选工具的建议:如果你是纯小白,先选一个有网页界面、免费额度够练手的工具(如 ElevenLabs 免费版或微软 Edge 浏览器自带的"大声朗读"功能)。先用起来,再对比。工具会迭代,但原理不变。
TTS(Text-To-Speech,语音合成),就是让计算机把文字读出声来的技术。你给它一段文字,它还你一段音频。
想象你请了一位配音演员来朗读稿子。整个过程分三步:
TTS 系统做的也是这三步,只是把"演员"换成了 AI 模型:
输入文本
│
▼
┌──────────────┐
│ ① 文本前端 │ ← 分句、分词、多音字消歧、标点解析
│ (Text Frontend)│
└──────┬───────┘
│
▼
┌──────────────┐
│ ② 韵律预测 │ ← 每个音节的音高、时长、重音、停顿
│ (Prosody) │
└──────┬───────┘
│
▼
┌──────────────┐
│ ③ 声学合成 │ ← 把韵律信息转成声音波形
│ (Vocoder) │ 输出:可播放的音频文件
└──────────────┘
你不需要记住这些术语,但理解这个"三步走"的逻辑很重要,因为后面所有的参数调整,本质上都是在影响这三个环节。
这是本教程最重要的概念之一。市面所有 TTS 工具都逃不出这两种模式(或两者的组合)。
什么是预置音色:工具方提前录好了几十到几百个专业配音员的声音,训练成模型,你直接选一个用就行。就像手机自带的铃声——你不用自己录,选一个喜欢的就行。
代表工具:微软 Azure TTS(上百种预置音色)、Google Cloud TTS、OpenAI TTS、字节火山引擎。
优点:
缺点:
适合场景:口播短视频、新闻播报、导航提示、应用内语音、有声书(通用型)、客服系统。
什么是声音克隆:你给 AI 一段某人的录音(可能只有 15 秒到几分钟),AI 就能学会这个人的音色、说话习惯,然后用这个声音来读任意文字。就像给配音演员听了 15 秒某人的声音,然后说"你模仿他的声音来读这段稿子"。
代表工具:ElevenLabs、阿里云 CosyVoice、微软 Azure Custom Voice(企业版)、字节火山引擎声音复刻。
优点:
缺点:
适合场景:多角色配音剧、有声书(个性化主播)、播客、品牌专属声音、无障碍辅助(为失声者恢复声音)。
| 维度 | 预置音色 | 声音克隆 |
|---|---|---|
| 上手难度 | ⭐ 极简 | ⭐⭐ 需准备音频样本 |
| 个性化 | 低(选菜单) | 高(自定义声音) |
| 音质稳定性 | 高 | 中(取决于样本质量) |
| 成本 | 多有免费额度 | 常需付费 |
| 合规风险 | 几乎无 | 需注意授权 |
| 适合内容类型 | 标准化、大批量 | 个性化、角色化 |
学会用这四个维度去评价任何 TTS 工具的输出,你就不再是"听着感觉还行"的小白了。
是什么:合成的声音听起来有多像真人说的。机器味重不重?
怎么判断:闭上眼睛听——如果你脑子里蹦出"这是机器人读的",那自然度就不够。好的 TTS 应该让你忘记它是 AI。
关键细节:
2026 年现状:主流工具的自然度已经很高,日常内容几乎听不出机器味。但在长文本、复杂句式、专业术语密集的场景,差距仍然存在。
是什么:声音能不能传达喜怒哀乐,而不是全程一个语气干巴巴地读。
怎么判断:找一段有明确情绪的文字(如"太好了!我们赢了!"和"他走了,再也没有回来"),听 TTS 能不能把激动和悲伤的区别读出来。
关键细节:
2026 年现状:ElevenLabs 在情感表现力上口碑领先,能根据文本上下文自动判断情绪。微软 Azure 通过 SSML 标签可手动指定情感风格(如 cheerful、sad、angry)。开源方案如 CosyVoice 也在快速追赶。
是什么:同一个声音在长文本中从头到尾是否保持一致,不会"读着读着变了一个人"。
怎么判断:生成一段 5 分钟以上的长音频,开头和结尾对比听——音色、语速、语气是否统一。
关键细节:
2026 年现状:这是目前 TTS 领域的难点之一。预置音色一致性较好;声音克隆在短文本上一致性不错,长文本(超过 2000 字)可能出现漂移。解决方案是分段生成时使用固定随机种子(seed)或参考音频锚定。
是什么:音频的"分辨率"。采样率越高,声音细节越丰富,音质越清晰。
怎么理解:就像图片的像素——720p 和 4K 都是同一张图,但 4K 细节更多。音频也一样,采样率越高,高频细节(如唇齿音、气息声)保留得越完整。
常见采样率对照:
| 采样率 | 音质水平 | 文件大小 | 适用场景 |
|---|---|---|---|
| 8 kHz | 电话级 | 最小 | 电话客服、对讲机 |
| 16 kHz | 广播级(入门) | 小 | 语音助手、草稿试听 |
| 22.05 kHz | FM 广播级 | 中 | 播客(入门) |
| 24 kHz | 标准 TTS 输出 | 中 | 短视频、有声书 |
| 44.1 kHz | CD 音质 | 大 | 音乐、精品有声书 |
| 48 kHz | 录音棚级 | 最大 | 专业影视配音 |
实操建议:大多数 TTS 工具默认输出 24 kHz,对自媒体创作完全够用。如果你做精品有声内容,选 44.1 kHz 或 48 kHz,但注意文件会大很多。别迷信高采样率——如果模型本身输出就是 24 kHz,工具给你"升频"到 48 kHz 也不会提升真实音质,只是文件变大了。
自然度听机器味,
情感力看喜怒悲,
一致性怕长文漂,
采样率定清晰度。
下面以一个通用的 TTS 工具操作流程为准,适用于绝大多数平台。每个工具的界面不同,但核心步骤一致。
这是最容易被忽视但最影响最终效果的一步。垃圾进,垃圾出——文本写得乱,声音再好也救不回来。
原始文本(不好):
AI(Artificial Intelligence)是2026年最🔥的技术!它能让计算机"说话"。
处理后(好):
人工智能,英文缩写 A I,是 2026 年最火的技术。它能让计算机说话。
小白提示:如果你不确定某个标点或符号会不会被读错,最简单的方法就是——先生成一次听听,读错了就改文本再试。TTS 的试错成本很低。
合规提醒:克隆他人声音前,务必获得本人授权。2026 年中国《人工智能生成合成内容标识办法》及相关法规已明确,未经授权克隆他人声音属于违法行为。克隆自己的声音没有问题。
大多数工具会提供以下参数(不同工具名称可能不同,但功能一致):
| 参数 | 作用 | 推荐值(入门) | 调高效果 | 调低效果 |
|---|---|---|---|---|
| 语速(Speed) | 控制朗读速度 | 1.0×(默认) | 更快,信息密度高 | 更慢,更舒缓 |
| 音调(Pitch) | 控制声音高低 | 0(默认) | 更高亢/尖锐 | 更低沉/厚重 |
| 音量(Volume) | 控制响度 | 0 dB(默认) | 更响亮 | 更轻柔 |
| 情感(Emotion) | 指定情绪风格 | neutral(中性) | 更激动/活泼 | 更平静/低沉 |
| 停顿时长(Pause) | 控制标点处停顿长短 | 1.0×(默认) | 停顿更长,更有节奏感 | 停顿更短,更紧凑 |
| 稳定性(Stability) | 控制音色一致性 | 50%(中) | 更稳定但可能平淡 | 更有变化但可能不稳 |
小白建议:第一次用,全部保持默认值,先跑通流程。等你能听出区别了再慢慢调。
命名建议:养成好习惯,文件名包含"日期_内容_音色_序号",如
20260807_口播第3期_播音员A_01.wav,方便管理。
如果你对效果还满意,这步可以跳过。如果要更专业:
小白跳过指南:如果你是做短视频口播,大多数情况下 TTS 直出音频就能用,不需要后期处理。后期处理是锦上添花,不是必须。
下面通过三个场景案例,把前面的知识串起来用。
场景描述:你要做一条 60 秒的短视频,讲"为什么天空是蓝色的",需要给视频配音。
文本准备(已处理,约 180 字,读完约 50–60 秒):
你有没有想过,天空为什么是蓝色的?
其实,这和阳光有关。太阳光看起来是白色的,但它其实包含了彩虹的七种颜色。
当阳光穿过大气层时,空气中的气体分子会把蓝色的光散射到四面八方。
我们的眼睛抬起头来,看到的就是这些被散射的蓝色光。
所以,天空是蓝色的,不是因为大海是蓝色的,而是因为空气把蓝光"撒"满了天空。
下次抬头看天,你就知道这个秘密了。
操作步骤:
预期结果:一段 50–60 秒、语气自然、节奏明快的配音,可直接用于短视频。
避坑点:
场景描述:你要把一本小说的第一章做成有声书,文本约 3000 字,预计朗读 15–20 分钟。
文本准备要点:
操作步骤:
预期结果:一段 15–20 分钟、音色统一、节奏舒缓的有声书音频。
避坑点:
场景描述:你要做一段 3 分钟的双人对白配音,有两个角色——旁白、男主、女主,需要三种不同的声音。
文本结构示例:
【旁白】夜深了,城市的灯火一盏盏熄灭。在一栋老旧的公寓楼里,有一扇窗还亮着。
【男主】你还没睡?
【女主】睡不着。在想一些事情。
【男主】什么事,能跟我说吗?
【女主】我在想,如果当初做了不同的选择,现在会不会不一样。
【旁白】风吹过窗台,带起一片落叶。两个人沉默了很久。
操作步骤:
预期结果:一段 3 分钟左右、有三个不同声音、有节奏感的多角色配音音频。
避坑点:
把这张表复制到你的笔记软件中,每次做新项目时填一遍,效率翻倍。
| 项目 | 填写 |
|---|---|
| 项目名称 | |
| 内容类型 | 口播 / 有声书 / 播客 / 角色配音 / 其他 |
| 预计时长 | |
| 目标平台 | 抖音 / B站 / 喜马拉雅 / YouTube / 其他 |
| 角色 | 音色名称/ID | 来源(预置/克隆) | 参考音频文件(如克隆) |
|---|---|---|---|
| 旁白 | |||
| 角色1 | |||
| 角色2 |
| 参数 | 旁白 | 角色1 | 角色2 |
|---|---|---|---|
| 语速 | |||
| 音调 | |||
| 情感 | |||
| 稳定性 | |||
| 停顿时长 |
| 项目 | 设置 |
|---|---|
| 音频格式 | MP3 / WAV |
| 采样率 | 24000 / 44100 / 48000 Hz |
| 响度目标 | -16 LUFS(播客)/ -14 LUFS(短视频)/ 其他 |
| 分段策略 | 每段 ___ 字,段间静音 ___ 秒 |
| 检查项 | 通过? |
|---|---|
| 多音字全部读对 | ☐ |
| 断句合理无异常停顿 | ☐ |
| 长文本音色一致性 | ☐ |
| 情感表达符合内容 | ☐ |
| 音量均衡无突变 | ☐ |
| 无杂音/电音/ glitches | ☐ |
A:取决于工具的条款。大多数付费版允许商用,免费版可能有限制。ElevenLabs 付费版可商用,免费版仅限个人非商用。微软 Azure TTS 按调用量付费,商用无限制。使用前务必查看工具的服务条款(ToS)中关于"商用授权"的条款。如果是声音克隆,还需要确认参考音频的版权和被克隆人的授权。
A:2026 年主流工具的最低门槛是 15 秒,但这是"能克隆"的底线,不是"克隆得好"的推荐值。实际建议:
音频质量比时长更重要:一段 1 分钟的干净录音,效果远好于 10 分钟有背景音乐的录音。
A:因为数字和英文的读法取决于上下文,而 TTS 不一定能猜对。比如"123"可以读成"一百二十三""一二三""one two three","AI"可以读成"人工智能"或"A I"。解决方案:
<phoneme> 标签、ElevenLabs 的发音字典)A:排查以下原因:
A:
A:可以,而且这是多角色场景的最佳实践。比如旁白用预置音色(稳定、自然),角色用声音克隆(个性化、有辨识度)。只要注意音量平衡和音色风格搭配,混用效果很好。大多数工具都支持在同一个项目中切换不同音色。
A:截至 2026 年,不会完全取代,但确实在改变行业。TTS 适合的场景是:大批量标准化内容(如有声书、新闻播报)、个人创作者预算有限的项目、需要快速迭代的草稿配音。而需要高度创意和情感表达的高端配音(如电影、动画、品牌广告),专业配音演员仍然是不可替代的。更可能的趋势是"人机协作"——TTS 出初稿,人工精修;或 TTS 做配角,真人做主角。
A:这个问题在 2026 年仍在发展中,不同国家和地区的法律不同。一般来说:
症状:非 48 kHz 不用,结果文件巨大,上传平台后还被压缩,音质没有任何提升。
真相:TTS 模型输出的原生采样率通常是 24 kHz 或 22.05 kHz。工具提供 48 kHz 选项,往往是"升频"(upsampling)——用算法插值补出来的,不是真的有更多细节。就像把 720p 视频拉到 4K,清晰度并没有真正提升。
建议:用工具的默认采样率就好。如果平台有要求(如某些播客平台要求 44.1 kHz),用音频软件做格式转换即可。
症状:克隆出来的声音带着隐隐约约的背景音乐或底噪,怎么都去不掉。
真相:TTS 模型会把参考音频中的所有声音特征都学进去,包括音乐、噪音、回声。这些"杂质"会渗透到每一次生成中。
建议:
症状:开头是严肃介绍,中间是激动的高潮,结尾是温柔总结,但 TTS 全程一个语气读下来,毫无波澜。
真相:大多数 TTS 工具一次生成只能用一个情感参数(或自动判断,但效果不稳定)。一段文本里情绪跨度大时,单一参数搞不定。
建议:按情绪段落拆分文本,每段用不同情感参数分别生成,最后拼接。虽然麻烦一点,但效果天差地别。
症状:生成完直接导出用,后来发现有个多音字读错了,已经发布了。
真相:TTS 不是完美的,尤其是多音字、专有名词、数字组合、中英混排,出错率不低。一次生成的正确率大约 90%–95%,剩下 5%–10% 需要人工检查。
建议:建立"生成 → 试听 → 检查 → 修改文本 → 重新生成"的标准流程。重点检查:多音字、数字、专有名词、标点密集的长句。
症状:做到一半,工具提示"免费额度已用完",项目卡在半路。
真相:免费额度通常有限(如 ElevenLabs 免费版每月 10000 字符),做长文本项目很容易超。
建议:
症状:克隆了名人声音发到社交媒体,结果被投诉下架甚至收到律师函。
真相:2026 年,中国、欧盟、美国都已出台或正在完善 AI 语音相关法规。未经授权克隆他人声音,可能涉及侵犯人格权、著作权、不正当竞争等。
建议:
在这篇教程中,我们从零开始,完成了以下学习:
本系列教程的后续篇章将继续深入:
TTS 是 AI 创作工具箱中最容易上手的工具之一——输入文字就能出声音,门槛极低。但要把它的效果做到"听起来像专业配音",需要你在文本准备、音色选择、参数调优上花心思。
好消息是,这些技巧一旦学会就不会忘,而且工具只会越来越好。你现在打下的基础,以后换任何工具都用得上。
现在,打开一个 TTS 工具,用本教程的方法,生成你的第一段 AI 语音吧。
教程信息
- 标题:L1B-01 · 语音合成(TTS)基础——从文本到声音的保姆级入门指南
- 系列:AI 创作教程 · L1(基础篇)
- 版本:v1.0
- 更新日期:2026-08-07
- 内容时效:截至 2026 年 8 月,基于市面主流工具与公开技术信息撰写
- 免责声明:本教程提及的工具名称归各自所有方所有,本教程不与任何工具存在合作关系,所述内容基于公开信息,不构成任何购买建议。