课程系列:AI 配音 · L1(基础篇) 课程编号:L1B-02 难度:⭐ 入门(有电脑、会复制粘贴即可,无需编程背景) 适用人群:纯新手自媒体人、想给短视频/有声书/剧集配音的创作者、培训机构讲师、想搭起自己音色库的进阶用户 预计阅读:30–40 分钟 · 预计动手练习:2–3 小时 更新日期:2026 年 8 月 前置课程:L1B-01(语音合成 TTS 基础)
读完这篇教程并跟着做完,你将能够:
在动手之前,先建立一张"地图"。下表把 2026 年 8 月中文创作场景里最常见的几类工具放在一起对比。所有免费额度、价格信息请以各官方页面为准,因为厂商随时会调整。
| 工具 | 类别 | 是否支持中文 | 声音克隆 | 免费额度(参考) | 主要强项 | 主要短板 |
|---|---|---|---|---|---|---|
| ElevenLabs | 海外在线服务 | ✅ | ✅(约 1 分钟样本即可) | 有免费档,每月若干分钟(以官方为准) | 情感表现力极强,语种多 | 中文偶尔有口音感;需要海淘支付;免费档时长少 |
| 豆包语音(火山引擎) | 国内在线服务 | ✅ | ✅ | 新用户通常有免费调用额度(以官方为准) | 中文音色多、自然;接入方便 | 需实名认证;部分高级音色需付费 |
| 通义听悟 / 通义灵听(阿里) | 国内在线服务 | ✅ | 部分支持 | 有免费/试用额度(以官方为准) | 中文情感好;工具链(转写+合成)完善 | 声音克隆能力相对保守 |
| 微软 TTS(Azure) | 云平台在线服务 | ✅ | ✅(企业级) | 有免费 tier(以官方为准) | 音色超多、SSML 精细控制 | 需绑信用卡;对小白略复杂 |
| IndexTTS2 | 开源、可本地/自部署 | ✅ | ✅ | 无(模型免费,占用自己算力) | 中文自然度顶尖、隐私私有、可控成本 | 需要 GPU / 一定技术门槛 |
💡 怎么看这张表:所有工具都能"文本变声音",区别在中文表现、克隆门槛、成本结构、隐私控制。海外工具偏重情感与多语种,国内工具偏重中文生态与接入顺手,开源工具偏重私有可控和长期成本。
本课程不绑死任何一家。 你在 L1B-01 学会的原理——自然度、情感、一致性、采样率——在任何工具里都适用。上面的表之所以重要,是因为它帮你把"选工具"这件事从"谁广告多"变成"按需求筛"。
这一节,我们逐个把四个最常见在线服务走一遍:从入口到免费额度再到适用场景。你不需要四个都注册,先挑一个离你最近的练手。
不管哪个平台,在线 TTS 的流程只有四步:
每一步各个平台长得不一样,但逻辑完全一样。掌握了这个套路,换平台只是找按钮的事。
挑上面任意一个工具,完成:
完成这五步,你就正式"上手"了第一个在线 TTS 工具。
在线服务用得越多,你手里的参考音频就越多——克隆过的好声音、反复用的金句、不同角色的样本……如果不管理,很快会乱成一锅粥。这一节教你用"一套简单到不会忘"的规范把它们管起来。
🎯 为什么音色库重要:好的 TTS 离不开好的参考音频。一个环节(找音色 → 保存 → 复用)做顺了,后面所有视频都能稳定地"用同一个人声",这就是观众说的"你的声音很统一"。一致性是 L1B-01 强调的关键指标,而一致性的根基就是音色库。
你的音色库里其实只有两类东西:
| 类型 | 是什么 | 例子 |
|---|---|---|
| 参考音频(reference audio) | 一段干净的人声样本,用来给 TTS 当"克隆原料" | 某位主播 30 秒的干净朗读 |
| 角色音色(voice / character) | 某一个稳定的、被命名并注册好的"声音身份" | "梅长苏""温柔女声""新闻男声" |
在线平台上,你把参考音频上传进去、起个名字,平台就会给你一个 Voice ID ——这就完成了一次"参考音频 → 角色音色"的升级。而你自己在本机保存的,是参考音频原件。
在你电脑上建一个这样的文件夹:
voice_library/
├── README.md # 记录每个音色的说明(可选但推荐)
├── reference/ # 参考音频原件,按角色分组
│ ├── 女声-温柔/
│ │ ├── w-01-开场白-30s.wav
│ │ └── w-02-情绪起伏-60s.wav
│ └── 男声-新闻/
│ ├── m-01-新闻导语-20s.wav
│ └── m-02-匀速长句-45s.wav
└── exported/ # 各平台生成并下载的成品音频
├── 2026-08-07-开场白-女声.mp3
└── ...
不需要很复杂,重点是:一个角色一个文件夹,成品和素材分开。
给参考音频起名时,按这个模板:
[角色类型]-[序号]-[用途]-[时长].ext
例如:
女声-温柔-01-开场白-30s.wav男声-新闻-02-语速测试-45s.wav主播-小雅-03-克隆样本-60s.mp3再给你三条保命建议:
-v1、-v2,不要直接覆盖,方便回退对比。| 角色名 | 平台 | Voice ID | 本地路径 |
|---|---|---|---|
| 温柔女声 | ElevenLabs | v1abcdef... | voice_library/reference/女声-温柔/ |
| 温柔女声 | 豆包 | ... | 同左 |
| 新闻男声 | 微软 | ... | voice_library/reference/男声-新闻/ |
不管是任何工具,好的参考音频都长这样:
(这其实是 L1B-01 里"一致性"指标的落地——你给机器什么原料,它就能多像。)
前三节讲的全是在线服务——录音要传给别人家服务器。这一节我们聊聊开源自部署的路线:IndexTTS2。这是很多追求"中文自然度 + 私有可控"的创作者的选择,同时也是本项目 vbox 背后的引擎。
🧭 如果你是纯小白,先不用着急自己装模型。你可以先读懂"它能干嘛、用 vbox 怎么调",把声音生成出来;至于本地要不要自己起服务,等你需要批量生产、或在意隐私时再动手。本节是"概念级入门",不要求你一次就部署成功。
IndexTTS2 是一个开源的语音合成(TTS)模型,属于"声音克隆 + 自由文本合成"这一类;它对中文的支持在开源方案里属于第一梯队,可以做到:
与在线服务的区别在于:模型权重是开源的,跑在你自己(或你租)的机器上,所以没有"每生成一次扣一次费"的持续开销,数据也不出你手。
| 维度 | 本地部署 | 服务部署 |
|---|---|---|
| 在哪跑 | 你自己的一台电脑/服务器 | 一台专门的 GPU 服务器(自己买或租云 GPU) |
| 需要什么 | 一张显存较大的 NVIDIA 显卡(越新越好,参考官方要求) | 一台带 GPU 的云主机(按小时租也常见) |
| 门槛 | 中等偏高,要会装 Python 环境、下载模型 | 中等,配置一次后别人通过接口调用 |
| 优点 | 一次配置长期免费用、完全私有 | 7x24 在线,可给别人/自己多端调用 |
| 代价 | 显卡贵;电脑关机就不能用 | 服务器按时间持续花钱(不管是否生成) |
一句话:本地=自己霸占一张卡,服务=把卡挂到网上随叫随到。对大多数自媒体人,先借已有的服务用起来,别急着买卡。
本项目(仓库 vbox)已经把 IndexTTS2 包装成了一个可用的系统:
server/api_server_v2.py)基于 IndexTTS2 提供了 /tts_url 这个合成接口;vbox-xxxx... 的 Key。对外开放接口都在 /api/open/v1/ 之下,请求时通过请求头带 Key,两种方式任选:
Authorization: Bearer <你的Key>
# 或
X-API-Key: <你的Key>
常用接口:
| 方法 | 路径 | 作用 |
|---|---|---|
| GET | /api/open/v1/me |
查看自己 Key 的状态、已调用次数 |
| GET | /api/open/v1/voices |
获取内置影视剧角色音色列表(按"电视剧 -> 角色"结构) |
| GET | /api/open/v1/user-voices |
获取你自己上传的自定义音色列表 |
| POST | /api/open/v1/tts/simple-generate |
核心:文本转语音,返回合成好的音频地址 |
POST /api/open/v1/tts/simple-generate,请求体(JSON):
{
"voiceId": "琅琊榜-梅长苏",
"text": "大家好,今天想跟大家聊聊配音这件事。"
}
说明:
voiceId 有两种格式:电视剧-角色名:用内置音色,例如 琅琊榜-梅长苏;user-{数字}:用你自己上传的音色,例如 user-123(可在 user-voices 里查到 ID)。text:要合成的文本,单次上限约 1000 字;emoVec:一个长度为 8 的情感向量(0–1.5),懂的话可以微调情绪,小白建议先不传。成功时返回类似:
{
"status": 200,
"message": "OK",
"data": {
"id": "OA_20260807120000_ab12cd34.wav",
"voice_id": "琅琊榜-梅长苏",
"audio": "http://你的服务器/cdn/result/audios/OA_....wav",
"format": "wav",
"text": "大家好...",
"credit_used": 1
}
}
拿到 data.audio 这个网址,浏览器打开就能试听、右键就能下载——一条请求,配音就出来了。
🧪 想一键试一下?(有 Python 即可)复制下面的脚本,填上你的 Key 和服务器地址:
import requests
BASE = "http://你的服务器地址" # 例如 http://localhost:7000
KEY = "vbox-你的Key"
resp = requests.post(
f"{BASE}/api/open/v1/tts/simple-generate",
headers={"Authorization": f"Bearer {KEY}", "Content-Type": "application/json"},
json={"voiceId": "琅琊榜-梅长苏", "text": "你好,我是用 vbox 生成的配音。"},
timeout=300,
)
data = resp.json()
print("返回:", data)
if resp.status_code == 200:
print("音频地址:", data["data"]["audio"])
把这个脚本存成 gen_voice.py,以后改改 text 和 voiceId 就能反复用——这就是你迈向"批量生成"的第一步(那部分 L1B-07 会讲得更深)。
me 接口里能看到自己调了多少次,方便控成本。很多新手被"免费"吓怕,或被"很贵"劝退。这一节把 TTS 的成本结构讲透,你会发现自己完全可以控制预算。
在线 TTS 大体按这几种方式计费(各平台略有差异,以官方为准):
| 计费方式 | 说明 | 典型代表 |
|---|---|---|
| 按字符 / 字数 | 每合成一个汉字(或字符)算一次费用 | 国内在线平台、微软 Azure 常见 |
| 按分钟 / 时长 | 按生成的音频时长计费 | ElevenLabs 等 |
| 按调用次数 / 条数 | 每次请求算一次,或按免费额度内的固定次数 | 部分试用活动 |
| 免费档 + 超出付费 | 每月送一定额度,超出按量计 | 几乎所有平台 |
关键认知:你真正要付的钱 ≈ “重复生成的文本量” × “单价”。所以省钱的两大杠杆是——少重复生成 和 走免费/批量。
假设某平台中文合成单价是 X 元 / 千字(具体以官方为准),那么:
把"单期字数 × 期数 × 单价"算一遍,你就知道月预算大概多少。建议开做前先算这笔账,别等到账单来了才吃惊。
并发(concurrency)= 同一时刻同时发出去的生成请求数量。
给你一个稳妥策略:先一次发 1 条测通,再试 5 条并行,观察排队和报错,逐步加大。不要盲目追求"一次跑几百条"。
把工具、成本、场景串起来,给你一张"按需选型"的决策表。
| 你想做什么 | 首选 | 备选 | 理由 |
|---|---|---|---|
| 中文短视频口播 | 豆包语音 | 微软 TTS | 中文音色自然、接入顺手、国内生态 |
| 有声书 / 叙事 / 强情感 | ElevenLabs | 通义 | 情感表现力强 |
| 访谈 / 转写+再合成 | 通义听悟 | 微软 TTS | 工具链完整 |
| 大量音色 + 精细控制 | 微软 TTS | 豆包 | 音色丰富、SSML 精细 |
| 追求中文顶级 + 私有可控 / 批量生产 | IndexTTS2(经 vbox) | 豆包 + 缓存 | 无持续按量费、数据不出手 |
| 纯小白、就想先试 | 选一个免费额度最多的在线平台练手 | — | 先熟悉流程,再决策 |
三条「反直觉但正确」的建议:
琅琊榜-梅长苏 的配音;这一课我们解决了"哪来那么多好听的声音"(工具、部署、音色库、成本)。但"用别人的/内置的音色"终究有上限——很多创作者最想要的,是把自己的声音变成 AI 能用的声音,或者是让一个指定的人声稳定地复现。
这就要用到 L1B-03 · 声音克隆实操(Voice Cloning) 了。我们将手把手教你:如何准备一段高质量的克隆样本、如何在各平台 / 通过 vbox 完成声音克隆、以及如何让克隆出来的声音既像又自然。
准备好了吗?下一课,把你的声音交给 AI。
📌 小字备注:本文所有工具的功能、免费额度、价格、接口参数均以各官方 2026 年 8 月的公开信息为准,厂商可能随时调整;文中给出的接口与脚本基于本项目(vbox)当前实现,如遇差异请以你的实际服务端为准。