L1B-02 · 主流语音工具上手:在线服务、IndexTTS2 与音色库管理

课程系列:AI 配音 · L1(基础篇) 课程编号:L1B-02 难度:⭐ 入门(有电脑、会复制粘贴即可,无需编程背景) 适用人群:纯新手自媒体人、想给短视频/有声书/剧集配音的创作者、培训机构讲师、想搭起自己音色库的进阶用户 预计阅读:30–40 分钟 · 预计动手练习:2–3 小时 更新日期:2026 年 8 月 前置课程:L1B-01(语音合成 TTS 基础)


目录

  1. 学习目标
  2. 主流 TTS 工具一张表对比
  3. 在线服务上手
  4. 音色库管理
  5. IndexTTS2 本地/服务部署入门
  6. 成本与并发
  7. 选型建议
  8. 小结与衔接

学习目标

读完这篇教程并跟着做完,你将能够:

  1. 看懂一张 TTS 工具总览表——把 ElevenLabs、豆包语音、通义听悟、微软 TTS、IndexTTS2 放在一起,知道各自强在哪、弱在哪。
  2. 独立开通并上手至少一个在线 TTS 服务——从注册、找免费额度、到生成第一段配音,全程走通。
  3. 建立自己的"音色库"——会用一套清晰的命名规范保存、管理、复用参考音频,不再满桌面乱丢文件。
  4. 理解 IndexTTS2 是什么、能干嘛——知道本地部署和服务部署的区别,并知道如何借助本项目的 vbox 对接它来生成配音。
  5. 看懂成本与并发——免费额度怎么用、按字符计费怎么算、批量生成怎么省时省钱。
  6. 给自己做一个清晰的选型决策——做什么内容、配哪个工具,不再纠结。

一、主流 TTS 工具一张表对比

在动手之前,先建立一张"地图"。下表把 2026 年 8 月中文创作场景里最常见的几类工具放在一起对比。所有免费额度、价格信息请以各官方页面为准,因为厂商随时会调整。

工具 类别 是否支持中文 声音克隆 免费额度(参考) 主要强项 主要短板
ElevenLabs 海外在线服务 ✅(约 1 分钟样本即可) 有免费档,每月若干分钟(以官方为准) 情感表现力极强,语种多 中文偶尔有口音感;需要海淘支付;免费档时长少
豆包语音(火山引擎) 国内在线服务 新用户通常有免费调用额度(以官方为准) 中文音色多、自然;接入方便 需实名认证;部分高级音色需付费
通义听悟 / 通义灵听(阿里) 国内在线服务 部分支持 有免费/试用额度(以官方为准) 中文情感好;工具链(转写+合成)完善 声音克隆能力相对保守
微软 TTS(Azure) 云平台在线服务 ✅(企业级) 有免费 tier(以官方为准) 音色超多、SSML 精细控制 需绑信用卡;对小白略复杂
IndexTTS2 开源、可本地/自部署 无(模型免费,占用自己算力) 中文自然度顶尖、隐私私有、可控成本 需要 GPU / 一定技术门槛

💡 怎么看这张表:所有工具都能"文本变声音",区别在中文表现、克隆门槛、成本结构、隐私控制。海外工具偏重情感与多语种,国内工具偏重中文生态与接入顺手,开源工具偏重私有可控和长期成本。

本课程不绑死任何一家。 你在 L1B-01 学会的原理——自然度、情感、一致性、采样率——在任何工具里都适用。上面的表之所以重要,是因为它帮你把"选工具"这件事从"谁广告多"变成"按需求筛"。


二、在线服务上手

这一节,我们逐个把四个最常见在线服务走一遍:从入口免费额度再到适用场景。你不需要四个都注册,先挑一个离你最近的练手。

2.1 通用心法:所有在线服务都一样

不管哪个平台,在线 TTS 的流程只有四步:

  1. 注册登录(大多要手机号或邮箱,国内平台通常要实名认证)。
  2. 找到"语音合成 / TTS / 文生音"入口(有的叫"语音合成",有的叫"文本转语音",有的藏在"音色广场"里)。
  3. 选音色 → 输入文本 → 点生成
  4. 试听 → 下载得到的通常是 mp3 或 wav 文件。

每一步各个平台长得不一样,但逻辑完全一样。掌握了这个套路,换平台只是找按钮的事。

2.2 ElevenLabs

2.3 豆包语音(火山引擎)

2.4 通义听悟(阿里)

2.5 微软 TTS(Azure)

2.6 一个通用小练习(完成它会很有成就感)

挑上面任意一个工具,完成:

  1. 注册并找到"文本转语音"入口;
  2. 选一个中文音色;
  3. 输入这句文案:"大家好,欢迎收听今天的节目,我是你的 AI 配音助手。";
  4. 生成并下载;
  5. 把它存进你的音色库文件夹(命名规范见下一节)。

完成这五步,你就正式"上手"了第一个在线 TTS 工具。


三、音色库管理

在线服务用得越多,你手里的参考音频就越多——克隆过的好声音、反复用的金句、不同角色的样本……如果不管理,很快会乱成一锅粥。这一节教你用"一套简单到不会忘"的规范把它们管起来。

🎯 为什么音色库重要:好的 TTS 离不开好的参考音频。一个环节(找音色 → 保存 → 复用)做顺了,后面所有视频都能稳定地"用同一个人声",这就是观众说的"你的声音很统一"。一致性是 L1B-01 强调的关键指标,而一致性的根基就是音色库。

3.1 音色库的两种东西

你的音色库里其实只有两类东西:

类型 是什么 例子
参考音频(reference audio) 一段干净的人声样本,用来给 TTS 当"克隆原料" 某位主播 30 秒的干净朗读
角色音色(voice / character) 某一个稳定的、被命名并注册好的"声音身份" "梅长苏""温柔女声""新闻男声"

在线平台上,你把参考音频上传进去、起个名字,平台就会给你一个 Voice ID ——这就完成了一次"参考音频 → 角色音色"的升级。而你自己在本机保存的,是参考音频原件

3.2 目录结构(强烈建议照抄)

在你电脑上建一个这样的文件夹:

voice_library/
├── README.md              # 记录每个音色的说明(可选但推荐)
├── reference/             # 参考音频原件,按角色分组
│   ├── 女声-温柔/
│   │   ├── w-01-开场白-30s.wav
│   │   └── w-02-情绪起伏-60s.wav
│   └── 男声-新闻/
│       ├── m-01-新闻导语-20s.wav
│       └── m-02-匀速长句-45s.wav
└── exported/              # 各平台生成并下载的成品音频
    ├── 2026-08-07-开场白-女声.mp3
    └── ...

不需要很复杂,重点是:一个角色一个文件夹,成品和素材分开

3.3 命名规范(照抄即可)

给参考音频起名时,按这个模板:

[角色类型]-[序号]-[用途]-[时长].ext

例如:

再给你三条保命建议:

  1. 时长写进名字:克隆样本最好干净、清楚;一般 20–60 秒足够,太长反而引入杂音。
  2. 绝不覆盖旧样本:同一个人的样本,存成 -v1-v2,不要直接覆盖,方便回退对比。
  3. 对照关系表做一张 Excel/表格,记录"文件夹名 → 平台 Voice ID → 平台"三者的对应。以后你在多个平台各克隆了一次,靠这张表一眼找回。
角色名 平台 Voice ID 本地路径
温柔女声 ElevenLabs v1abcdef... voice_library/reference/女声-温柔/
温柔女声 豆包 ... 同左
新闻男声 微软 ... voice_library/reference/男声-新闻/

3.4 参考音频的"好样本"标准

不管是任何工具,好的参考音频都长这样:

(这其实是 L1B-01 里"一致性"指标的落地——你给机器什么原料,它就能多像。)


四、IndexTTS2 本地/服务部署入门

前三节讲的全是在线服务——录音要传给别人家服务器。这一节我们聊聊开源自部署的路线:IndexTTS2。这是很多追求"中文自然度 + 私有可控"的创作者的选择,同时也是本项目 vbox 背后的引擎

🧭 如果你是纯小白,先不用着急自己装模型。你可以先读懂"它能干嘛、用 vbox 怎么调",把声音生成出来;至于本地要不要自己起服务,等你需要批量生产、或在意隐私时再动手。本节是"概念级入门",不要求你一次就部署成功。

4.1 IndexTTS2 是什么

IndexTTS2 是一个开源的语音合成(TTS)模型,属于"声音克隆 + 自由文本合成"这一类;它对中文的支持在开源方案里属于第一梯队,可以做到:

与在线服务的区别在于:模型权重是开源的,跑在你自己(或你租)的机器上,所以没有"每生成一次扣一次费"的持续开销,数据也不出你手。

4.2 本地部署 vs 服务部署(一张表说清)

维度 本地部署 服务部署
在哪跑 你自己的一台电脑/服务器 一台专门的 GPU 服务器(自己买或租云 GPU)
需要什么 一张显存较大的 NVIDIA 显卡(越新越好,参考官方要求) 一台带 GPU 的云主机(按小时租也常见)
门槛 中等偏高,要会装 Python 环境、下载模型 中等,配置一次后别人通过接口调用
优点 一次配置长期免费用、完全私有 7x24 在线,可给别人/自己多端调用
代价 显卡贵;电脑关机就不能用 服务器按时间持续花钱(不管是否生成)

一句话:本地=自己霸占一张卡,服务=把卡挂到网上随叫随到。对大多数自媒体人,先借已有的服务用起来,别急着买卡

4.3 对接本项目 vbox(重点)

本项目(仓库 vbox)已经把 IndexTTS2 包装成了一个可用的系统:

怎么拿 API Key

  1. 在 vbox 前端注册并登录账号;
  2. 进入 API Key 管理页,新建一个 Key(注意:原始 Key 只在创建那一刻展示一次,务必立刻复制保存,之后只能看到加密后的状态);
  3. 拿到形如 vbox-xxxx... 的 Key。

对外 API 有哪些(照抄即可用)

对外开放接口都在 /api/open/v1/ 之下,请求时通过请求头带 Key,两种方式任选:

Authorization: Bearer <你的Key>
# 或
X-API-Key: <你的Key>

常用接口:

方法 路径 作用
GET /api/open/v1/me 查看自己 Key 的状态、已调用次数
GET /api/open/v1/voices 获取内置影视剧角色音色列表(按"电视剧 -> 角色"结构)
GET /api/open/v1/user-voices 获取你自己上传的自定义音色列表
POST /api/open/v1/tts/simple-generate 核心:文本转语音,返回合成好的音频地址

核心接口:文本转语音

POST /api/open/v1/tts/simple-generate,请求体(JSON):

{
  "voiceId": "琅琊榜-梅长苏",
  "text": "大家好,今天想跟大家聊聊配音这件事。"
}

说明:

成功时返回类似:

{
  "status": 200,
  "message": "OK",
  "data": {
    "id": "OA_20260807120000_ab12cd34.wav",
    "voice_id": "琅琊榜-梅长苏",
    "audio": "http://你的服务器/cdn/result/audios/OA_....wav",
    "format": "wav",
    "text": "大家好...",
    "credit_used": 1
  }
}

拿到 data.audio 这个网址,浏览器打开就能试听、右键就能下载——一条请求,配音就出来了

🧪 想一键试一下?(有 Python 即可)复制下面的脚本,填上你的 Key 和服务器地址:

import requests

BASE = "http://你的服务器地址"      # 例如 http://localhost:7000
KEY  = "vbox-你的Key"

resp = requests.post(
    f"{BASE}/api/open/v1/tts/simple-generate",
    headers={"Authorization": f"Bearer {KEY}", "Content-Type": "application/json"},
    json={"voiceId": "琅琊榜-梅长苏", "text": "你好,我是用 vbox 生成的配音。"},
    timeout=300,
)
data = resp.json()
print("返回:", data)
if resp.status_code == 200:
    print("音频地址:", data["data"]["audio"])

把这个脚本存成 gen_voice.py,以后改改 textvoiceId 就能反复用——这就是你迈向"批量生成"的第一步(那部分 L1B-07 会讲得更深)。

为什么用 vbox 对接很划算


五、成本与并发

很多新手被"免费"吓怕,或被"很贵"劝退。这一节把 TTS 的成本结构讲透,你会发现自己完全可以控制预算。

5.1 成本到底由什么构成

在线 TTS 大体按这几种方式计费(各平台略有差异,以官方为准):

计费方式 说明 典型代表
按字符 / 字数 每合成一个汉字(或字符)算一次费用 国内在线平台、微软 Azure 常见
按分钟 / 时长 按生成的音频时长计费 ElevenLabs 等
按调用次数 / 条数 每次请求算一次,或按免费额度内的固定次数 部分试用活动
免费档 + 超出付费 每月送一定额度,超出按量计 几乎所有平台

关键认知:你真正要付的钱 ≈ “重复生成的文本量” × “单价”。所以省钱的两大杠杆是——少重复生成走免费/批量

5.2 免费额度怎么薅

5.3 按字符计费怎么算(举例)

假设某平台中文合成单价是 X 元 / 千字(具体以官方为准),那么:

把"单期字数 × 期数 × 单价"算一遍,你就知道月预算大概多少。建议开做前先算这笔账,别等到账单来了才吃惊。

5.4 并发是什么,普通人要不要管

并发(concurrency)= 同一时刻同时发出去的生成请求数量。

给你一个稳妥策略:先一次发 1 条测通,再试 5 条并行,观察排队和报错,逐步加大。不要盲目追求"一次跑几百条"。

5.5 批量生成与缓存:省钱的两招

  1. 批量:把一期节目的所有台词整理成清单,一次性按清单生成,而不是想到一句生成一句。这样既省你反复操作的时间,也方便统一质检。
  2. 缓存:同一句文案如果反复用(比如固定片头"欢迎收听……"),生成一次存好,之后直接复用,绝不重复花钱。这正是 L1B-07 里讲的缓存思想的雏形。

六、选型建议

把工具、成本、场景串起来,给你一张"按需选型"的决策表。

你想做什么 首选 备选 理由
中文短视频口播 豆包语音 微软 TTS 中文音色自然、接入顺手、国内生态
有声书 / 叙事 / 强情感 ElevenLabs 通义 情感表现力强
访谈 / 转写+再合成 通义听悟 微软 TTS 工具链完整
大量音色 + 精细控制 微软 TTS 豆包 音色丰富、SSML 精细
追求中文顶级 + 私有可控 / 批量生产 IndexTTS2(经 vbox) 豆包 + 缓存 无持续按量费、数据不出手
纯小白、就想先试 选一个免费额度最多的在线平台练手 先熟悉流程,再决策

三条「反直觉但正确」的建议:

  1. 别一上来买最贵的。先用免费额度把你的脚本、风格、流程跑通,再考虑付费。
  2. 别只盯"最像真人的"。有些平台音色更自然,但单价和门槛更高;先求"能用、稳定、成本可控",再谈"更真"。
  3. 把音色库和脚本管好,比换更贵的工具提升更大。很多"听起来不自然"的问题,其实出在参考音频太脏、或文案没分段,而不在工具本身。

七、小结与衔接

本节你带走了什么

✅ 自测(动手做一遍才算会)

  1. 开通任意一个在线 TTS 工具,生成一句中文配音;
  2. 把它的参考音频或成品音频按本课命名规范存进音色库;
  3. 用 vbox 的对外 API(拿到 Key)生成一句 琅琊榜-梅长苏 的配音;

➡️ 下一篇预告

这一课我们解决了"哪来那么多好听的声音"(工具、部署、音色库、成本)。但"用别人的/内置的音色"终究有上限——很多创作者最想要的,是把自己的声音变成 AI 能用的声音,或者是让一个指定的人声稳定地复现

这就要用到 L1B-03 · 声音克隆实操(Voice Cloning) 了。我们将手把手教你:如何准备一段高质量的克隆样本、如何在各平台 / 通过 vbox 完成声音克隆、以及如何让克隆出来的声音既像又自然。

准备好了吗?下一课,把你的声音交给 AI。


📌 小字备注:本文所有工具的功能、免费额度、价格、接口参数均以各官方 2026 年 8 月的公开信息为准,厂商可能随时调整;文中给出的接口与脚本基于本项目(vbox)当前实现,如遇差异请以你的实际服务端为准。