L0-3 工具地图:国内外主流 AI 创作工具一张图看懂

保姆级教程 · 面向纯小白与自媒体人

项目 信息
课程系列 AI 创作入门 · L0 通识与入门
课程编号 L0-3
板块 L0 通识与入门
难度等级 ★☆☆☆☆(零基础友好)
适用人群 想用 AI 做内容、但对市面上工具一头雾水、不知道从哪个开始用的新手创作者
预计阅读 25-35 分钟
更新日期 2026 年 8 月
内容声明 本教程只做工具分类与选型思路科普,不涉及具体付费优惠/邀请链接,不绑定任何单一平台

学习目标

学完本教程后,你将能够:

  1. 看懂市面上的 AI 创作工具到底分几大类——文字、语音、图片、视频、智能体,不再被五花八门的名字绕晕。
  2. 按用途选工具:给「我要做一条口播视频 / 一张封面 / 一条小红书图文」这样的具体需求,快速定位该用哪一类、哪一款。
  3. 分清三类来源:外国工具、国内工具、开源/自托管,知道各自的「门槛」和「天花板」在哪里。
  4. 建立自己的最小工具清单:不贪多,先挑 1-2 个能立刻上手的主力工具,把一条内容跑通。
  5. 判断哪些工具值得深入研究、哪些只要知道名字、将来碰到再学即可。

前置准备

你需要什么

你不需要什么


一、先建立一张「分类地图」

很多新手最大的困惑不是「不会用」,而是「工具太多不知道选哪个」。破解方法很简单:先按它帮你做什么来分类,而不是按品牌记。

AI 创作工具按照产出可以分成五大类:

大类 帮你做什么 典型场景 国内代表 国外代表
文字类 写文案、写脚本、润色、翻译、策划 标题、口播稿、小红书正文、公众号长文 豆包、文心一言、通义千问、Kimi、DeepSeek ChatGPT、Claude、Gemini
语音类 文字变声音、声音克隆、配音 口播、有声书、播客、多角色配音 豆包语音、通义听悟、各类 TTS 服务 ElevenLabs、微软 Azure TTS、OpenAI TTS
图片类 文生图、图生图、扩图、改图 封面、配图、海报、电商图、IP 形象 即梦、文心一格、通义万相 Midjourney、Stable Diffusion、Firefly、DALL·E
视频类 文生视频、图生视频、数字人 短视频素材、口播视频、混剪 可灵、即梦、海螺 Runway、Sora、Veo
智能体类 把多个环节串成自动流程、搭机器人 选题监控、自动分发、知识问答、客服助手 扣子(Coze)、Dify、FastGPT、文心智能体 OpenAI GPTs、Google 相关 Agent 平台

一句话记忆:文字、语音、图片、视频,是四种「产出内容」的工具;智能体是「把前面几种串起来自动干活的调度员」。

记下这张表就够了。接下来的每一节,我们逐个拆开讲怎么选。


二、文字类:你最该先上手的入门工具

2.1 它们的作用

文字类是目前最成熟、门槛最低、也最能立刻提效的一类。它既能帮你从零写(给你主题,生成大纲和初稿),也能帮你(润色、降重、去 AI 味、改语气),还能帮你翻译、提炼、brainstorm 选题

对自媒体人来说,文字类几乎覆盖了前期所有「想和写」的环节。

2.2 国内主流:怎么选

2.3 国外主流:怎么选

2.4 新手选型建议

想深入学提示词怎么写、怎么让模型输出更好,往后进入 L1A-01 提示词基础 会系统教。


三、语音类:把文字变成「说出来的声音」

3.1 它帮你做什么

语音类(TTS,Text-to-Speech)把一段文字变成一段人声朗读的音频。现在不仅能「读」,还能选择不同音色、调节情绪、甚至克隆某段特定的声音

自媒体人常用它做:口播视频的配音、有声书、播客、多角色配音短剧等。

3.2 国内主流

3.3 国外主流

3.4 新手选型建议

语音这块如果你用的是本项目对应的 TTS 引擎(IndexTTS2),相关的本地/服务部署、声音克隆实操,会从 L1B 系列开始系统讲。


四、图片类:把想法变成看得见的画面

4.1 它帮你做什么

图片类(AI 生图)根据一句文字描述生成图片,也能根据一张已有图片做变化(图生图)、把图向外扩展、局部重绘、统一风格系列图。自媒体人用于:封面、配图、海报、IP 形象、电商主图等。

4.2 国内主流

4.3 国外主流

4.4 新手选型建议


五、视频类:文字和图片的下一步

5.1 它帮你做什么

视频类让 AI 根据文字或图片生成动态画面。目前常用形态:文生视频(一句话出一段画面)、图生视频(把一张图动起来)、数字人/口播形象(配合配音生成说话的人像)。

5.2 国内主流

5.3 国外主流

5.4 新手选型建议


六、智能体类:把前面所有工具串起来

6.1 它是什么

智能体(Agent)类工具不是「产出一种内容」,而是把你前面学的文字、语音、图片、视频能力,编排成一条自动运行的流程。好比一个自动化的「内容流水线」。

举例:一个智能体可以做到「每天早上自动抓热点选题 → 用文字模型生成文案初稿 → 配一张图 → 排进发布计划」。

6.2 国内主流

6.3 国外主流

6.4 新手选型建议


七、三个来源怎么看待:国外 / 国内 / 开源

来源 特点 门槛 适合谁
国外工具 部分能力领先、英文生态好、选择多 注册/付费需海外卡,部分需网络访问 想要前沿能力、愿意折腾的人
国内工具 中文好、注册即用、合规省心、免费额度多 绝大多数小白,强烈建议从这里起步
开源/自托管 可控、可定制、数据可本地化 高,需一定技术(部署、显卡) 有技术能力的进阶玩家、对数据敏感的用户

给八成读者的建议:先以国内工具为主力把事做成,再把个别国内做不好的环节(如顶级画质、海外平台)用国外工具补充。别一上来就被「国外最强」洗脑——对大多数人来说,「用得动、用得起」比「最强」更重要。


八、搭一套你的「最小工具清单」

不必一次装一堆。建议按下面节奏来:

第一步:先选 1 个文字主力

就一个,选你用得最顺手的(国产优先)。用它处理所有「写和改」。

第二步:加 1 个图片辅助

需要配图时用它。中文生图先从国内工具开始。

第三步:按需加 1 个配音/视频

真正开始做视频内容时再加,不要一开始就摊大饼。

第四步:给自己一个「练习主线」

给自己定一个小目标,比如「用 AI 完成一条小红书图文」或「用 AI 配一条口播视频」,把选好的工具串起来跑一遍。跑通一遍,比收藏 50 个工具都强。


模板速查:我的工具评估卡

遇到任何新工具,都可以用这张卡快速判断值不值得试:

维度 打钩处
它解决我哪一类需求(文字/语音/图片/视频/智能体)?
注册和上手难度?(国内低/国外中/开源高)
有免费额度吗?够我试用吗?
中文支持好吗?
老手/教程多不多?(好不好学)
和我的其他工具能否联动?

五项里有三项以上打得上勾,就值得试;否则基本可以放着以后再说。


FAQ:常见问题解答

Q1:工具这么多,会不会过两天就全变了?

会,而且变得很快。所以本教程教「分类和选型」而不是让你背清单。只要你会分类,新工具出来你也能快速判断它属于哪一类、要不要试。

Q2:国外工具是不是一定比国内强?

不一定。「强不强」要看任务:很多国内工具的中文理解和产品体验反而更好。选工具看「适不适合你、你用不用得起」,别只看「谁宣传得最猛」。

Q3:我需要同时注册很多工具吗?

不需要。建议严格执行「最小清单」:先 1 个文字 + 1 个图片,跑通一条内容再说。

Q4:免费工具和付费的差别大吗?

差别主要体现在额度、速度、部分高级能力上。免费额度足够新手把流程跑熟;等你确定某个工具确实带来价值,再按 L0-5 的成本方法去评估付费。

Q5:我想要的角色/风格,为什么工具总给不出来?

单点工具的能力有边界。想要「稳定出某个人物/某套风格」,往往需要更进阶的控制手段(参考图、LoRA、一致化工具),这在 L2-C 图片系列、L1-B 语音系列里会讲。


进阶避坑指南

坑 1:囤积工具,一个都没用熟

破解:先定一条内容主线,用最少工具跑通它。跑通过程中的「卡点」,才是你扩展工具清单的触发条件。

坑 2:盲目追「最强最新」

新工具刚出来常伴随炒作。等它稳定、等教程多起来再用,并不丢人——效率工具的胜利属于「用得久的人」,不是「下手最早的人」。

坑 3:被「免费试用」套牢

很多工具免费额度有限,试用期一过就开始计费。用之前看清额度规则(详见 L0-5),别让「试一下」变成「不知不觉扣费」。

坑 4:只看名字不看分类

「XX 也出 AI 了」不等于它适合你。先回到分类地图,判断它补的是哪一类能力、你有没有这个需求,再决定要不要花时间去试。

最重要的三句话

  1. 工具分五类:文字、语音、图片、视频、智能体,先分类再选型。
  2. 对多数人:国内工具起步最省心,再用个别国外工具补充短板。
  3. 别囤工具,用最少的一套把一条内容跑通,才是真正的效率。

下一站预告

到这里你已经对工具世界有了一个「地图」,知道每一类大概是干什么的。但「工具」背后还有两件更基础的事要解决:你的账号和网络环境怎么准备(要不要折腾、付费走哪),以及这套工具到底会花你多少钱

下一课《L0-4 账号与网络环境准备》就来看怎么准备账号、怎么安全地付费。想直接管住钱包的,也可以先跳到《L0-5 成本认知》。


教程版本:v1.0 最后更新:2026-08 内容时效:AI 工具迭代极快,本文的工具清单与代表产品基于截至 2026 年 8 月的信息整理。建议每 3-6 个月回顾一次本课的「分类逻辑」,而不是死记清单——分类永不过时,具体的品牌名字会换。