L0-3 工具地图:国内外主流 AI 创作工具一张图看懂
保姆级教程 · 面向纯小白与自媒体人
| 项目 |
信息 |
| 课程系列 |
AI 创作入门 · L0 通识与入门 |
| 课程编号 |
L0-3 |
| 板块 |
L0 通识与入门 |
| 难度等级 |
★☆☆☆☆(零基础友好) |
| 适用人群 |
想用 AI 做内容、但对市面上工具一头雾水、不知道从哪个开始用的新手创作者 |
| 预计阅读 |
25-35 分钟 |
| 更新日期 |
2026 年 8 月 |
| 内容声明 |
本教程只做工具分类与选型思路科普,不涉及具体付费优惠/邀请链接,不绑定任何单一平台 |
学习目标
学完本教程后,你将能够:
- 看懂市面上的 AI 创作工具到底分几大类——文字、语音、图片、视频、智能体,不再被五花八门的名字绕晕。
- 按用途选工具:给「我要做一条口播视频 / 一张封面 / 一条小红书图文」这样的具体需求,快速定位该用哪一类、哪一款。
- 分清三类来源:外国工具、国内工具、开源/自托管,知道各自的「门槛」和「天花板」在哪里。
- 建立自己的最小工具清单:不贪多,先挑 1-2 个能立刻上手的主力工具,把一条内容跑通。
- 判断哪些工具值得深入研究、哪些只要知道名字、将来碰到再学即可。
前置准备
你需要什么
- 一颗开放的心态。工具更新极快,今天的最强明天可能就被超越,所以本教程教你的不是「背清单」,而是「会分类、会选型」。
- 一张纸或一个空白文档(可选)。用来画你自己的「工具地图」,把想试的工具记下来。
- 能上网的设备。手机即可,电脑更顺手。
你不需要什么
- 不需要编程基础。
- 不需要把每一款工具都注册一遍。
- 不需要马上花钱——绝大多数工具都有免费额度,先白嫖、再决定值不值得掏钱(具体怎么控制预算见 L0-5)。
一、先建立一张「分类地图」
很多新手最大的困惑不是「不会用」,而是「工具太多不知道选哪个」。破解方法很简单:先按它帮你做什么来分类,而不是按品牌记。
AI 创作工具按照产出可以分成五大类:
| 大类 |
帮你做什么 |
典型场景 |
国内代表 |
国外代表 |
| 文字类 |
写文案、写脚本、润色、翻译、策划 |
标题、口播稿、小红书正文、公众号长文 |
豆包、文心一言、通义千问、Kimi、DeepSeek |
ChatGPT、Claude、Gemini |
| 语音类 |
文字变声音、声音克隆、配音 |
口播、有声书、播客、多角色配音 |
豆包语音、通义听悟、各类 TTS 服务 |
ElevenLabs、微软 Azure TTS、OpenAI TTS |
| 图片类 |
文生图、图生图、扩图、改图 |
封面、配图、海报、电商图、IP 形象 |
即梦、文心一格、通义万相 |
Midjourney、Stable Diffusion、Firefly、DALL·E |
| 视频类 |
文生视频、图生视频、数字人 |
短视频素材、口播视频、混剪 |
可灵、即梦、海螺 |
Runway、Sora、Veo |
| 智能体类 |
把多个环节串成自动流程、搭机器人 |
选题监控、自动分发、知识问答、客服助手 |
扣子(Coze)、Dify、FastGPT、文心智能体 |
OpenAI GPTs、Google 相关 Agent 平台 |
一句话记忆:文字、语音、图片、视频,是四种「产出内容」的工具;智能体是「把前面几种串起来自动干活的调度员」。
记下这张表就够了。接下来的每一节,我们逐个拆开讲怎么选。
二、文字类:你最该先上手的入门工具
2.1 它们的作用
文字类是目前最成熟、门槛最低、也最能立刻提效的一类。它既能帮你从零写(给你主题,生成大纲和初稿),也能帮你改(润色、降重、去 AI 味、改语气),还能帮你翻译、提炼、brainstorm 选题。
对自媒体人来说,文字类几乎覆盖了前期所有「想和写」的环节。
2.2 国内主流:怎么选
- 豆包(字节旗下):上手极快,中文自然,App 体验好,适合完全小白。免费额度友好。
- Kimi(月之暗面):长文本处理出名,适合丢一大段资料让它总结、写长文。
- DeepSeek:性价比高、推理能力强,写长文和复杂任务表现好,价格便宜。
- 文心一言(百度):通义千问(阿里):背靠大厂,中文能力强,和自家生态(网盘、搜索、办公)I 联动方便。
2.3 国外主流:怎么选
- ChatGPT(OpenAI):综合能力均衡,插件/生态丰富,是最广为人知的模型。
- Claude(Anthropic):写作和长文能力出众,「有温度」,适合写长文案、脚本、自然语气的内容。
- Gemini(Google):多模态好,和 Google 搜索、YouTube 联动强。
2.4 新手选型建议
- 完全没接触过:先挑国内任一日常工具(豆包或文心都能),因为注册简单、响应快、没有任何访问障碍,先把「会用 AI 对话」这件事做熟。
- 想要更好写作质量、不介意折腾:可以再试 Claude、ChatGPT,对比一下哪个的文风更对胃口。
- 记住:文字模型没有「唯一正确答案」,同一段话换模型结果不同很正常,多试几个,选自己用着顺手的。
想深入学提示词怎么写、怎么让模型输出更好,往后进入 L1A-01 提示词基础 会系统教。
三、语音类:把文字变成「说出来的声音」
3.1 它帮你做什么
语音类(TTS,Text-to-Speech)把一段文字变成一段人声朗读的音频。现在不仅能「读」,还能选择不同音色、调节情绪、甚至克隆某段特定的声音。
自媒体人常用它做:口播视频的配音、有声书、播客、多角色配音短剧等。
3.2 国内主流
- 豆包语音 / 各种大厂 TTS:中文音色自然,调用方便,部分免费。
- 通义听悟 / 剪映字幕配音:和视频剪辑软件联动紧,适合快速给视频配旁白。
- 各类专注 TTS 的服务:可作为大脑调用,常以「API 接口」或「网页工具」两种形态出现。
3.3 国外主流
- ElevenLabs:音色自然、克隆能力突出,是 AI 配音里口碑很好的工具。
- 微软 Azure TTS / OpenAI TTS:技术底子厚,多语言支持好,常被集成进各类产品。
3.4 新手选型建议
- 先想清楚需求:只要朗读配音可以从国内工具起步;要做声音克隆、多角色配音再研究更强的工具。
- 语音类常和「视频剪辑」绑在一起,很多剪视频的软件内置了配音功能,可以先从那里顺手用起来。
语音这块如果你用的是本项目对应的 TTS 引擎(IndexTTS2),相关的本地/服务部署、声音克隆实操,会从 L1B 系列开始系统讲。
四、图片类:把想法变成看得见的画面
4.1 它帮你做什么
图片类(AI 生图)根据一句文字描述生成图片,也能根据一张已有图片做变化(图生图)、把图向外扩展、局部重绘、统一风格系列图。自媒体人用于:封面、配图、海报、IP 形象、电商主图等。
4.2 国内主流
- 即梦(字节):操作友好、模板多,适合新手快速出图、做视频封面。
- 文心一格(百度):中文理解好,适合中文提示词。
- 通义万相(阿里):和阿里生态联动,多几种风格玩法。
4.3 国外主流
- Midjourney:画面质量高、风格化强,深受设计师欢迎,但常驻聊天界面(通常用 Discord 或网页版),上手曲线略高。
- Stable Diffusion:开源,可本地部署、高度可定制,能做角色一致性、LoRA 等高级玩法,但需要一定配置和门槛。
- Firefly(Adobe)/ DALL·E(OpenAI):分别嵌在 Adobe 生态和 OpenAI 生态里。
4.4 新手选型建议
- 只想快速出好看的图:从国内工具(即梦/文心一格)起步,注册即用、中文友好。
- 追求专业画质、愿意学:再探索 Midjourney。
- 想要可控、能批量、能保角色一致:将来研究 Stable Diffusion 或 ComfyUI,这部分在 L2-C 图片系列 里讲。
五、视频类:文字和图片的下一步
5.1 它帮你做什么
视频类让 AI 根据文字或图片生成动态画面。目前常用形态:文生视频(一句话出一段画面)、图生视频(把一张图动起来)、数字人/口播形象(配合配音生成说话的人像)。
5.2 国内主流
- 可灵(快手):短视频生成表现好,运动连贯性不错。
- 即梦(字节):和图片/剪辑生态互通,适合「图文→视频」的联动。
- 海螺(Minimax):文生视频、角色一致性有亮点。
5.3 国外主流
- Runway:视频生成老牌工具,工具链完整。
- Sora(OpenAI)/ Veo(Google):图像/视频生成的大厂标杆,能力在快速迭代。
5.4 新手选型建议
- 视频类更新最快、也最不稳定,今天的效果不等于明天的效果。
- 新手不必一上来就追求高分视频,先把它当「素材补充工具」:用 AI 生成空镜、转场、特效镜头,再配你自己拍的或剪辑的视频,这样最稳。
- 视频 + 配音 + 文案的组合是自媒体主流形态,具体的实战思路在 L2-C 视频系列里展开。
六、智能体类:把前面所有工具串起来
6.1 它是什么
智能体(Agent)类工具不是「产出一种内容」,而是把你前面学的文字、语音、图片、视频能力,编排成一条自动运行的流程。好比一个自动化的「内容流水线」。
举例:一个智能体可以做到「每天早上自动抓热点选题 → 用文字模型生成文案初稿 → 配一张图 → 排进发布计划」。
6.2 国内主流
- 扣子(Coze):低代码,拖拽式搭流程,上手容易,是很多人入门的首选。
- Dify / FastGPT:偏向「知识库 + 智能体」,适合做知识问答、客服、内部助手。
- 文心智能体(百度):和文心生态联动。
6.3 国外主流
- GPTs(OpenAI) / 各类 Agent 平台:可以直接在聊天里调用配置好的助手。
- LangChain、LlamaIndex 等代码框架:是给会写代码的人用的「积木库」,普通人了解概念即可。
6.4 新手选型建议
- 智能体是进阶内容,建议先把单点工具(文字、图片)用熟,再考虑自动化。
- 想接触的话,从**扣子(Coze)**这类低代码平台开始,拖拖拽拽就能理解「流程」是怎么回事。
- 这一整块从 L1-D 智能体/自动化系列 开始系统讲。
七、三个来源怎么看待:国外 / 国内 / 开源
| 来源 |
特点 |
门槛 |
适合谁 |
| 国外工具 |
部分能力领先、英文生态好、选择多 |
注册/付费需海外卡,部分需网络访问 |
想要前沿能力、愿意折腾的人 |
| 国内工具 |
中文好、注册即用、合规省心、免费额度多 |
低 |
绝大多数小白,强烈建议从这里起步 |
| 开源/自托管 |
可控、可定制、数据可本地化 |
高,需一定技术(部署、显卡) |
有技术能力的进阶玩家、对数据敏感的用户 |
给八成读者的建议:先以国内工具为主力把事做成,再把个别国内做不好的环节(如顶级画质、海外平台)用国外工具补充。别一上来就被「国外最强」洗脑——对大多数人来说,「用得动、用得起」比「最强」更重要。
八、搭一套你的「最小工具清单」
不必一次装一堆。建议按下面节奏来:
第一步:先选 1 个文字主力
就一个,选你用得最顺手的(国产优先)。用它处理所有「写和改」。
第二步:加 1 个图片辅助
需要配图时用它。中文生图先从国内工具开始。
第三步:按需加 1 个配音/视频
真正开始做视频内容时再加,不要一开始就摊大饼。
第四步:给自己一个「练习主线」
给自己定一个小目标,比如「用 AI 完成一条小红书图文」或「用 AI 配一条口播视频」,把选好的工具串起来跑一遍。跑通一遍,比收藏 50 个工具都强。
模板速查:我的工具评估卡
遇到任何新工具,都可以用这张卡快速判断值不值得试:
| 维度 |
打钩处 |
| 它解决我哪一类需求(文字/语音/图片/视频/智能体)? |
|
| 注册和上手难度?(国内低/国外中/开源高) |
|
| 有免费额度吗?够我试用吗? |
|
| 中文支持好吗? |
|
| 老手/教程多不多?(好不好学) |
|
| 和我的其他工具能否联动? |
|
五项里有三项以上打得上勾,就值得试;否则基本可以放着以后再说。
FAQ:常见问题解答
Q1:工具这么多,会不会过两天就全变了?
会,而且变得很快。所以本教程教「分类和选型」而不是让你背清单。只要你会分类,新工具出来你也能快速判断它属于哪一类、要不要试。
Q2:国外工具是不是一定比国内强?
不一定。「强不强」要看任务:很多国内工具的中文理解和产品体验反而更好。选工具看「适不适合你、你用不用得起」,别只看「谁宣传得最猛」。
Q3:我需要同时注册很多工具吗?
不需要。建议严格执行「最小清单」:先 1 个文字 + 1 个图片,跑通一条内容再说。
Q4:免费工具和付费的差别大吗?
差别主要体现在额度、速度、部分高级能力上。免费额度足够新手把流程跑熟;等你确定某个工具确实带来价值,再按 L0-5 的成本方法去评估付费。
Q5:我想要的角色/风格,为什么工具总给不出来?
单点工具的能力有边界。想要「稳定出某个人物/某套风格」,往往需要更进阶的控制手段(参考图、LoRA、一致化工具),这在 L2-C 图片系列、L1-B 语音系列里会讲。
进阶避坑指南
坑 1:囤积工具,一个都没用熟
破解:先定一条内容主线,用最少工具跑通它。跑通过程中的「卡点」,才是你扩展工具清单的触发条件。
坑 2:盲目追「最强最新」
新工具刚出来常伴随炒作。等它稳定、等教程多起来再用,并不丢人——效率工具的胜利属于「用得久的人」,不是「下手最早的人」。
坑 3:被「免费试用」套牢
很多工具免费额度有限,试用期一过就开始计费。用之前看清额度规则(详见 L0-5),别让「试一下」变成「不知不觉扣费」。
坑 4:只看名字不看分类
「XX 也出 AI 了」不等于它适合你。先回到分类地图,判断它补的是哪一类能力、你有没有这个需求,再决定要不要花时间去试。
最重要的三句话
- 工具分五类:文字、语音、图片、视频、智能体,先分类再选型。
- 对多数人:国内工具起步最省心,再用个别国外工具补充短板。
- 别囤工具,用最少的一套把一条内容跑通,才是真正的效率。
下一站预告
到这里你已经对工具世界有了一个「地图」,知道每一类大概是干什么的。但「工具」背后还有两件更基础的事要解决:你的账号和网络环境怎么准备(要不要折腾、付费走哪),以及这套工具到底会花你多少钱。
下一课《L0-4 账号与网络环境准备》就来看怎么准备账号、怎么安全地付费。想直接管住钱包的,也可以先跳到《L0-5 成本认知》。
教程版本:v1.0
最后更新:2026-08
内容时效:AI 工具迭代极快,本文的工具清单与代表产品基于截至 2026 年 8 月的信息整理。建议每 3-6 个月回顾一次本课的「分类逻辑」,而不是死记清单——分类永不过时,具体的品牌名字会换。