保姆级教程 · 面向纯小白与自媒体人
项目 信息 课程系列 AI 创作入门 · L1-C 图片/视频 课程编号 L1C-02 板块 L1-C 图片/视频 难度等级 ★★☆☆☆(有一点选择困难,没有编程要求) 适用人群 想找到一款主力出图工具,或已经试过多个平台却始终用不顺的自媒体创作者 预计学时 60-90 分钟 更新日期 2026 年 8 月 前置课程 L1C-01(图像生成基础:原理、提示词与核心参数) 内容声明 产品功能、价格、额度和界面会持续变化,本文讲通用使用方法,具体以各平台官方页面和当前界面为准
学完本教程后,你将能够:
一只圆滚滚的橘猫吉祥物,软萌3D卡通风格,正面半身,干净浅色背景,柔和棚拍光,表情友好,细节丰富
最简单的分法是:
在线工具的优势是快,适合入门和日常创作;本地工具的优势是可控,适合长期批量生产、深度定制和隐私要求高的场景。
不要把“在线”和“本地”理解成质量高低。很多在线平台的默认体验比新手刚装好的本地环境更稳定;本地的上限更高,但需要更多配置和维护。
| 工具/路线 | 使用方式 | 上手门槛 | 风格表现 | 可控程度 | 适合谁 |
|---|---|---|---|---|---|
| Midjourney | 在线网页或社区入口 | 低到中 | 艺术感、氛围感、成片速度强 | 中 | 想快速做高质量视觉草图、封面和概念图的人 |
| Stable Diffusion WebUI | 本地或服务器网页界面 | 中到高 | 模型和 LoRA 丰富,风格范围大 | 高 | 想控制人物、姿势、构图并长期定制的人 |
| 国产在线工具 | 国内网页/App | 低 | 中文理解和国内内容场景顺手 | 中 | 纯小白、中文创作、希望快速出图的人 |
| ComfyUI | 节点式本地/服务器工作流 | 高 | 取决于模型和工作流,上限高 | 很高 | 想搭建可复用流程、批量出图或精细控制的人 |
打开任何工具之前,先回答四个问题:
新手建议:先选一个门槛最低的在线工具跑通“提示词 → 出图 → 导出 → 复盘”,再决定是否进入本地路线。没有真实需求时,安装环境很容易变成另一项拖延。
Midjourney 的典型优势是快速形成完整画面。它通常擅长氛围、色彩、材质、电影感和概念设计,适合:
它不一定是所有任务的最佳选择。需要严格复现同一个人物、精确控制手势、批量保持固定版式时,你往往需要参考图、局部编辑或本地控制工具。
不同版本的网页和入口会变化,但核心流程基本稳定:
1:1,图文封面可用 3:4,短视频素材用 9:16,横版封面用 16:9。第一轮的目标不是得到最终成片,而是确认模型是否理解了主体、风格和画面关系。不要在第一轮同时改十个参数,否则无法判断哪一个改变带来了效果。
A round and chubby orange cat mascot, soft 3D cartoon style, friendly expression, half-body front view, clean light background, soft studio lighting, polished material, centered composition, highly detailed
如果你更习惯中文,先用中文也可以。对英文生态较成熟的工具,使用具体、可观察的英文描述通常更容易得到稳定结果。重点不是单词“高级”,而是让主体、视角、材质、背景和光线可被看见。
Stable Diffusion 通常指一套开放生态,而不是只有一个网页。你会接触到:
新手可以先把它理解成“可更换零件的图像工作台”。在线工具帮你把零件配好了;Stable Diffusion 把选择权交给你,因此自由度高,也更容易装错或配错。
在安装之前,先确认:
如果你使用的是没有合适 GPU 的电脑,不要为了“本地”二字硬装。可以先使用托管 GPU、云端 WebUI 或在线工具验证需求,确认每周确实有稳定使用量后再投入环境。
不同发行版的按钮名称略有差异,但操作顺序可以按下面做:
一只圆滚滚的橘猫吉祥物,软萌3D卡通风格,正面半身,干净浅色背景,柔和棚拍光,表情友好,细节丰富
低清,模糊,水印,文字,多余的手指,畸形,扭曲,复杂背景
| 控件 | 作用 | 初学阶段怎么做 |
|---|---|---|
| Checkpoint | 选择基础模型 | 先固定一个模型,不要频繁切换 |
| Prompt | 描述想要的内容 | 按主体、风格、构图、光影组织 |
| Negative Prompt | 排除常见问题 | 先写低清、水印、畸形等通用项 |
| Width/Height | 设置输出尺寸 | 按发布平台比例选择 |
| Batch size | 一次生成几张 | 先用 2-4 张,避免浪费显存和时间 |
| Steps | 采样步数 | 使用模型推荐范围,再做小幅测试 |
| CFG/引导强度 | 让结果贴近提示词的程度 | 过高可能画面僵硬,先用默认值 |
| Seed | 随机种子 | 看中结果后保存,方便复现 |
满足下面任意两项,就可以认真考虑:
如果只是偶尔做一张氛围图,WebUI 的维护成本可能大于它带来的收益。
国内常见的在线图像工具包括即梦、文心一格、通义万相等。产品名称、模型版本和入口可能变化,但它们普遍有这些共同点:
对于纯小白,这条路线的价值不是“国产一定更强”,而是不用先解决复杂部署问题,可以把创作流程跑起来。
小红书封面:
一桌刚出锅的中式早餐,豆浆、油条、鸡蛋和小碟小菜,清爽国风生活方式摄影,三分之四俯拍,主体集中在画面下方,上方留出标题空间,暖色晨光,干净桌面,高细节,适合小红书竖版封面
视频横版封面:
一台未来感智能设备的产品特写,简洁科技视觉,横版中心构图,主体右侧,左侧留出标题空间,蓝色与青色边缘光,深色干净背景,高对比,材质清晰,适合视频封面
电商主图:
一只白色无线耳机放在浅灰色极简台面上,产品摄影,正面三分之二角度,柔和侧光,阴影自然,背景干净,主体完整,四周留白,商业产品图质感,不要文字不要水印
注意“适合小红书竖版封面”“左侧留出标题空间”这类用途和版式描述。它们不能替代后期设计,但能提高第一版的可用率。
图像模型可以理解“海报”“标题区域”“简洁排版”,但对准确中文字符、数字和品牌名称的处理仍可能不稳定。生产流程建议拆成两步:
只有对文字内容做过人工校对,图片才适合发布。尤其是价格、日期、活动规则、产品参数和人名,不能只看“整体很像”就直接使用。
如果 WebUI 像一个把常用功能放在面板上的工作台,ComfyUI 更像一张可视化流程图。你可以把“加载模型 → 编码提示词 → 采样 → 解码 → 保存”拆成节点,用连线表达数据怎么流动。
它的优势是:
它的代价是学习成本高。节点多不代表效果一定好,复杂工作流也不代表适合新手。
最基础的文生图流程通常可以抽象成:
加载模型
↓
正向/负向提示词编码
↓
采样器生成潜空间图像
↓
解码为可见图片
↓
保存图片
你不需要先记住每个节点的名字,只要能回答:
这四个问题能回答,就已经看懂一条最小流程的骨架。
下载工作流或图片反推工作流后,按顺序检查:
安全提醒:模型、插件和工作流可能来自社区。不要为了“跑通”随意执行不理解的脚本,也不要在陌生节点中填写 API Key、个人资料或客户素材。
建议按四个阶段学习:
先看懂数据流,再追求节点数量。能稳定复现一个简单结果,比收藏一百条复杂工作流更有价值。
| 任务 | 首选路线 | 备选路线 | 选择理由 |
|---|---|---|---|
| 第一次尝试文生图 | 国产在线工具 | Midjourney | 中文直接、入口简单 |
| 做氛围感封面和概念图 | Midjourney | 国产在线工具 | 快速得到多种审美方向 |
| 做中文社交媒体配图 | 国产在线工具 | Midjourney | 中文提示和本地平台场景更顺 |
| 需要指定模型或 LoRA | Stable Diffusion | ComfyUI | 模型生态和参数控制更开放 |
| 需要复杂多步处理 | ComfyUI | Stable Diffusion WebUI | 节点流程可复用、可批量 |
| 需要固定人物与姿势 | Stable Diffusion/ComfyUI | 支持参考图的在线工具 | 控制模块更丰富 |
| 偶尔做一张图 | 在线工具 | 不建议立即本地部署 | 维护成本最低 |
| 客户素材不宜外传 | 私有部署 | 合规的企业版在线服务 | 便于控制数据和权限 |
如果你仍然不知道选谁,用同一组测试题在两到三个工具中各做一次:
可以用下面的评分表:
| 维度 | 权重 | 工具 A | 工具 B | 工具 C |
|---|---|---|---|---|
| 第一次可用率 | 30% | |||
| 修改和控制 | 25% | |||
| 生成速度 | 15% | |||
| 成本 | 15% | |||
| 导出与商用条件 | 15% |
每项按 1-5 分打分。对自媒体创作者来说,“第一次可用率”和“修改是否省事”常常比排行榜上的最高画质更重要。
组合不必一次配齐。你的主力工具应该是“能持续打开、能稳定出片、成本看得懂”的那一个。
写下这张图最终要去哪儿。比如:“小红书竖版首图,标题后期添加”。用途决定比例、留白和细节重点。
复制下面这段,在测试期间不要改主体描述:
一桌刚出锅的中式早餐,豆浆、油条、鸡蛋和小碟小菜,清爽国风生活方式摄影,三分之四俯拍,主体集中在画面下方,上方留出标题空间,暖色晨光,干净桌面,高细节,适合小红书竖版封面
建议选择一个自己最容易访问的国产在线工具,再选择 Midjourney 或另一个在线工具。如果电脑有本地环境,可以把 Stable Diffusion 加进来,但不要把安装问题混进本次横评。
所有工具都使用接近的竖版比例,每个工具生成 4 张。工具不支持完全相同比例时,记录实际比例,不要为了表面一致强行裁切。
逐张检查:
选每个工具中最有潜力的一张,只改一个问题。例如背景杂乱就加“背景干净、留白更多”;主体太小就改“主体占画面约三分之二”。再次生成后,比较修改是否有效。
不要写“某工具最好”这种无条件结论,而要写成:
对我当前的小红书美食封面需求,工具 A 的第一次可用率最高,工具 B 的风格更有冲击力;日常赶稿用 A,需要做视觉方向探索时用 B。
这才是一份真正能指导后续创作的选型结果。
如果你想尽快出图,先学 Midjourney 或国产在线工具;如果你已经明确需要模型、LoRA、姿势和人物一致性控制,再学 Stable Diffusion。学习顺序不影响以后迁移,但先跑通真实需求更容易坚持。
不一定。先区分是审美方向不合适、提示词没写清、构图不适合用途,还是模型能力确实不匹配。可以用同一组提示词横评,再决定是否更换。很多封面最终还需要排版和裁切,不是单看原图就能判断成品质量。
软件和部分模型可能免费,但电脑、显卡、电费、云 GPU、存储和维护都有成本;模型和插件也可能有不同授权。免费不等于可以无条件商用,使用前要看具体许可。
可以。ComfyUI 是进阶工具,不是所有创作者的必修课。你只做封面和普通配图,在线工具或简单 WebUI 可能已经够用;当你需要重复执行相同流程、批量生成或接入多个控制模块时,再学习它的收益更明显。
因为基础模型、训练数据、提示词解析方式、默认参数和后处理都不同。上一课的五块结构是通用思路,不是跨平台完全相同的语法。换工具时,先参考它自己的官方示例和参数说明。
先检查模型文件、插件版本、输入图片路径和显存是否满足要求。不要立刻安装一堆来历不明的插件;如果无法确认工作流来源和节点作用,换一个更小、更可信的示例验证环境。
把文字从图片生成环节拆出去。先生成留白合理的背景和主体,再用排版工具输入准确文字。模型生成的标题、价格、日期、品牌名都必须人工校对。
不能只根据“生成成功”判断。要同时检查平台服务条款、模型授权、参考图和素材的版权、人物肖像或商标风险,以及发布平台是否要求 AI 内容标识。客户项目还应保留工具、版本、素材来源和授权记录。
工具数量不会自动提升产能。先选一个主力,完成一张真实封面并发布或交付,再考虑扩展工具链。
一张图好不好,还取决于选题、构图、留白、文字层级、裁切和发布尺寸。生成模型只负责其中一段,不能替代完整设计。
一张惊艳的样片不代表适合日常生产。真正要比较的是:不满意时能否快速修正,能否重复得到相近结果,以及一周后还能不能找回同样的设置。
看到好图却找不回来源,等于丢失了一次可复用经验。至少记录日期、工具、模型或版本、提示词、比例、种子(若有)和后期操作。
本地路线解决的是控制、隐私、复现和长期定制问题,不是所有人的“升级必经之路”。先计算使用频率、显卡投入、维护时间和实际收益。
你现在已经知道用什么工具出图,也能完成一次工具横评。但真正做自媒体时,难点往往不是“能不能出一张”,而是能不能稳定做出一组封面、配图和人物形象,并且让它们看起来像同一个账号的内容。
下一课《L2-C3 自媒体视觉场景实战》会从封面、配图、IP 形象、海报、Banner、信息图和商品主图入手,把“生成一张图”推进到“交付一套可发布的视觉素材”。
教程版本:v1.0 最后更新:2026-08 内容时效:工具名称、模型版本、价格、免费额度和界面会随厂商调整;本文保留的是选型方法、实操顺序和质量检查标准,具体按钮以实际平台为准。