L2-C2 主流图像工具上手:Midjourney、Stable Diffusion、国产工具与 ComfyUI

保姆级教程 · 面向纯小白与自媒体人

项目 信息
课程系列 AI 创作入门 · L1-C 图片/视频
课程编号 L1C-02
板块 L1-C 图片/视频
难度等级 ★★☆☆☆(有一点选择困难,没有编程要求)
适用人群 想找到一款主力出图工具,或已经试过多个平台却始终用不顺的自媒体创作者
预计学时 60-90 分钟
更新日期 2026 年 8 月
前置课程 L1C-01(图像生成基础:原理、提示词与核心参数)
内容声明 产品功能、价格、额度和界面会持续变化,本文讲通用使用方法,具体以各平台官方页面和当前界面为准

学习目标

学完本教程后,你将能够:

  1. 分清四类图像工具:Midjourney、Stable Diffusion、国产在线工具、ComfyUI 分别解决什么问题。
  2. 独立完成第一次出图:至少用一种在线工具生成一张符合用途和比例的图片。
  3. 理解工具的核心差异:操作门槛、风格表现、可控程度、速度、成本与隐私。
  4. 知道什么时候该换工具:不再因为一张图不满意就盲目更换模型或堆提示词。
  5. 建立主力工具 + 备用工具的组合,为后面的封面、系列图、人物一致性和局部重绘做准备。
  6. 看懂 ComfyUI 工作流的基本结构,即使暂时不安装,也能理解节点、模型和输出之间的关系。

前置准备

你需要什么

一只圆滚滚的橘猫吉祥物,软萌3D卡通风格,正面半身,干净浅色背景,柔和棚拍光,表情友好,细节丰富

你不需要什么


一、先看懂:四类工具到底有什么不同

1.1 在线工具和本地工具

最简单的分法是:

在线工具的优势是快,适合入门和日常创作;本地工具的优势是可控,适合长期批量生产、深度定制和隐私要求高的场景。

不要把“在线”和“本地”理解成质量高低。很多在线平台的默认体验比新手刚装好的本地环境更稳定;本地的上限更高,但需要更多配置和维护。

1.2 四类工具速查表

工具/路线 使用方式 上手门槛 风格表现 可控程度 适合谁
Midjourney 在线网页或社区入口 低到中 艺术感、氛围感、成片速度强 想快速做高质量视觉草图、封面和概念图的人
Stable Diffusion WebUI 本地或服务器网页界面 中到高 模型和 LoRA 丰富,风格范围大 想控制人物、姿势、构图并长期定制的人
国产在线工具 国内网页/App 中文理解和国内内容场景顺手 纯小白、中文创作、希望快速出图的人
ComfyUI 节点式本地/服务器工作流 取决于模型和工作流,上限高 很高 想搭建可复用流程、批量出图或精细控制的人

1.3 先按这四个问题筛选

打开任何工具之前,先回答四个问题:

  1. **我要多快看到第一版?**今天就要发,优先在线工具。
  2. **我需要控制什么?**只要氛围和风格,不必上复杂节点;要固定姿势、人物和构图,需要更强控制。
  3. **我会不会长期重复生产?**偶尔做一张,不值得为环境维护付出太多;每周批量生产,可考虑本地路线。
  4. **素材是否敏感?**涉及未公开商品、客户资料或内部视觉资产,先确认平台的数据使用和存储条款,必要时选择私有部署。

新手建议:先选一个门槛最低的在线工具跑通“提示词 → 出图 → 导出 → 复盘”,再决定是否进入本地路线。没有真实需求时,安装环境很容易变成另一项拖延。


二、Midjourney 上手:快速得到有审美的画面

2.1 Midjourney 适合什么

Midjourney 的典型优势是快速形成完整画面。它通常擅长氛围、色彩、材质、电影感和概念设计,适合:

它不一定是所有任务的最佳选择。需要严格复现同一个人物、精确控制手势、批量保持固定版式时,你往往需要参考图、局部编辑或本地控制工具。

2.2 第一次出图的通用流程

不同版本的网页和入口会变化,但核心流程基本稳定:

  1. 登录 Midjourney 的网页或当前官方提供的创作入口。
  2. 找到图像生成输入框,粘贴上一节的橘猫提示词。
  3. 先设置用途对应的比例。头像用 1:1,图文封面可用 3:4,短视频素材用 9:16,横版封面用 16:9
  4. 提交生成,等待一组候选图。
  5. 先挑“主体正确、构图可用”的图,再做放大、变体或编辑。
  6. 下载原图,同时记录提示词、比例和工具版本。

第一轮的目标不是得到最终成片,而是确认模型是否理解了主体、风格和画面关系。不要在第一轮同时改十个参数,否则无法判断哪一个改变带来了效果。

2.3 一段适合 Midjourney 的提示词

A round and chubby orange cat mascot, soft 3D cartoon style, friendly expression, half-body front view, clean light background, soft studio lighting, polished material, centered composition, highly detailed

如果你更习惯中文,先用中文也可以。对英文生态较成熟的工具,使用具体、可观察的英文描述通常更容易得到稳定结果。重点不是单词“高级”,而是让主体、视角、材质、背景和光线可被看见。

2.4 常见操作怎么选

2.5 Midjourney 的三个避坑点

  1. 文字排版不要完全交给模型。海报里的中文标题、价格和按钮文字容易出现错别字。更稳的做法是先生成干净画面,再在设计软件或剪辑软件中排字。
  2. 不要把参数当提示词。比例、版本、风格化等参数要按当前界面支持的方式填写,不要把网上旧教程的写法原样套用。
  3. 注意社区环境和素材权限。公开频道、公开作品和商业使用条款需要分开看,尤其是客户项目和未发布产品图。

三、Stable Diffusion WebUI 上手:本地可控的工作台

3.1 Stable Diffusion 是什么

Stable Diffusion 通常指一套开放生态,而不是只有一个网页。你会接触到:

新手可以先把它理解成“可更换零件的图像工作台”。在线工具帮你把零件配好了;Stable Diffusion 把选择权交给你,因此自由度高,也更容易装错或配错。

3.2 安装前先确认硬件

在安装之前,先确认:

如果你使用的是没有合适 GPU 的电脑,不要为了“本地”二字硬装。可以先使用托管 GPU、云端 WebUI 或在线工具验证需求,确认每周确实有稳定使用量后再投入环境。

3.3 WebUI 的第一次出图流程

不同发行版的按钮名称略有差异,但操作顺序可以按下面做:

  1. 启动 WebUI,打开它输出的本地网页地址。
  2. 选择一个与任务匹配的基础模型,不要同时加载多个模型。
  3. 在正向提示词中填写:
一只圆滚滚的橘猫吉祥物,软萌3D卡通风格,正面半身,干净浅色背景,柔和棚拍光,表情友好,细节丰富
  1. 在负向提示词中填写:
低清,模糊,水印,文字,多余的手指,畸形,扭曲,复杂背景
  1. 设置宽高和批量数量。第一次建议使用中等尺寸、一次生成 2-4 张。
  2. 先使用模型推荐的默认采样器、步数和引导强度。
  3. 点击生成,观察结果,保存可用图片和生成信息。
  4. 只修改一个变量,再生成第二轮。

3.4 新手应该先认识哪些控件

控件 作用 初学阶段怎么做
Checkpoint 选择基础模型 先固定一个模型,不要频繁切换
Prompt 描述想要的内容 按主体、风格、构图、光影组织
Negative Prompt 排除常见问题 先写低清、水印、畸形等通用项
Width/Height 设置输出尺寸 按发布平台比例选择
Batch size 一次生成几张 先用 2-4 张,避免浪费显存和时间
Steps 采样步数 使用模型推荐范围,再做小幅测试
CFG/引导强度 让结果贴近提示词的程度 过高可能画面僵硬,先用默认值
Seed 随机种子 看中结果后保存,方便复现

3.5 WebUI 什么时候值得用

满足下面任意两项,就可以认真考虑:

如果只是偶尔做一张氛围图,WebUI 的维护成本可能大于它带来的收益。


四、国产图像工具上手:中文场景的低门槛路线

4.1 常见工具怎么理解

国内常见的在线图像工具包括即梦、文心一格、通义万相等。产品名称、模型版本和入口可能变化,但它们普遍有这些共同点:

对于纯小白,这条路线的价值不是“国产一定更强”,而是不用先解决复杂部署问题,可以把创作流程跑起来

4.2 通用上手步骤

  1. 登录工具官网或 App,确认当前账号的免费额度和生成权益。
  2. 选择“文生图”或相近入口。
  3. 先输入 L1C-01 的五块提示词,不要一开始就写抽象的情绪作文。
  4. 选择比例和生成数量,按目标平台设置。
  5. 生成多张候选图,优先比较主体是否正确、留白是否足够、视觉重点是否明确。
  6. 使用平台提供的变体、扩图、消除或局部重绘功能继续修改。
  7. 导出前检查分辨率、是否带水印、是否允许商用和是否需要标注 AI 生成。

4.3 适合直接套用的中文提示词

小红书封面:

一桌刚出锅的中式早餐,豆浆、油条、鸡蛋和小碟小菜,清爽国风生活方式摄影,三分之四俯拍,主体集中在画面下方,上方留出标题空间,暖色晨光,干净桌面,高细节,适合小红书竖版封面

视频横版封面:

一台未来感智能设备的产品特写,简洁科技视觉,横版中心构图,主体右侧,左侧留出标题空间,蓝色与青色边缘光,深色干净背景,高对比,材质清晰,适合视频封面

电商主图:

一只白色无线耳机放在浅灰色极简台面上,产品摄影,正面三分之二角度,柔和侧光,阴影自然,背景干净,主体完整,四周留白,商业产品图质感,不要文字不要水印

注意“适合小红书竖版封面”“左侧留出标题空间”这类用途和版式描述。它们不能替代后期设计,但能提高第一版的可用率。

4.4 文字生成为什么仍然要后期排版

图像模型可以理解“海报”“标题区域”“简洁排版”,但对准确中文字符、数字和品牌名称的处理仍可能不稳定。生产流程建议拆成两步:

  1. 用模型生成主体、背景、装饰和留白;
  2. 在剪映、醒图、Canva、稿定设计或其他排版工具中添加准确文字。

只有对文字内容做过人工校对,图片才适合发布。尤其是价格、日期、活动规则、产品参数和人名,不能只看“整体很像”就直接使用。


五、ComfyUI 入门:把出图流程拆成节点

5.1 ComfyUI 解决什么问题

如果 WebUI 像一个把常用功能放在面板上的工作台,ComfyUI 更像一张可视化流程图。你可以把“加载模型 → 编码提示词 → 采样 → 解码 → 保存”拆成节点,用连线表达数据怎么流动。

它的优势是:

它的代价是学习成本高。节点多不代表效果一定好,复杂工作流也不代表适合新手。

5.2 先认识一条最小工作流

最基础的文生图流程通常可以抽象成:

加载模型
   ↓
正向/负向提示词编码
   ↓
采样器生成潜空间图像
   ↓
解码为可见图片
   ↓
保存图片

你不需要先记住每个节点的名字,只要能回答:

这四个问题能回答,就已经看懂一条最小流程的骨架。

5.3 导入别人工作流时的检查顺序

下载工作流或图片反推工作流后,按顺序检查:

  1. 模型文件是否缺失:缺少模型时,节点可能显示红色或无法运行。
  2. 自定义节点是否需要安装:不要为了一个陌生工作流安装来源不明的插件。
  3. 输入图片和遮罩路径是否正确:尤其是图生图和局部重绘。
  4. 输出尺寸是否过大:先用较小尺寸验证逻辑,避免等待很久或占满显存。
  5. 节点连线是否完整:从输入一路检查到预览和保存。
  6. 是否包含外部请求或未知脚本:工作流文件本身也要当作第三方资产审阅。

安全提醒:模型、插件和工作流可能来自社区。不要为了“跑通”随意执行不理解的脚本,也不要在陌生节点中填写 API Key、个人资料或客户素材。

5.4 新手的学习顺序

建议按四个阶段学习:

先看懂数据流,再追求节点数量。能稳定复现一个简单结果,比收藏一百条复杂工作流更有价值。


六、四类工具的真实选型

6.1 按任务选

任务 首选路线 备选路线 选择理由
第一次尝试文生图 国产在线工具 Midjourney 中文直接、入口简单
做氛围感封面和概念图 Midjourney 国产在线工具 快速得到多种审美方向
做中文社交媒体配图 国产在线工具 Midjourney 中文提示和本地平台场景更顺
需要指定模型或 LoRA Stable Diffusion ComfyUI 模型生态和参数控制更开放
需要复杂多步处理 ComfyUI Stable Diffusion WebUI 节点流程可复用、可批量
需要固定人物与姿势 Stable Diffusion/ComfyUI 支持参考图的在线工具 控制模块更丰富
偶尔做一张图 在线工具 不建议立即本地部署 维护成本最低
客户素材不宜外传 私有部署 合规的企业版在线服务 便于控制数据和权限

6.2 用一个小测试替代纠结

如果你仍然不知道选谁,用同一组测试题在两到三个工具中各做一次:

  1. 同一主体:橘猫吉祥物;
  2. 同一用途:小红书竖版封面;
  3. 同一要求:主体完整、上方留白、背景干净;
  4. 同一输出数量:每个工具生成 4 张;
  5. 记录五项结果:可用图数量、等待时间、修改难度、导出限制、实际成本。

可以用下面的评分表:

维度 权重 工具 A 工具 B 工具 C
第一次可用率 30%
修改和控制 25%
生成速度 15%
成本 15%
导出与商用条件 15%

每项按 1-5 分打分。对自媒体创作者来说,“第一次可用率”和“修改是否省事”常常比排行榜上的最高画质更重要。

6.3 推荐的新手组合

组合不必一次配齐。你的主力工具应该是“能持续打开、能稳定出片、成本看得懂”的那一个。


七、分步实操:完成一次工具横评

第 1 步:明确发布用途

写下这张图最终要去哪儿。比如:“小红书竖版首图,标题后期添加”。用途决定比例、留白和细节重点。

第 2 步:固定提示词

复制下面这段,在测试期间不要改主体描述:

一桌刚出锅的中式早餐,豆浆、油条、鸡蛋和小碟小菜,清爽国风生活方式摄影,三分之四俯拍,主体集中在画面下方,上方留出标题空间,暖色晨光,干净桌面,高细节,适合小红书竖版封面

第 3 步:选择两个工具

建议选择一个自己最容易访问的国产在线工具,再选择 Midjourney 或另一个在线工具。如果电脑有本地环境,可以把 Stable Diffusion 加进来,但不要把安装问题混进本次横评。

第 4 步:统一比例和数量

所有工具都使用接近的竖版比例,每个工具生成 4 张。工具不支持完全相同比例时,记录实际比例,不要为了表面一致强行裁切。

第 5 步:按标准打分

逐张检查:

第 6 步:只做一次修改

选每个工具中最有潜力的一张,只改一个问题。例如背景杂乱就加“背景干净、留白更多”;主体太小就改“主体占画面约三分之二”。再次生成后,比较修改是否有效。

第 7 步:得出自己的结论

不要写“某工具最好”这种无条件结论,而要写成:

对我当前的小红书美食封面需求,工具 A 的第一次可用率最高,工具 B 的风格更有冲击力;日常赶稿用 A,需要做视觉方向探索时用 B。

这才是一份真正能指导后续创作的选型结果。


八、常见问题 FAQ

Q1:我应该先学 Midjourney 还是 Stable Diffusion?

如果你想尽快出图,先学 Midjourney 或国产在线工具;如果你已经明确需要模型、LoRA、姿势和人物一致性控制,再学 Stable Diffusion。学习顺序不影响以后迁移,但先跑通真实需求更容易坚持。

Q2:国产工具生成的图不够“高级”,是不是一定要换 Midjourney?

不一定。先区分是审美方向不合适、提示词没写清、构图不适合用途,还是模型能力确实不匹配。可以用同一组提示词横评,再决定是否更换。很多封面最终还需要排版和裁切,不是单看原图就能判断成品质量。

Q3:Stable Diffusion 是不是完全免费?

软件和部分模型可能免费,但电脑、显卡、电费、云 GPU、存储和维护都有成本;模型和插件也可能有不同授权。免费不等于可以无条件商用,使用前要看具体许可。

Q4:ComfyUI 看起来太复杂,可以跳过吗?

可以。ComfyUI 是进阶工具,不是所有创作者的必修课。你只做封面和普通配图,在线工具或简单 WebUI 可能已经够用;当你需要重复执行相同流程、批量生成或接入多个控制模块时,再学习它的收益更明显。

Q5:为什么同一条提示词在不同工具里差异很大?

因为基础模型、训练数据、提示词解析方式、默认参数和后处理都不同。上一课的五块结构是通用思路,不是跨平台完全相同的语法。换工具时,先参考它自己的官方示例和参数说明。

Q6:我下载的工作流打不开怎么办?

先检查模型文件、插件版本、输入图片路径和显存是否满足要求。不要立刻安装一堆来历不明的插件;如果无法确认工作流来源和节点作用,换一个更小、更可信的示例验证环境。

Q7:图片里有文字乱码,怎么处理?

把文字从图片生成环节拆出去。先生成留白合理的背景和主体,再用排版工具输入准确文字。模型生成的标题、价格、日期、品牌名都必须人工校对。

Q8:生成的图片能直接商用吗?

不能只根据“生成成功”判断。要同时检查平台服务条款、模型授权、参考图和素材的版权、人物肖像或商标风险,以及发布平台是否要求 AI 内容标识。客户项目还应保留工具、版本、素材来源和授权记录。


九、进阶避坑指南

坑 1:收藏工具,却没有完成作品

工具数量不会自动提升产能。先选一个主力,完成一张真实封面并发布或交付,再考虑扩展工具链。

坑 2:把模型能力和设计能力混为一谈

一张图好不好,还取决于选题、构图、留白、文字层级、裁切和发布尺寸。生成模型只负责其中一段,不能替代完整设计。

坑 3:只看最高画质,忽略修改成本

一张惊艳的样片不代表适合日常生产。真正要比较的是:不满意时能否快速修正,能否重复得到相近结果,以及一周后还能不能找回同样的设置。

坑 4:没有记录提示词和参数

看到好图却找不回来源,等于丢失了一次可复用经验。至少记录日期、工具、模型或版本、提示词、比例、种子(若有)和后期操作。

坑 5:为了本地部署而本地部署

本地路线解决的是控制、隐私、复现和长期定制问题,不是所有人的“升级必经之路”。先计算使用频率、显卡投入、维护时间和实际收益。

最重要的三句话

  1. 在线工具解决“马上出图”,本地工具解决“长期可控”。
  2. 选工具看真实任务,不要只看排行榜和宣传图。
  3. 先用同一需求做小规模横评,再确定主力和备用。

下一站预告

你现在已经知道用什么工具出图,也能完成一次工具横评。但真正做自媒体时,难点往往不是“能不能出一张”,而是能不能稳定做出一组封面、配图和人物形象,并且让它们看起来像同一个账号的内容。

下一课《L2-C3 自媒体视觉场景实战》会从封面、配图、IP 形象、海报、Banner、信息图和商品主图入手,把“生成一张图”推进到“交付一套可发布的视觉素材”。


教程版本:v1.0 最后更新:2026-08 内容时效:工具名称、模型版本、价格、免费额度和界面会随厂商调整;本文保留的是选型方法、实操顺序和质量检查标准,具体按钮以实际平台为准。