保姆级教程 · 面向纯小白与自媒体人
项目 信息 课程系列 AI 创作入门 · L1-C 图片/视频 课程编号 L1C-01 板块 L1-C 图片/视频 难度等级 ★☆☆☆☆(零基础友好) 适用人群 没生成过 AI 图片、或生出来的图总觉得「差口气」的自媒体创作者 预计学时 45-60 分钟 更新日期 2026 年 8 月 内容声明 本教程为通用图像生成知识,适用于即梦、Midjourney、Stable Diffusion、通义万相等主流工具,不绑定特定平台
学完本教程后,你将能够:
文生图 = 让模型看懂了你的文字描述,再从一堆「噪声」里逐渐拼出符合描述的清晰画面。
想象一张高清照片被一层一层加了噪声(马赛克/雪花),最后变成一片纯噪声,什么都看不清。
「扩散」模型做的,就是把这个过程反过来:从一片纯「雪花点」开始,一步一步「擦掉」噪声、慢慢浮现出轮廓、细节、明暗,最终得到一张清晰的图。
而「你敲的命令词」是怎么掺进来的?模型在每一「步擦除」时,都会参考你的文字描述——你写「一只橘猫坐在窗台」,它就往「像猫、像窗台」的方向擦;你没写的,它就自由发挥。
所以你得明白一件事:模型是「猜」的。 它按你的文字和它学过的海量图片来猜画面。你描述得越清楚,它猜得越准;你没说的部分,它就会随机编。
因为所有「生成出来不对」的根源,基本都在这两句话里:
下面两节,分别解决「词」和「参数」的问题。
「会写提示词」不是文采好,而是结构完整。一套靠谱的提示词,建议按下面五块来组织:
| 板块 | 管什么 | 举例 |
|---|---|---|
| ① 主体 | 画面里最主要的东西 | 一只橘猫、一位穿汉服的少女 |
| ② 风格 | 什么画风/摄影风格 | 水彩、3D 卡通、赛博朋克、电影感、写实摄影 |
| ③ 构图 | 取景角度、布局 | 特写、全身、俯视、居中构图、三分法 |
| ④ 光影 | 光线与氛围 | 黄昏逆光、柔光、霓虹灯、晨雾 |
| ⑤ 质量词 | 提画质、补细节 | 高清、细节丰富、8K、杰作、锐利 |
主体 + 风格 + 构图 + 光影 + 质量词
示例(拆开看):
一位穿汉服的少女,水墨风格,半身特写,黄昏逆光,细节丰富,高清新手最大误区:只写「画一只猫」。剩下的全靠模型乱猜,于是出来的猫五花八门。把五块都想想,图就稳多了。
除了文字,工具通常会给你几个可调参数。每个参数只干一件明确的事,逐个记住就行:
画面的宽高比例。
1:1(正方形,适合头像)、3:4/4:3(竖/横,适合图文封面)、9:16(竖屏短视频)、16:9(横屏视频/公众号)。一个「随机编号」。同一个提示词 + 同一个种子 = 大概率得到同一张图(可复现)。
模型「擦噪声」擦多少步。
同一段话里,你可以「加重」某个词。
(词:1.5)、[词:0.8] 或双括号):数字越大越强调,越小越削弱。| 参数 | 一句话作用 | 新手建议 |
|---|---|---|
| 比例 | 决定画面宽高 | 按发布平台先定 |
| 种子 | 复现同一张图 | 锁图微调时用 |
| 采样步数 | 擦噪声的步数 | 用默认附近,别拉满 |
| 权重 | 强调/削弱某个词 | 个别词不准时小幅调 |
先定「画什么」。别急着一口气写成句子,先把核心主体写出来。
例:我想画一张「国风少女在竹林里」的图。
按「主体+风格+构图+光影+质量词」把风格、构图、光影、质量词补上。
完整:
国风少女,古装,站在竹林里,水墨国潮风格,半身构图,清晨薄雾,柔和逆光,细节丰富,高清
想好发在哪——小红书封面(3:4)、公众号头图(16:9)、头像(1:1),先设好比例。
用默认参数先出一版。不要一上来就调一堆参数,先看提示词对不对。
看出来的图,分两种情况处理:
对满意的一张记下它的种子,锁定后只改你想改的一小处(换配色、换角度),保持其他不变,精准迭代。
按用途选尺寸/格式导出,存进你的素材库。
除了「要什么」,你还可以告诉它「不要什么」。很多工具支持负向提示词(Negative Prompt)。
负向提示词里写:低清,模糊,水印,文字,多余的手指,畸形,扭曲,塑料感
注意:负向提示词是「辅助排雷」,不是万能。如果主体本来就错了,负向提示词救不回来——那得改正向提示词。
一碗热气腾腾的中式早餐豆浆油条,国风水墨背景,俯视45度,暖黄晨光,构图饱满,细节丰富,高清3:4未来感的智能设备特写,赛博朋克霓虹风格,中心构图,蓝紫冷光,景深,高对比,细节丰富,8K16:9一只圆滚滚的橘猫吉祥物,软萌3D卡通风格,正面特写,柔和棚拍光,干净背景,清晰,细节丰富1:1[主体描述],[风格],[构图/取景],[光影/氛围],[质量词]
填写卡:
存成你自己的「出图模板」,下次换个主体就能套用。
「高清 8K」只是质量词,决定图糊不糊的还有基础分辨率和工具本身。加质量词有助,但不是唯一变量;换个更高分辨率输出或换工具可能更有效。
因为模型是随机的。想要复现,就锁定同一个种子。不锁种子,每次都是新的随机画面。
加负向提示词(多余手指、畸形、扭曲),同时确保主体提示词写清楚(是「一只手」而不是含糊)。人物脸畸形的,常和参考图/特定模型有关,进阶去 L2-C4 一致性篇。
国内工具中英文都行,中文即可;Midjourney 等英文生态更成熟的,用英文往往更准。按工具习惯来,能用哪个写清楚就用哪个。
多数工具可以选一次出几张、每张是否可变。需求稳定后,通常一次出多张挑一张,省时间。
记住常用映射:头像 1:1、图文封面 3:4 或 4:3、公众号横图 16:9、短视频竖屏 9:16。不确定就看平台要求。
参数是修表的螺丝刀,不是开机键。先让提示词对,再微调参数,否则你都不知道是哪个变量惹的祸。
不要写「我要一副美轮美奂的画…」这种语气词。给结构化的关键词(主体/风格/构图/光影),比抒情长句有效得多。
负向提示词是性价比最高的「排雷」手段之一,很多新手压根不知道它存在。出图总有小瑕疵,先想到它。
权重不是越大越好,拉满容易让画面失衡、过拟合某个元素。小幅调整、多次试,比一次拉满更稳。
你已经会写基础提示词、会调核心参数、会用负向排除问题了。但工具那么多——Midjourney、Stable Diffusion、国产的即梦/文心一格……它们各有各的界面和玩法,哪个适合你?
下一课《L2-C2 主流图像工具上手》逐个带你把主流工具过一遍,并教你按自己的需求选一个主力的出图工具。
教程版本:v1.0 最后更新:2026-08 内容时效:扩散模型的概念、提示词结构、参数作用属于长期通用的基础,多年不过时;文中提及的具体工具与默认值会随版本更新,以你实际使用的工具界面为准。