L2-C1 图像生成基础:原理、提示词与核心参数

保姆级教程 · 面向纯小白与自媒体人

项目 信息
课程系列 AI 创作入门 · L1-C 图片/视频
课程编号 L1C-01
板块 L1-C 图片/视频
难度等级 ★☆☆☆☆(零基础友好)
适用人群 没生成过 AI 图片、或生出来的图总觉得「差口气」的自媒体创作者
预计学时 45-60 分钟
更新日期 2026 年 8 月
内容声明 本教程为通用图像生成知识,适用于即梦、Midjourney、Stable Diffusion、通义万相等主流工具,不绑定特定平台

学习目标

学完本教程后,你将能够:

  1. 用大白话讲清楚「文生图」背后的扩散模型到底是怎么把文字变成图片的(不涉及复杂公式)。
  2. 写出一句结构完整的好提示词:主体 + 风格 + 构图 + 光影 + 质量词五个部分都能想到。
  3. 看懂并调节核心参数:比例、种子(seed)、采样步数、提示词权重,知道它们各管什么。
  4. 用负向提示词主动排除不想要的东西(畸形、水印、多余手指等)。
  5. 判断一张图不好,大概率是哪里出了问题、该改提示词还是改参数。

前置准备

你需要什么

你不需要什么


核概念一:文生图是怎么工作的(三分钟人话版)

一句话定义

文生图 = 让模型看懂了你的文字描述,再从一堆「噪声」里逐渐拼出符合描述的清晰画面。

通俗讲解:扩散模型的「倒着擦」

想象一张高清照片被一层一层加了噪声(马赛克/雪花),最后变成一片纯噪声,什么都看不清。

「扩散」模型做的,就是把这个过程反过来:从一片纯「雪花点」开始,一步一步「擦掉」噪声、慢慢浮现出轮廓、细节、明暗,最终得到一张清晰的图。

而「你敲的命令词」是怎么掺进来的?模型在每一「步擦除」时,都会参考你的文字描述——你写「一只橘猫坐在窗台」,它就往「像猫、像窗台」的方向擦;你没写的,它就自由发挥。

所以你得明白一件事:模型是「猜」的。 它按你的文字和它学过的海量图片来猜画面。你描述得越清楚,它猜得越准;你没说的部分,它就会随机编。

你为什么需要理解这个

因为所有「生成出来不对」的根源,基本都在这两句话里:

  1. 它按你给的词去猜 → 词没写清,图就不准(提示词问题)。
  2. 它有一套随机过程 → 同样的词可能出不同的图(参数/种子问题)。

下面两节,分别解决「词」和「参数」的问题。


核概念二:提示词结构——把一句话拆成五块

「会写提示词」不是文采好,而是结构完整。一套靠谱的提示词,建议按下面五块来组织:

板块 管什么 举例
① 主体 画面里最主要的东西 一只橘猫、一位穿汉服的少女
② 风格 什么画风/摄影风格 水彩、3D 卡通、赛博朋克、电影感、写实摄影
③ 构图 取景角度、布局 特写、全身、俯视、居中构图、三分法
④ 光影 光线与氛围 黄昏逆光、柔光、霓虹灯、晨雾
⑤ 质量词 提画质、补细节 高清、细节丰富、8K、杰作、锐利

组织成一句话的套路

主体 + 风格 + 构图 + 光影 + 质量词

示例(拆开看):

新手最大误区:只写「画一只猫」。剩下的全靠模型乱猜,于是出来的猫五花八门。把五块都想想,图就稳多了。


核概念三:核心参数——它们各管什么

除了文字,工具通常会给你几个可调参数。每个参数只干一件明确的事,逐个记住就行:

3.1 比例(Aspect Ratio)

画面的宽高比例。

3.2 种子(Seed)

一个「随机编号」。同一个提示词 + 同一个种子 = 大概率得到同一张图(可复现)。

3.3 采样步数(Steps)

模型「擦噪声」擦多少步。

3.4 提示词权重

同一段话里,你可以「加重」某个词。

3.5 一张速查表

参数 一句话作用 新手建议
比例 决定画面宽高 按发布平台先定
种子 复现同一张图 锁图微调时用
采样步数 擦噪声的步数 用默认附近,别拉满
权重 强调/削弱某个词 个别词不准时小幅调

分步实操:从一句词到一张满意的图

第 1 步:写下主体

先定「画什么」。别急着一口气写成句子,先把核心主体写出来。

例:我想画一张「国风少女在竹林里」的图。

第 2 步:补齐四块

按「主体+风格+构图+光影+质量词」把风格、构图、光影、质量词补上。

完整:国风少女,古装,站在竹林里,水墨国潮风格,半身构图,清晨薄雾,柔和逆光,细节丰富,高清

第 3 步:决定比例

想好发在哪——小红书封面(3:4)、公众号头图(16:9)、头像(1:1),先设好比例。

第 4 步:先生成看效果

用默认参数先出一版。不要一上来就调一堆参数,先看提示词对不对。

第 5 步:看图诊断

看出来的图,分两种情况处理:

第 6 步:锁定种子微调

对满意的一张记下它的种子,锁定后只改你想改的一小处(换配色、换角度),保持其他不变,精准迭代。

第 7 步:导出存档

按用途选尺寸/格式导出,存进你的素材库。


拓展:负向提示词——主动「排雷」

除了「要什么」,你还可以告诉它「不要什么」。很多工具支持负向提示词(Negative Prompt)

它能帮你排除的常见问题

用法示例

负向提示词里写:低清,模糊,水印,文字,多余的手指,畸形,扭曲,塑料感

注意:负向提示词是「辅助排雷」,不是万能。如果主体本来就错了,负向提示词救不回来——那得改正向提示词。


案例实战

案例一:小红书封面(国风美食)

案例二:视频封面(科技感)

案例三:IP 人物形象(可爱风)


模板速查:图像生成提示词模板

[主体描述],[风格],[构图/取景],[光影/氛围],[质量词]

填写卡:

存成你自己的「出图模板」,下次换个主体就能套用。


FAQ:常见问题解答

Q1:为什么我写了「高清 8K」,出来的图还是糊?

「高清 8K」只是质量词,决定图糊不糊的还有基础分辨率和工具本身。加质量词有助,但不是唯一变量;换个更高分辨率输出或换工具可能更有效。

Q2:同样的提示词,为什么每次图都不同?

因为模型是随机的。想要复现,就锁定同一个种子。不锁种子,每次都是新的随机画面。

Q3:多根手指/畸形脸怎么办?

加负向提示词(多余手指、畸形、扭曲),同时确保主体提示词写清楚(是「一只手」而不是含糊)。人物脸畸形的,常和参考图/特定模型有关,进阶去 L2-C4 一致性篇。

Q4:中英文提示词哪个好?

国内工具中英文都行,中文即可;Midjourney 等英文生态更成熟的,用英文往往更准。按工具习惯来,能用哪个写清楚就用哪个。

Q5:一次输出的图太多/太少,能控制吗?

多数工具可以选一次出几张、每张是否可变。需求稳定后,通常一次出多张挑一张,省时间。

Q6:比例到底怎么选?

记住常用映射:头像 1:1、图文封面 3:4 或 4:3、公众号横图 16:9、短视频竖屏 9:16。不确定就看平台要求。


进阶避坑指南

坑 1:一上来就堆一大堆参数

参数是修表的螺丝刀,不是开机键。先让提示词对,再微调参数,否则你都不知道是哪个变量惹的祸。

坑 2:写提示词像写作文

不要写「我要一副美轮美奂的画…」这种语气词。给结构化的关键词(主体/风格/构图/光影),比抒情长句有效得多。

坑 3:忽略负向提示词

负向提示词是性价比最高的「排雷」手段之一,很多新手压根不知道它存在。出图总有小瑕疵,先想到它。

坑 4:迷信「权重拉满」

权重不是越大越好,拉满容易让画面失衡、过拟合某个元素。小幅调整、多次试,比一次拉满更稳。

最重要的三句话

  1. 文生图是模型按你的词去「猜」,词写清楚,图才准。
  2. 提示词五块:主体、风格、构图、光影、质量词,缺一块图就飘。
  3. 先让提示词对,再调参数;不满意就诊断是「词」的问题还是「参数」的问题。

下一站预告

你已经会写基础提示词、会调核心参数、会用负向排除问题了。但工具那么多——Midjourney、Stable Diffusion、国产的即梦/文心一格……它们各有各的界面和玩法,哪个适合你?

下一课《L2-C2 主流图像工具上手》逐个带你把主流工具过一遍,并教你按自己的需求选一个主力的出图工具。


教程版本:v1.0 最后更新:2026-08 内容时效:扩散模型的概念、提示词结构、参数作用属于长期通用的基础,多年不过时;文中提及的具体工具与默认值会随版本更新,以你实际使用的工具界面为准。