保姆级教程 · 面向纯小白与自媒体人
项目 信息 课程系列 AI 创作入门 · L1-C 图片/视频 课程编号 L1C-03 难度等级 ★★☆☆☆ 适用人群 会用至少一种图像工具,但还不能稳定做出可发布素材的创作者 预计学时 75-100 分钟 前置课程 L1C-01 图像生成基础、L1C-02 主流图像工具上手 更新日期 2026 年 8 月 内容声明 本教程为通用视觉场景方法论,适用于即梦、Midjourney、Stable Diffusion、通义万相等主流工具,不绑定特定平台。具体功能与界面以当前官方说明为准
学完本教程后,你将能够:
新手最常见的挫折是:AI 生成的图很好看,但发到平台上总觉得"差点意思"——标题没地方放、主体被裁掉了、颜色和账号其他内容格格不入。问题不在出图能力,而在你把"生成图片"当成了最终目标。
一个能发布的素材,至少经过以下环节:
明确用途 → 确定画布比例 → 规划主体与信息层级 → 生成底稿 → 人工筛选 → 后期排版 → 导出检查
AI 只负责其中"生成底稿"这一段。剩下的环节,需要你用结构和流程来保证。
| 问题 | 回答示例 | 为什么重要 |
|---|---|---|
| 发到哪里? | 小红书首图、公众号头图、短视频封面 | 不同平台的最佳比例和视觉习惯不同 |
| 用户先看什么? | 人物表情、商品外观、标题文字 | 决定主体在画面中的大小和位置 |
| 后期要放什么? | 标题、价格、品牌名、二维码 | 决定留白区域的位置和面积 |
常见错误:拿到需求直接写提示词,生成完才发现标题没地方放,只能硬挤在主体脸上。先回答这三个问题,再动笔写提示词,可以省掉 80% 的返工。
如果后期需要加文字,在提示词中明确写出留白要求:
主体位于画面下方,上方留出标题空间,不要文字,不要水印
但注意:不要要求模型生成准确的中文标题。图像模型对中文字符的处理仍然不稳定,准确文字必须由排版工具添加。
一张好的封面,不是把所有信息都塞进去,而是让用户在 0.5 秒内看懂"这条内容讲什么"。
| 层级 | 作用 | 设计要点 |
|---|---|---|
| 主题层 | 用户一眼知道内容讲什么 | 用画面主体或场景直接暗示主题 |
| 主体层 | 人物、商品或关键场景成为视觉焦点 | 主体占画面 50%-70%,不能太小也不能撑满 |
| 留白层 | 给标题和标签留下稳定区域 | 留白要"实",不能是一堆杂物 |
| 识别层 | 颜色、字体和装饰保持账号统一 | 固定主色和标题字体,形成账号辨识度 |
核心原则:标题负责解释,图片负责吸引和建立预期。两者分工,不要让图片试图说清楚所有事。
以"新手早餐教程"为例,完整走一遍流程:
第 1 步:确定用途和比例
用途:小红书竖版首图,标题后期添加。比例:3:4(小红书首图标准比例)。
第 2 步:写提示词
刚出锅的中式早餐,豆浆、油条、鸡蛋和小碟小菜,清爽国风生活方式摄影,三分之四俯拍,主体集中在画面下方,上方留出标题空间,暖色晨光,干净桌面,适合小红书竖版封面,不要文字,不要水印
第 3 步:生成 4 张候选,用以下标准筛选
只留下 1-2 张满足全部条件的,其余丢弃。
第 4 步:在排版工具中添加标题
把选中的底图导入排版工具,在上方留白区添加标题。标题字号建议占画面高度的 5%-8%,太小看不清,太大抢主体。
第 5 步:导出与归档
导出两份:一份发布图(带标题),一份无文字底图(便于后续换标题复用)。同时记录提示词、比例、工具版本。
横版封面通常需要主体和标题形成左右关系。提示词要明确说明主体在哪一侧:
未来感智能设备产品特写,简洁科技视觉,横版构图,主体位于画面右侧,左侧留出大面积标题空间,蓝色与青色边缘光,深色干净背景,材质清晰,不要文字,不要水印
| 常见错误 | 为什么不行 | 正确做法 |
|---|---|---|
| 只写"高级、震撼、吸睛" | 这些词不能告诉模型主体大小、位置和留白在哪 | 写具体的构图指令:"主体位于右侧,左侧留白" |
| 要求模型生成中文标题 | 中文字符大概率变成乱码 | 生成无文字底图,排版工具加标题 |
| 主体占满整个画面 | 标题只能压在主体上,可读性差 | 主体占 60% 左右,其余留白 |
| 忽略账号色调统一 | 每张封面颜色风格不同,不像同一账号 | 固定主色和风格词,写进"固定词"模板 |
新手做系列内容时,常遇到这个问题:单张图都还行,但放在一起不像一个系列。原因不是每张图不够好,而是没有固定视觉规范——每张图的画风、色调、构图、留白都在变。
生成前,先花 5 分钟写一张小规范表:
| 项目 | 示例规则 | 为什么固定它 |
|---|---|---|
| 主色 | 米白背景 + 橙色重点 + 深灰文字 | 保持账号辨识度 |
| 摄影/画风 | 柔和 3D 卡通,低饱和,柔光 | 避免风格漂移 |
| 主体位置 | 主体占画面约 60%,标题区域固定在顶部 | 统一信息层级 |
| 镜头 | 半身或中景,不使用极端俯仰角 | 保持观看节奏一致 |
| 负向项 | 文字、水印、复杂背景、过度饱和 | 排除常见干扰 |
[固定风格],柔和棚拍光,低饱和配色,干净背景,主体完整,上方留白,系列封面统一视觉;
[本期主体],[动作或道具],[本期情绪]
使用方法:每次只替换变量部分(本期主体、动作、情绪),固定部分一字不改。
示例——早餐系列三期:
# 第 1 期:豆浆油条
柔和 3D 卡通风格,柔和棚拍光,低饱和配色,干净背景,主体完整,上方留白,系列封面统一视觉;
一碗豆浆和两根油条,放在木桌上,温暖的早晨氛围
# 第 2 期:鸡蛋三明治
柔和 3D 卡通风格,柔和棚拍光,低饱和配色,干净背景,主体完整,上方留白,系列封面统一视觉;
一个切开的鸡蛋三明治,放在白盘上,清新的早餐氛围
# 第 3 期:水果燕麦碗
柔和 3D 卡通风格,柔和棚拍光,低饱和配色,干净背景,主体完整,上方留白,系列封面统一视觉;
一碗水果燕麦,表面有蓝莓和香蕉片,放在浅色桌上,轻盈健康的氛围
三张图放在一起,画风、色调、构图高度统一,用户一看就知道是同一个系列。
| 手段 | 作用 | 使用条件 |
|---|---|---|
| 固定提示词顺序 | 减少随机变化 | 所有平台都适用,最基础 |
| 固定模型/版本 | 避免模型差异导致的风格跳变 | 工具支持选模型时 |
| 固定种子(seed) | 复现相近的随机起点 | 工具支持种子参数时 |
| 风格参考图 | 让模型"照着这个调性画" | 工具支持风格参考时 |
| 后期模板 | 统一标题位置、字体、边框 | 所有平台都适用,最可靠 |
新手建议:先做到"固定提示词 + 后期模板"这两条,一致性就能提升一大截。平台支持的风格参考和种子复用是锦上添花,不是必须。
不要从"生成一个可爱的 IP"开始。先写一张角色卡,把角色的固定特征写死:
| 字段 | 内容示例 | 为什么重要 |
|---|---|---|
| 物种/身份 | 圆滚滚的橘猫吉祥物 | 确定基础形象 |
| 固定外观 | 绿色围巾、圆耳朵、白色腹部 | 这些特征每次都必须出现 |
| 性格 | 好奇、友好、略微笨拙 | 影响表情和动作倾向 |
| 画风 | 软萌 3D 卡通,哑光材质 | 锁定风格,避免画风漂移 |
| 禁止变化 | 不换物种、不换主色、不增加复杂服装 | 防止模型"自由发挥" |
第一轮:只做角色定稿
不要同时测试十种动作和背景。第一轮只生成 1:1 头像或半身图,目标是从中选出一张"脸部、配色、服装都满意"的基准图。
一只圆滚滚的橘猫吉祥物,绿色围巾,圆耳朵,白色腹部,软萌 3D 卡通风格,哑光材质,正面半身,干净浅色背景,柔和棚拍光,表情友好好奇,细节丰富
生成 4-6 张,选出最稳定的一张作为基准参考图。
第二轮:动作扩展
以基准图为参考,只改变动作、道具和场景,固定外观描述一字不改:
# 动作 1:阅读
一只圆滚滚的橘猫吉祥物,绿色围巾,圆耳朵,白色腹部,软萌 3D 卡通风格,哑光材质,坐在书桌前翻看一本打开的书,柔和棚拍光,干净背景,表情专注
# 动作 2:做饭
一只圆滚滚的橘猫吉祥物,绿色围巾,圆耳朵,白色腹部,软萌 3D 卡通风格,哑光材质,站在厨房台面旁,手拿木勺,柔和棚拍光,干净背景,表情开心
每次只改一个变量,并和基准图并排比较。发现耳朵、围巾或主色漂移时,回到参考图或改用支持参考图/角色锁定的功能。
| 方法 | 一致性水平 | 适合场景 |
|---|---|---|
| 纯文生图 + 固定提示词 | 低到中(大致像,细节会变) | 草稿探索、不要求严格一致 |
| 参考图功能 | 中到高(主要特征稳定) | 系列内容、IP 初期 |
| 角色 LoRA | 高(需训练,有门槛) | 长期生产同一角色 |
| 专用一致性功能 | 高(平台内置角色锁定) | 有此功能的平台 |
重要提醒:普通文生图很难保证跨多张完全一致。不要把偶然生成的相似误判为稳定能力。稳定生产需要参考图、种子、角色 LoRA 或专用一致性功能,这些内容会在 L1C-04 展开。
如果你的 IP 形象基于真实人物(包括名人、明星、动漫角色),商用前必须确认肖像权和版权授权。AI 生成的"像某个人"的形象,不等于你可以自由使用。使用原创设定或已获授权的参考素材是最安全的做法。
图像模型和排版工具各负责什么?这个分工必须清晰:
| 任务 | 谁负责 | 为什么 |
|---|---|---|
| 背景、主体、装饰、材质和氛围 | 图像模型 | 模型擅长生成视觉素材 |
| 标题、日期、价格、品牌名和按钮 | 排版工具 | 模型对准确文字不可靠 |
| 字体层级、对齐、间距和安全边距 | 排版工具 | 需要精确控制 |
| 二维码、Logo 和必须准确的图表 | 排版工具 | 不能有丝毫偏差 |
| 多个版式方向供筛选 | 图像模型 | 快速探索视觉方向 |
流程固定为"先底图,后文字"。发布前逐字检查专有名词、数字、单位和日期。
[活动主题相关的场景/主体],[风格],海报构图,主体位于画面[位置],
[方向]留出标题和信息区,[光影氛围],干净背景,不要文字,不要水印,适合海报底图
示例——新品发布海报:
一台悬浮的白色智能音箱,科技感产品摄影,海报构图,主体位于画面中央偏下,
上方留出大面积标题和日期信息区,蓝色冷光边缘照明,深色渐变背景,材质清晰,
不要文字,不要水印,适合海报底图
Banner(横幅广告)通常比例极端(如 16:9 甚至更宽),主体需要偏左或偏右,另一侧放文字和按钮。提示词重点:
[主体]位于画面左侧,右侧留出大面积文字和按钮空间,横版宽幅构图,
[风格],[光影],背景干净简洁,不要文字,不要水印,适合 Banner 横幅
信息图是最容易翻车的类型。模型可以提供背景和插画元素,但数据、流程箭头、表格和比例必须在设计软件中重建。
正确的信息图生产流程:
1. 把需求拆成:主题插画 + 3-5 个信息区 + 准确文案 + 图标/箭头 + 统一颜色
2. 先生成"干净、留白、无文字"的背景插画
3. 在设计软件中用可编辑图层添加:
- 数据数字(逐字核对)
- 流程箭头(方向不能错)
- 标签文案(字数和位置精确)
- 图标(风格统一)
4. 修改一个数字时不必重新生成整张图
常见错误:让模型"画一个包含销售数据的柱状图"——出来的数字是编的,柱子高度和数值不匹配,完全不可用。数据图表永远由人工制作。
商品图最怕三件事:主体变形、Logo 伪造、材质失真。使用图生图、换背景或局部编辑时,必须遵守以下原则:
白色无线耳机产品摄影,保持产品外形、颜色和 Logo 完整准确,放在浅灰色极简台面,
三分之二角度,柔和侧光,自然阴影,背景干净,四周留白,商业产品图质感,
不要新增文字,不要改变结构,不要添加不存在的配件
用白底图作为输入,让模型把商品放到一个生活场景中:
保持无线耳机的外形、颜色、Logo 和位置不变,将背景替换为简约北欧风格书桌,
桌上有绿植和咖啡杯,柔和自然光从左侧照入,生活场景产品摄影,不要改变产品结构
电商商品图涉及消费者购买决策,虚构的产品功能、夸大的效果、伪造的认证标志都可能违反广告法和电商平台的规则。AI 生成的商品图仅作为视觉素材使用,产品参数、功能描述和认证信息必须以真实数据为准。
选择一个真实主题,在 30-60 分钟内完成一套素材。建议主题:"新手 3 步做一份早餐"。
| 序号 | 素材 | 规格 | 用途 |
|---|---|---|---|
| 1 | 竖版首图 | 3:4,无文字底图 + 带标题发布图 | 小红书封面 |
| 2 | 内容配图 A | 3:4,同风格 | 步骤 1-2 展示 |
| 3 | 内容配图 B | 3:4,同风格 | 步骤 3 展示 |
| 4 | 横版封面 | 16:9,主体一侧留白 | 视频封面或公众号头图 |
| 5 | 归档记录 | 提示词 + 比例 + 工具 + 种子 | 复用和追溯 |
做完这一步,你就从"会出图"升级到"能交付"了。 这两种能力之间的差距,比你想的大得多。
因为只固定了"主题",没有固定画风、镜头、色彩和版式。解决方法:建立"固定词 + 变量词"模板,做一张视觉规范表,并减少每轮变化量。固定提示词顺序 + 后期模板是最基础也最有效的一致性手段。
可以做方向稿(底图),不建议直接交付含关键文字的成品。准确文字和排版应使用可编辑工具完成。流程固定为"先底图,后文字",发布前逐字检查。
普通宣传概念图可以用 AI 生成,但电商主图和功能展示应保留真实商品依据,避免外形、材质和功能失真。最佳做法:用真实商品照片做图生图,明确要求"保持外形不变"。
这是模型对"留白"理解不稳定导致的。可以尝试:① 换个说法,如"主体位于画面下方三分之一,上方三分之二为干净背景";② 加负向提示词"不要在上方放置物体";③ 生成后用扩图功能把上方延伸出来。
正常。新手常以为"一次就能出好图",实际上生成 4-8 张候选、筛选 1-2 张、再微调 1-2 轮是标准节奏。关键是每次只改一个变量,记录改动和结果,不要随机狂点。
现象:每张图单独看都不错,但发到账号上,粉丝反馈"风格好乱"。
原因:每张图的画风、色调、构图都在变。模型每次生成的随机性,加上提示词不统一,导致系列感崩塌。
处理:生成前先写视觉规范表,建立"固定词 + 变量词"模板。三张图放在一起检查一致性,而不是逐张单独看。
现象:生成的海报上,标题文字全是乱码,数字也是错的,完全不能用。
原因:图像模型对中文字符和数字的处理能力有限。即使写了"标题写 XX 活动",出来的也大概率是变形的笔画。
处理:永远遵循"先底图,后文字"的流程。模型只负责背景和主体,准确文字由排版工具添加。发布前逐字校对。
现象:用 AI 生成的商品图,产品外形和实物不一致,多了不存在的按钮,或者颜色偏了,客户投诉。
原因:纯文生图没有真实商品参考,模型会根据训练数据"编造"一个看起来像但细节不对的产品。
处理:始终用真实商品照片做图生图输入。提示词中明确写"保持产品外形、颜色、Logo 和结构不变"。生成后与实物逐项核对。
现象:上周做了一张特别满意的封面,这周想做同风格的,怎么都出不来了。
原因:没有记录提示词、比例、种子、工具版本和模型。好结果变成了一次性偶然事件。
处理:每张可用图都记录:日期、工具、模型版本、提示词、比例、种子(如有)、后期操作。存成表格或笔记,下次直接复用。
你已经能根据场景交付封面、系列配图、IP 形象和商品图了。但真正做自媒体时,更大的挑战是:怎么让同一个角色在十张图里都是同一张脸?怎么精确控制人物姿势和构图?怎么只改一只手而不重画整张图?
下一课《L2-C4 图像控制与一致性》会继续解决角色跨图保持、参考图控制、构图引导、局部重绘和扩展画幅等问题。
教程版本:v1.0 最后更新:2026-08 内容时效:具体工具入口、模型能力和商用条款会变化,请以当前官方说明为准。本文保留的是视觉场景方法论、交付流程和质量检查标准,这些长期通用。