L2-C4 图像控制与一致性:参考图、构图引导、局部重绘与扩图

保姆级教程 · 面向需要稳定视觉产出的创作者

项目 信息
课程系列 AI 创作入门 · L1-C 图片/视频
课程编号 L1C-04
难度等级 ★★★☆☆
适用人群 已能独立出图,但遇到人物漂移、姿势失控或局部修改困难的创作者
预计学时 100-130 分钟
前置课程 L1C-01、L1C-02、L1C-03
更新日期 2026 年 8 月
内容声明 不同平台对参考图、ControlNet、LoRA 和局部编辑的命名与能力不同,以当前官方文档为准。本文讲通用方法论,不绑定特定工具

学习目标

学完本教程后,你将能够:

  1. 理解"一致性"不是单一概念,而是角色、构图、风格和局部四种目标的组合。
  2. 判断一致性问题来自提示词、参考图、种子还是模型能力,并选择对应的控制手段。
  3. 运用参考图、风格参考和种子提高结果稳定性,建立可复用的角色参考包。
  4. 掌握用姿势、边缘、深度或线稿控制构图的基本流程,知道何时该叠加控制条件。
  5. 独立完成局部重绘和扩展画幅,修复问题时不影响已满意的部分。
  6. 建立可回退、可比较、可复用的迭代记录习惯,把偶然效果变成稳定流程。

前置准备

你需要什么

你不需要什么


一、先判断你要控制什么

1.1 "一致性"不是一 个开关

新手常说"我想要一致,但 AI 总是不一致"。问题在于,"一致性"至少包含四种不同的目标,每种需要不同的控制手段:

目标 需要稳定的内容 常用方法 难度
角色一致 脸型、发型、服装、配色 参考图、角色功能、LoRA
构图一致 姿势、视角、主体位置 线稿、姿势图、深度图、ControlNet 中到高
风格一致 画材、色调、光线、质感 风格参考、固定模型、固定提示词 低到中
局部准确 手、脸、商品、背景细节 遮罩、局部重绘、后期修图

先写清目标,再选择控制手段。 不要为了"保持同一个人"去调构图模块,也不要用整图重生成解决一个手指问题——那样只会越改越糟。

1.2 一个判断流程

遇到"不一致"问题时,按下面顺序问自己:

1. 哪里不一致?是角色变了、姿势不对、风格漂了,还是只有一小块有问题?
2. 当前用了什么控制手段?只靠提示词,还是已经有参考图?
3. 最小改动是什么?改提示词?换参考图?做局部重绘?
4. 这个改动能否只改一个变量?

核心原则:最小改动原则。能用局部重绘解决的手指问题,不要整图重画。能改提示词解决的风格偏差,不要换模型。


二、参考图与种子

2.1 参考图的三种用法

参考图不是"上传一张图让 AI 照着画"这么简单。它至少有三种不同的用法,不同平台对这些能力的命名也不同:

用法 保留什么 适合场景 注意事项
内容参考 人物、商品或物体的外观特征 同一角色做不同动作 参考图背景越干净越好
构图参考 主体位置、镜头角度和画面关系 复用构图但换内容 不要同时要求换风格
风格参考 色彩、材质、光影和画面气质 系列内容统一调性 和内容参考分开使用

上传前确认:你用的工具把这张参考图当作"参考内容"还是"参考风格"?一张图同时承担太多参考目标时,模型可能无法判断优先级,反而效果更差。

2.2 建立角色参考包

为一个 IP 角色准备一套标准参考素材,后续每次生成都从这里取用:

参考图类型 用途 拍摄/生成要点
正面半身图 锁定脸部特征 表情自然,光线均匀,背景干净
侧面/三分之二侧脸图 锁定轮廓 同一光线条件,同一服装
全身图 锁定身材比例和服装 站姿端正,四肢完整
固定服装/配色说明 文字补充 列出每个固定特征
无动作角色提示词 提示词备份 只描述外观,不含动作和场景

参考图质量要求:

2.3 种子能做什么,不能做什么

种子(seed)是什么:一个随机编号。同一个提示词 + 同一个种子 = 大概率得到相近的图。

种子能做的:

种子不能做的:

正确用法:

保存原图 → 记录种子和参数 → 只改一个变量 → 比较差异 → 选定分支

新手误区:以为锁定种子就能保持角色一致。实际上,种子只锁定"随机起点",角色的脸部和服装还需要参考图或角色 LoRA 来保证。

2.4 风格统一的组合策略

策略 做法 效果
固定提示词 风格词一字不改,只换主体 基础一致性
固定模型 不切换 Checkpoint/模型版本 避免模型差异导致跳变
风格参考图 上传一张风格满意的图作为风格参考 色调和质感更稳定
固定种子 锁定随机起点 复现相近结果
后期统一 在排版工具中统一色调和边框 最可靠的一致性保障

建议优先级:固定提示词 > 固定模型 > 后期统一 > 风格参考 > 固定种子。先做前三项,一致性就能大幅提升。


三、构图控制

3.1 从最简单的控制开始

按学习成本从低到高排序,建议先用:

  1. 文字指定视角和位置(零成本,改提示词即可)
  2. 参考图指定整体构图(上传一张构图满意的图)
  3. 简单草图或线稿指定轮廓(画一个粗略轮廓让模型遵循)
  4. 姿势、深度和边缘控制(ControlNet 等)
  5. 多控制条件叠加(进阶)

原则:如果文字已经能解决问题,不要增加复杂节点。控制越多,排错越难。

3.2 用文字控制构图的基础写法

不需要任何进阶工具,提示词中明确写出视角和位置就能大幅提升构图控制力:

# 指定视角
俯视角度,从上方拍摄
仰视角度,低角度拍摄
平视角度,与主体等高

# 指定位置
主体位于画面左侧,右侧留白
主体居中,四周留白
主体位于画面下方三分之一,上方留白

# 指定镜头距离
特写,只显示脸部和肩膀
半身,显示腰部以上
全身,显示完整人物

3.3 姿势控制的通用流程

当文字描述不够精确(比如"右手抬起、左手叉腰"这种具体姿势),就需要姿势控制:

  1. 准备一张姿势参考图:姿势清楚、背景简单。可以是真人照片、3D 模型截图或手绘火柴人。
  2. 在工具中选择姿势/骨骼控制功能(不同工具名称不同:ControlNet OpenPose、姿势参考、骨骼引导等)。
  3. 先固定模型、尺寸和主体描述,只调姿势控制。
  4. 用较低控制强度生成一批结果(如强度 0.3-0.5)。
  5. 观察结果:
    • 姿势偏离 → 逐步提高控制强度
    • 画面僵硬 → 降低强度或简化提示词
  6. 保存控制图、强度、种子和最终结果,方便复现。

注意:控制图只约束结构(骨架和姿势),不会自动保证手指、服装和表情正确,这些仍需提示词和局部修复。

3.4 线稿、边缘与深度的适用场景

控制类型 适合场景 不适合场景
线稿/边缘 产品轮廓、建筑、插画构图、草图转成片 复杂光影和材质表现
深度 保留前后空间关系,如同一机位换不同风格 平面构图、无明显前后景
姿势 人物动作和站位 静物和风景
法线/体积 3D 感强烈的物体表面方向 平面画面

第一次测试只启用一种控制条件,并使用中等尺寸。能说明"输入变化如何影响输出"后,再组合条件。

3.5 LoRA:什么时候值得学

LoRA(Low-Rank Adaptation)是一种小型附加模型,可以让某个角色或风格更加稳定地出现。

情况 是否需要 LoRA
偶尔做几张图,不要求严格一致 不需要,用参考图即可
做一个系列(4-10 张),角色大致一致 可以不用,参考图 + 种子够
长期生产同一 IP(几十上百张) 值得投入
需要高度还原某个特定角色 值得投入
只是风格统一,不是角色统一 不需要,用风格参考

新手建议:不要一上来就学 LoRA 训练。先用参考图功能跑通流程,等你确实觉得"参考图不够稳了"再考虑。LoRA 的训练需要素材准备、参数调优和反复测试,时间成本不低。


四、局部重绘与扩展画幅

4.1 局部重绘(Inpaint):只改有问题的地方

局部重绘是性价比最高的修复手段。适合修复:脸、手、背景杂物、衣服颜色、局部物体。

标准步骤:

  1. 复制原图作为备份,永远保留原始版本。
  2. 用遮罩涂出需要修改的区域,边缘略微覆盖问题外圈(多涂 5-10 像素)。
  3. 在提示词中描述"该区域应该是什么",同时说明需要保留的上下文。
  4. 先用较小变化强度生成 2-4 个候选(不要一上来就最大变化)。
  5. 比较遮罩边缘是否自然、光线是否一致、主体是否被改坏。
  6. 只保留最佳结果,并记录遮罩范围和参数。

遮罩大小指南:

问题类型 遮罩范围 注意事项
多一根手指 只涂多余手指及周围 不要涂整只手
脸部表情不对 涂脸部,不含头发 边缘沿发际线
背景有杂物 涂杂物及少量背景 不要碰到主体
衣服颜色 涂衣服区域 不含皮肤和背景
文字/Logo 涂文字区域 小范围多次修

常见错误:遮罩过大会改变原本满意的内容。手指、文字和 Logo 等细节要多次小范围修复,不要一次涂满整个人物。

4.2 局部重绘提示词写法

# 修复多余手指(遮罩只涂手指区域)
[保持手部自然,五根手指,手指比例正确,皮肤质感一致]

# 修复背景杂物(遮罩涂杂物区域)
[干净整洁的背景,与周围环境光线一致,无杂物]

# 换衣服颜色(遮罩涂衣服区域)
[蓝色衬衫,保持衣服褶皱和版型不变,只改变颜色]

4.3 扩展画幅(Outpaint):把图往外延展

扩图用于:

标准流程:

  1. 先确定目标比例和新增画布方向(向左、向右、向上、向下,或多方向)。
  2. 把原图放在主体不被裁切的位置
  3. 让模型延展背景和环境,不要要求它重新设计主体。
  4. 检查新旧区域的光线、透视、纹理和重复物体。
  5. 在后期排版软件中裁切到最终尺寸

扩图提示词:

# 把正方形封面扩成横版(向左延展)
[原图右侧主体保持不变,向左延展背景,保持同一光线和色调,背景是延续的桌面和墙面,不要新增主体物体]

# 把正方形头像扩成竖版(向上延展)
[原图下方人物保持不变,向上延展背景空间,保持同一光线和色调,上方是干净的天空或纯色背景,留出标题空间]

注意:扩图不等于简单拉伸。新增区域若出现重复建筑、断裂地面或不合理阴影,说明扩展范围过大。缩小扩展范围,分次处理。

4.4 扩图常见问题诊断

问题 原因 处理
新旧区域有明显接缝 边缘过渡不自然 扩大重叠区域,分次扩展
新区域出现重复物体 模型复制了原图元素 补充环境描述,如"空旷的桌面"
透视关系不对 扩展方向和原图视角冲突 分方向扩展,每次只扩一个方向
新区域颜色偏移 光线描述不充分 在提示词中明确光线方向和色温

五、控制强度与排错

5.1 排错顺序表

遇到结果不对,按下面顺序排查,一次只改一个变量:

现象 常见原因 处理顺序
角色完全换脸 参考图质量差、角色描述冲突、模型不支持身份参考 换清晰参考图 → 减少冲突词 → 换支持角色控制的工具
姿势对但风格漂移 固定模型和风格参考不足、冲突词太多 降低风格变化 → 固定模型 → 加风格参考
构图总是偏 控制图不清晰、控制强度太低 先提升控制强度 → 换更清晰的控制图
画面僵硬 控制强度过高、同时启用条件过多 降低强度 → 减少控制条件 → 简化提示词
局部修复有接缝 遮罩边缘太紧、光线描述缺失 扩大遮罩边缘 → 补光线描述 → 缩小重绘范围
扩图后透视不对 新增区域过大、缺少环境描述 分次扩展 → 补环境词 → 缩小每次扩展范围
手指总是错 模型对手指生成能力有限 局部重绘 → 多次小范围修复 → 必要时用后期工具修

5.2 迭代记录模板

记录"原图、改动、结果、下一步"四列,比凭感觉反复点击更容易找到有效设置:

| 轮次 | 原图问题 | 改了什么 | 结果 | 下一步 |
|------|----------|----------|------|--------|
| 1 | 脸不像 | 换了参考图 | 脸好一些,但颜色偏 | 固定新参考图,调颜色 |
| 2 | 颜色偏 | 加风格参考 | 颜色对了,但姿势歪 | 加姿势控制 |
| 3 | 姿势歪 | 加姿势控制,强度0.4 | 姿势改善,手还是错 | 局部重绘修手 |

这张表是"把偶然效果变成可复用流程"的关键工具。 养成记录习惯,你的经验就是可积累的资产。


六、实战:制作四张同一 IP 的内容图

设定角色为"橘猫吉祥物,绿色围巾,软萌 3D 卡通"。

第 1 步:建立角色参考包

先用 L1C-03 的角色卡方法,生成一张正面站立图作为基准:

一只圆滚滚的橘猫吉祥物,绿色围巾,圆耳朵,白色腹部,软萌 3D 卡通风格,哑光材质,
正面站立,干净浅色背景,柔和棚拍光,表情友好,细节丰富

从 4-6 张候选中选出最稳定的 1 张作为基准参考图。同时保存:提示词、比例、种子、工具版本。

第 2 步:生成三个动作变体

以基准图作为内容参考,生成"阅读、做饭、跑步"三个动作:

# 动作 1:阅读
一只圆滚滚的橘猫吉祥物,绿色围巾,圆耳朵,白色腹部,软萌 3D 卡通风格,哑光材质,
坐在书桌前翻看一本打开的书,柔和棚拍光,干净背景,表情专注

# 动作 2:做饭
一只圆滚滚的橘猫吉祥物,绿色围巾,圆耳朵,白色腹部,软萌 3D 卡通风格,哑光材质,
站在厨房台面旁,手拿木勺,柔和棚拍光,干净背景,表情开心

# 动作 3:跑步
一只圆滚滚的橘猫吉祥物,绿色围巾,圆耳朵,白色腹部,软萌 3D 卡通风格,哑光材质,
在公园小路上慢跑,柔和日光,绿树背景,表情愉快

关键:每次只替换动作和道具,固定画风、围巾、主色与镜头描述一字不改。

第 3 步:一致性检查

对每张图与基准图并排比较:

第 4 步:修复偏离

对偏离严重的一张:

  1. 先提高参考强度(如从 0.5 调到 0.7)。
  2. 仍不稳定,换支持角色控制的工具或功能。
  3. 局部问题(如围巾颜色偏了)用局部重绘修复,不整图重做。

第 5 步:统一后期

对最终四张统一背景色和尺寸,在排版工具中添加同一位置的标题:

第 6 步:最终验收

缩小成手机预览尺寸,检查四张放在一起是否属于同一账号:


FAQ:常见问题

Q1:参考图越多越好吗?

不一定。参考图过多会产生冲突——模型不知道该优先遵循哪张。先使用一张质量高、主体清楚的基准图,只在确有需要时增加侧面或全身参考。一般来说,1-3 张参考图就够了。

Q2:LoRA 是不是必须学习?

不是。偶尔做图先用在线参考功能;只有长期生产同一角色或风格,且已有稳定素材时,LoRA 才值得投入。LoRA 训练需要准备素材、调参数、反复测试,时间成本不低。先用参考图把流程跑通,确认"参考图不够稳了"再考虑。

Q3:为什么局部重绘把好地方也改了?

三个原因:① 遮罩范围过大,涂到了不需要改的区域;② 重绘强度过高;③ 提示词没有说明"保持原有内容"。解决:缩小遮罩,降低变化强度,并在提示词中明确"保持周围内容不变,只修改 XX"。

Q4:固定了种子,为什么还是出不来一样的图?

因为种子只锁定随机起点。如果你同时改了模型、比例、参考图或大段提示词,相同种子也会得到完全不同的画面。种子的正确用法是:其他条件全部不变,只微调一个词时锁种子。

Q5:ControlNet 和参考图有什么区别?

参考图是"告诉模型长什么样",偏向内容和风格。ControlNet 是"告诉模型结构怎么摆",偏向姿势、轮廓和空间关系。两者可以组合使用:参考图锁定角色外观,ControlNet 锁定姿势和构图。


进阶避坑指南

坑 1:一次改太多变量,找不到哪个起作用

现象:改了提示词、换了参考图、调了强度、还换了模型,结果变好了但不知道是哪个改动起的作用,下次无法复现。

原因:多个变量同时变化,无法归因。

处理:永远一次只改一个变量。用迭代记录表(第五节 5.2)记录每轮的"改了什么"和"结果如何",把有效改动沉淀为可复用的参数组合。

坑 2:控制强度拉满,画面变僵硬

现象:姿势控制或构图控制强度拉到最高后,人物姿势确实对了,但画面像木偶,质感僵硬,细节消失。

原因:控制强度过高会让模型过度遵循控制图,牺牲了画面自然感和创造性。

处理:从低强度(0.3-0.4)开始,逐步提高。找到"姿势够准 + 画面够自然"的平衡点。如果到 0.6 还是偏,考虑换一张更清晰的控制图,而不是继续拉强度。

坑 3:用局部重绘修手指,越修越糟

现象:手指多了一根,用局部重绘修,结果修出来更畸形了;再修,整只手都变了形。

原因:手指是 AI 图像生成的难点区域,遮罩范围不对或提示词不够具体都会导致越修越差。

处理:① 遮罩只涂多余的手指和少量周围,不要涂整只手;② 提示词写"五根手指,手指比例自然,与手腕连接正确";③ 一次生成 4 个候选,挑最好的;④ 如果两轮还不行,放弃局部重绘,用后期工具(Photoshop、醒图等)手动修。

坑 4:扩图后新旧区域"两张皮"

现象:扩图后,新增区域和原图之间有明显的接缝,颜色、光线或透视对不上。

原因:扩图范围过大,模型难以一次性生成与原图完全匹配的延展内容。

处理:缩小每次扩展范围,分次处理。每次只扩一个方向(如先向左扩 200 像素,再向上扩 200 像素)。在提示词中明确光线方向和色温,帮助模型匹配。最后在后期软件中做色调统一。


最重要的三句话

  1. 先定义要稳定的是角色、构图、风格还是局部,再选控制手段。
  2. 参考图提供方向,种子提供复现机会,都不是绝对锁定。
  3. 小范围修改、一次一个变量,才能把偶然效果变成可复用流程。

下一站预告

你已经掌握了图像控制的核心方法——角色参考、构图引导、局部重绘和扩图。接下来,我们把静态画面扩展到动态素材。

下一课《L2-C5 视频生成基础》会讲清文生视频、图生视频、视频生视频的区别,镜头语言与提示词写法,时长、分辨率、运动幅度等参数选择,帮你生成可供剪辑使用的短镜头。


教程版本:v1.0 最后更新:2026-08 内容时效:不同平台对参考图、ControlNet、LoRA 和局部编辑的命名与能力不同,以当前官方文档为准。本文的控制方法论和排错流程长期通用。