保姆级教程 · 面向需要稳定视觉产出的创作者
项目 信息 课程系列 AI 创作入门 · L1-C 图片/视频 课程编号 L1C-04 难度等级 ★★★☆☆ 适用人群 已能独立出图,但遇到人物漂移、姿势失控或局部修改困难的创作者 预计学时 100-130 分钟 前置课程 L1C-01、L1C-02、L1C-03 更新日期 2026 年 8 月 内容声明 不同平台对参考图、ControlNet、LoRA 和局部编辑的命名与能力不同,以当前官方文档为准。本文讲通用方法论,不绑定特定工具
学完本教程后,你将能够:
新手常说"我想要一致,但 AI 总是不一致"。问题在于,"一致性"至少包含四种不同的目标,每种需要不同的控制手段:
| 目标 | 需要稳定的内容 | 常用方法 | 难度 |
|---|---|---|---|
| 角色一致 | 脸型、发型、服装、配色 | 参考图、角色功能、LoRA | 中 |
| 构图一致 | 姿势、视角、主体位置 | 线稿、姿势图、深度图、ControlNet | 中到高 |
| 风格一致 | 画材、色调、光线、质感 | 风格参考、固定模型、固定提示词 | 低到中 |
| 局部准确 | 手、脸、商品、背景细节 | 遮罩、局部重绘、后期修图 | 中 |
先写清目标,再选择控制手段。 不要为了"保持同一个人"去调构图模块,也不要用整图重生成解决一个手指问题——那样只会越改越糟。
遇到"不一致"问题时,按下面顺序问自己:
1. 哪里不一致?是角色变了、姿势不对、风格漂了,还是只有一小块有问题?
2. 当前用了什么控制手段?只靠提示词,还是已经有参考图?
3. 最小改动是什么?改提示词?换参考图?做局部重绘?
4. 这个改动能否只改一个变量?
核心原则:最小改动原则。能用局部重绘解决的手指问题,不要整图重画。能改提示词解决的风格偏差,不要换模型。
参考图不是"上传一张图让 AI 照着画"这么简单。它至少有三种不同的用法,不同平台对这些能力的命名也不同:
| 用法 | 保留什么 | 适合场景 | 注意事项 |
|---|---|---|---|
| 内容参考 | 人物、商品或物体的外观特征 | 同一角色做不同动作 | 参考图背景越干净越好 |
| 构图参考 | 主体位置、镜头角度和画面关系 | 复用构图但换内容 | 不要同时要求换风格 |
| 风格参考 | 色彩、材质、光影和画面气质 | 系列内容统一调性 | 和内容参考分开使用 |
上传前确认:你用的工具把这张参考图当作"参考内容"还是"参考风格"?一张图同时承担太多参考目标时,模型可能无法判断优先级,反而效果更差。
为一个 IP 角色准备一套标准参考素材,后续每次生成都从这里取用:
| 参考图类型 | 用途 | 拍摄/生成要点 |
|---|---|---|
| 正面半身图 | 锁定脸部特征 | 表情自然,光线均匀,背景干净 |
| 侧面/三分之二侧脸图 | 锁定轮廓 | 同一光线条件,同一服装 |
| 全身图 | 锁定身材比例和服装 | 站姿端正,四肢完整 |
| 固定服装/配色说明 | 文字补充 | 列出每个固定特征 |
| 无动作角色提示词 | 提示词备份 | 只描述外观,不含动作和场景 |
参考图质量要求:
种子(seed)是什么:一个随机编号。同一个提示词 + 同一个种子 = 大概率得到相近的图。
种子能做的:
种子不能做的:
正确用法:
保存原图 → 记录种子和参数 → 只改一个变量 → 比较差异 → 选定分支
新手误区:以为锁定种子就能保持角色一致。实际上,种子只锁定"随机起点",角色的脸部和服装还需要参考图或角色 LoRA 来保证。
| 策略 | 做法 | 效果 |
|---|---|---|
| 固定提示词 | 风格词一字不改,只换主体 | 基础一致性 |
| 固定模型 | 不切换 Checkpoint/模型版本 | 避免模型差异导致跳变 |
| 风格参考图 | 上传一张风格满意的图作为风格参考 | 色调和质感更稳定 |
| 固定种子 | 锁定随机起点 | 复现相近结果 |
| 后期统一 | 在排版工具中统一色调和边框 | 最可靠的一致性保障 |
建议优先级:固定提示词 > 固定模型 > 后期统一 > 风格参考 > 固定种子。先做前三项,一致性就能大幅提升。
按学习成本从低到高排序,建议先用:
原则:如果文字已经能解决问题,不要增加复杂节点。控制越多,排错越难。
不需要任何进阶工具,提示词中明确写出视角和位置就能大幅提升构图控制力:
# 指定视角
俯视角度,从上方拍摄
仰视角度,低角度拍摄
平视角度,与主体等高
# 指定位置
主体位于画面左侧,右侧留白
主体居中,四周留白
主体位于画面下方三分之一,上方留白
# 指定镜头距离
特写,只显示脸部和肩膀
半身,显示腰部以上
全身,显示完整人物
当文字描述不够精确(比如"右手抬起、左手叉腰"这种具体姿势),就需要姿势控制:
注意:控制图只约束结构(骨架和姿势),不会自动保证手指、服装和表情正确,这些仍需提示词和局部修复。
| 控制类型 | 适合场景 | 不适合场景 |
|---|---|---|
| 线稿/边缘 | 产品轮廓、建筑、插画构图、草图转成片 | 复杂光影和材质表现 |
| 深度 | 保留前后空间关系,如同一机位换不同风格 | 平面构图、无明显前后景 |
| 姿势 | 人物动作和站位 | 静物和风景 |
| 法线/体积 | 3D 感强烈的物体表面方向 | 平面画面 |
第一次测试只启用一种控制条件,并使用中等尺寸。能说明"输入变化如何影响输出"后,再组合条件。
LoRA(Low-Rank Adaptation)是一种小型附加模型,可以让某个角色或风格更加稳定地出现。
| 情况 | 是否需要 LoRA |
|---|---|
| 偶尔做几张图,不要求严格一致 | 不需要,用参考图即可 |
| 做一个系列(4-10 张),角色大致一致 | 可以不用,参考图 + 种子够 |
| 长期生产同一 IP(几十上百张) | 值得投入 |
| 需要高度还原某个特定角色 | 值得投入 |
| 只是风格统一,不是角色统一 | 不需要,用风格参考 |
新手建议:不要一上来就学 LoRA 训练。先用参考图功能跑通流程,等你确实觉得"参考图不够稳了"再考虑。LoRA 的训练需要素材准备、参数调优和反复测试,时间成本不低。
局部重绘是性价比最高的修复手段。适合修复:脸、手、背景杂物、衣服颜色、局部物体。
标准步骤:
遮罩大小指南:
| 问题类型 | 遮罩范围 | 注意事项 |
|---|---|---|
| 多一根手指 | 只涂多余手指及周围 | 不要涂整只手 |
| 脸部表情不对 | 涂脸部,不含头发 | 边缘沿发际线 |
| 背景有杂物 | 涂杂物及少量背景 | 不要碰到主体 |
| 衣服颜色 | 涂衣服区域 | 不含皮肤和背景 |
| 文字/Logo | 涂文字区域 | 小范围多次修 |
常见错误:遮罩过大会改变原本满意的内容。手指、文字和 Logo 等细节要多次小范围修复,不要一次涂满整个人物。
# 修复多余手指(遮罩只涂手指区域)
[保持手部自然,五根手指,手指比例正确,皮肤质感一致]
# 修复背景杂物(遮罩涂杂物区域)
[干净整洁的背景,与周围环境光线一致,无杂物]
# 换衣服颜色(遮罩涂衣服区域)
[蓝色衬衫,保持衣服褶皱和版型不变,只改变颜色]
扩图用于:
标准流程:
扩图提示词:
# 把正方形封面扩成横版(向左延展)
[原图右侧主体保持不变,向左延展背景,保持同一光线和色调,背景是延续的桌面和墙面,不要新增主体物体]
# 把正方形头像扩成竖版(向上延展)
[原图下方人物保持不变,向上延展背景空间,保持同一光线和色调,上方是干净的天空或纯色背景,留出标题空间]
注意:扩图不等于简单拉伸。新增区域若出现重复建筑、断裂地面或不合理阴影,说明扩展范围过大。缩小扩展范围,分次处理。
| 问题 | 原因 | 处理 |
|---|---|---|
| 新旧区域有明显接缝 | 边缘过渡不自然 | 扩大重叠区域,分次扩展 |
| 新区域出现重复物体 | 模型复制了原图元素 | 补充环境描述,如"空旷的桌面" |
| 透视关系不对 | 扩展方向和原图视角冲突 | 分方向扩展,每次只扩一个方向 |
| 新区域颜色偏移 | 光线描述不充分 | 在提示词中明确光线方向和色温 |
遇到结果不对,按下面顺序排查,一次只改一个变量:
| 现象 | 常见原因 | 处理顺序 |
|---|---|---|
| 角色完全换脸 | 参考图质量差、角色描述冲突、模型不支持身份参考 | 换清晰参考图 → 减少冲突词 → 换支持角色控制的工具 |
| 姿势对但风格漂移 | 固定模型和风格参考不足、冲突词太多 | 降低风格变化 → 固定模型 → 加风格参考 |
| 构图总是偏 | 控制图不清晰、控制强度太低 | 先提升控制强度 → 换更清晰的控制图 |
| 画面僵硬 | 控制强度过高、同时启用条件过多 | 降低强度 → 减少控制条件 → 简化提示词 |
| 局部修复有接缝 | 遮罩边缘太紧、光线描述缺失 | 扩大遮罩边缘 → 补光线描述 → 缩小重绘范围 |
| 扩图后透视不对 | 新增区域过大、缺少环境描述 | 分次扩展 → 补环境词 → 缩小每次扩展范围 |
| 手指总是错 | 模型对手指生成能力有限 | 局部重绘 → 多次小范围修复 → 必要时用后期工具修 |
记录"原图、改动、结果、下一步"四列,比凭感觉反复点击更容易找到有效设置:
| 轮次 | 原图问题 | 改了什么 | 结果 | 下一步 |
|------|----------|----------|------|--------|
| 1 | 脸不像 | 换了参考图 | 脸好一些,但颜色偏 | 固定新参考图,调颜色 |
| 2 | 颜色偏 | 加风格参考 | 颜色对了,但姿势歪 | 加姿势控制 |
| 3 | 姿势歪 | 加姿势控制,强度0.4 | 姿势改善,手还是错 | 局部重绘修手 |
这张表是"把偶然效果变成可复用流程"的关键工具。 养成记录习惯,你的经验就是可积累的资产。
设定角色为"橘猫吉祥物,绿色围巾,软萌 3D 卡通"。
先用 L1C-03 的角色卡方法,生成一张正面站立图作为基准:
一只圆滚滚的橘猫吉祥物,绿色围巾,圆耳朵,白色腹部,软萌 3D 卡通风格,哑光材质,
正面站立,干净浅色背景,柔和棚拍光,表情友好,细节丰富
从 4-6 张候选中选出最稳定的 1 张作为基准参考图。同时保存:提示词、比例、种子、工具版本。
以基准图作为内容参考,生成"阅读、做饭、跑步"三个动作:
# 动作 1:阅读
一只圆滚滚的橘猫吉祥物,绿色围巾,圆耳朵,白色腹部,软萌 3D 卡通风格,哑光材质,
坐在书桌前翻看一本打开的书,柔和棚拍光,干净背景,表情专注
# 动作 2:做饭
一只圆滚滚的橘猫吉祥物,绿色围巾,圆耳朵,白色腹部,软萌 3D 卡通风格,哑光材质,
站在厨房台面旁,手拿木勺,柔和棚拍光,干净背景,表情开心
# 动作 3:跑步
一只圆滚滚的橘猫吉祥物,绿色围巾,圆耳朵,白色腹部,软萌 3D 卡通风格,哑光材质,
在公园小路上慢跑,柔和日光,绿树背景,表情愉快
关键:每次只替换动作和道具,固定画风、围巾、主色与镜头描述一字不改。
对每张图与基准图并排比较:
对偏离严重的一张:
对最终四张统一背景色和尺寸,在排版工具中添加同一位置的标题:
缩小成手机预览尺寸,检查四张放在一起是否属于同一账号:
不一定。参考图过多会产生冲突——模型不知道该优先遵循哪张。先使用一张质量高、主体清楚的基准图,只在确有需要时增加侧面或全身参考。一般来说,1-3 张参考图就够了。
不是。偶尔做图先用在线参考功能;只有长期生产同一角色或风格,且已有稳定素材时,LoRA 才值得投入。LoRA 训练需要准备素材、调参数、反复测试,时间成本不低。先用参考图把流程跑通,确认"参考图不够稳了"再考虑。
三个原因:① 遮罩范围过大,涂到了不需要改的区域;② 重绘强度过高;③ 提示词没有说明"保持原有内容"。解决:缩小遮罩,降低变化强度,并在提示词中明确"保持周围内容不变,只修改 XX"。
因为种子只锁定随机起点。如果你同时改了模型、比例、参考图或大段提示词,相同种子也会得到完全不同的画面。种子的正确用法是:其他条件全部不变,只微调一个词时锁种子。
参考图是"告诉模型长什么样",偏向内容和风格。ControlNet 是"告诉模型结构怎么摆",偏向姿势、轮廓和空间关系。两者可以组合使用:参考图锁定角色外观,ControlNet 锁定姿势和构图。
现象:改了提示词、换了参考图、调了强度、还换了模型,结果变好了但不知道是哪个改动起的作用,下次无法复现。
原因:多个变量同时变化,无法归因。
处理:永远一次只改一个变量。用迭代记录表(第五节 5.2)记录每轮的"改了什么"和"结果如何",把有效改动沉淀为可复用的参数组合。
现象:姿势控制或构图控制强度拉到最高后,人物姿势确实对了,但画面像木偶,质感僵硬,细节消失。
原因:控制强度过高会让模型过度遵循控制图,牺牲了画面自然感和创造性。
处理:从低强度(0.3-0.4)开始,逐步提高。找到"姿势够准 + 画面够自然"的平衡点。如果到 0.6 还是偏,考虑换一张更清晰的控制图,而不是继续拉强度。
现象:手指多了一根,用局部重绘修,结果修出来更畸形了;再修,整只手都变了形。
原因:手指是 AI 图像生成的难点区域,遮罩范围不对或提示词不够具体都会导致越修越差。
处理:① 遮罩只涂多余的手指和少量周围,不要涂整只手;② 提示词写"五根手指,手指比例自然,与手腕连接正确";③ 一次生成 4 个候选,挑最好的;④ 如果两轮还不行,放弃局部重绘,用后期工具(Photoshop、醒图等)手动修。
现象:扩图后,新增区域和原图之间有明显的接缝,颜色、光线或透视对不上。
原因:扩图范围过大,模型难以一次性生成与原图完全匹配的延展内容。
处理:缩小每次扩展范围,分次处理。每次只扩一个方向(如先向左扩 200 像素,再向上扩 200 像素)。在提示词中明确光线方向和色温,帮助模型匹配。最后在后期软件中做色调统一。
你已经掌握了图像控制的核心方法——角色参考、构图引导、局部重绘和扩图。接下来,我们把静态画面扩展到动态素材。
下一课《L2-C5 视频生成基础》会讲清文生视频、图生视频、视频生视频的区别,镜头语言与提示词写法,时长、分辨率、运动幅度等参数选择,帮你生成可供剪辑使用的短镜头。
教程版本:v1.0 最后更新:2026-08 内容时效:不同平台对参考图、ControlNet、LoRA 和局部编辑的命名与能力不同,以当前官方文档为准。本文的控制方法论和排错流程长期通用。