课程库 › AI 视觉生成 › 控制与一致性 › 第 3 课
结构化控制与精确编辑——让构图听话
工具课约 55 分钟
本课导读
L6 解决的是"像不像"——身份、造型、风格的一致。但还有一类抱怨它管不了:"人是同一个人,可我要她坐在窗边左侧、侧身回头,模型偏给我正面站姿。"这是结构问题:东西在画面的哪里、摆什么姿势、占多大——语言对空间关系的描述和对长相一样欠定("左边一点"到底是多少?)。本课补上控制的第三块拼图:空间条件——让构图、姿态、布局精确听话;顺带学会三件精确编辑武器,让"九成满意的图"不再靠重抽。预计 55 分钟。
控制的第三块拼图
把 unit-1 至今的控制手段排一排,每种锚住的东西不同:
| 手段 | 锚住什么 | 锚不住什么 |
|---|---|---|
| 文字提示(L2/L3) | 内容主题、氛围 | 一切精确的东西 |
| 参考图(L4/L6) | 身份、造型、风格——"长什么样" | 构图、姿态——"摆在哪" |
| 空间条件(本课) | 结构——边缘、深度、姿态、布局 | 内容——贴着骨架画什么都行 |
参考图和空间条件是一对互补:参考图管"内容像什么",空间条件管"结构在哪里"。两者可以同时挂——角色参考图定脸,姿态骨架定动作,各锚各的。
精确编辑三件套:别再重抽好图
在讲空间条件之前,先解决一个更高频的场景:图已经九成满意,只有一处不对。你现在有三种"保住好图"的手段,精度递增——多轮编辑(L4,对话式改)、固定种子微调(L6 工具三,变化更局部)、以及本课的蒙版编辑(指哪改哪):
1. 局部重绘(inpaint):在图上刷一块蒙版,只有蒙版内的区域重新生成,其余像素一动不动。换背景、修错手、给角色换道具,都是它。要领两条:蒙版画得比目标略大一圈(给模型留衔接的余地);提示词只描述蒙版里要出现的东西,不用重复整张图。
2. 扩图(outpaint):向画布外扩展——竖版海报改横版 banner、主体太满想加留白,让模型顺着已有画面"续画"。扩图是补图不是重构图:一次扩一边、小步多次,比一次扩一圈质量稳得多。
3. 蒙版的反向用法:把蒙版刷在要保护的主体上反选重绘,等于"主体冻结、环境全换"——产品图换季节背景的标准做法,比重新生成再祈祷产品结构不变(L6 的结构清单质检)省一个数量级的额度。
提示
编辑优先于重抽,是个额度经济学问题:重抽是把整张图的不确定性再赌一遍,编辑是只赌出错的那 10%。L4 的多轮编辑、L6 的种子微调、本课的蒙版编辑,构成从「对话改」到「指哪改哪」的精度阶梯——按毛病大小选工具。
空间条件家族:给生成套上骨架
空间条件的原理一句话:从一张参考图里提取某一维度的结构骨架,生成时强制贴着骨架画——结构锁死,内容自由。开放生态里这套机制叫 ControlNet,不同的"提取维度"对应不同条件类型:
| 条件类型 | 提取什么 | 锁住什么 | 典型场景 |
|---|---|---|---|
| Canny 边缘 | 图中所有轮廓线 | 整体构图和物体形状 | 照片转插画、保构图换风格 |
| Line Art 线稿 | 干净的艺术线稿 | 线条走向 | 线稿上色、草图变成品 |
| Depth 深度 | 每个像素的远近 | 空间层次、前后关系 | 保场景纵深换内容、换机位感 |
| Pose 姿态 | 人体骨骼关键点 | 动作和姿势 | 让角色摆出指定动作 |
| Segmentation 分割 | 区域色块(天/楼/人) | 大块布局 | 概念图控制画面分区 |
选择逻辑:想锁得越死,选信息越密的条件(边缘 > 深度 > 姿态 > 分割)。给角色摆姿势用 Pose 最合适——它只提取骨骼,脸和衣服完全交给你的参考图和提示词,不会把姿态参考图里那个人的长相也带进来;用 Canny 就会连轮廓细节一起锁死,角色反而换不了。
IP-Adapter(图像提示)是这个家族的近亲但方向相反:它不提取结构,而是把参考图的内容气质(风格、物体特征)轻量注入生成——可以理解为"参考图版的提示词"。记住分工即可:ControlNet 管结构,IP-Adapter 管内容,两者常联手。
控制强度:新旋钮与老纪律
空间条件带来一个新参数:控制强度(通常 0–1)。太高,生成物僵硬地描骨架,细节死板;太低,模型又开始自由发挥。经验起点是中档(0.5–0.7),按结果调。
多条件可以叠加(Pose 定动作 + Depth 定场景纵深),但条件之间可能打架——姿态骨架和深度图对"人在哪"给出矛盾信号时,产出会撕裂。排查方法是老纪律:一次只动一个变量(L2 实验日志)——先单条件跑通,再叠第二个,强度逐个调。这也是为什么控制强度对比要留档:它是你"这个模型听话程度"的校准数据。
说明
当前版本速览(2026-08,过时请以官网为准):ControlNet / IP-Adapter 是开放生态(Stable Diffusion、FLUX 系列)的标准组件,条件类型持续增多。封闭产品把同类能力做成了产品功能:各家的局部重绘/扩图已是标配,结构类控制以「结构参考/风格参考/角色参考」等功能名出现(如 Midjourney 的参考谱系、Firefly 的结构参考、GPT Image 的对话式精确编辑)。趋势是:开放生态叫组件名、封闭产品叫功能名,能力同源——本课讲的维度划分跨两边通用。
接回一致性系统
空间条件不是孤立技巧,它直接升级 L6 的两处:
- 五层诊断的药方库:造型层断裂(产品结构漂了)从"重抽+结构清单质检"升级为"Canny 锁结构再生成";叙事层断裂(空间关系乱)有了 Depth/分割这样的硬手段;
- 生产流程第②步:派生生成的公式从"参考图锚 + 风格块 + 变化描述"扩展为"参考图锚 + 风格块 + 空间条件(需要时) + 变化描述"——系列图里所有"同构图换内容"的需求(如 12 张详情图统一版式)一次锁定。
动手任务:一个构图,三把锁
基础路线(约 45 分钟,封闭产品即可):
- 从你 L6 的四场景系列里挑一张构图最好的图;
- 局部重绘:换掉其中一个元素(背景、道具或服装),主体不动,产出 2 张;
- 扩图:把它从方图扩成横版(如 16:9),小步扩 2–3 次,检查衔接处有没有"续画痕迹";
- 用你的产品/平台里最接近"结构参考"的功能,保住这张图的构图,换一个完全不同的主体(如人物场景换成产品静物),产出 2 张;
- 三行小结:哪一步的可控感最强?哪一步模型最不听话?对照本课的条件强度解释为什么。
进阶路线(可选,支持 ControlNet 的在线服务或本地环境):同一个视觉任务(建议:让你的主角摆出指定姿势)分别用 Canny、Depth、Pose 三类条件各跑一遍,每类跑强度 0.3 / 0.6 / 0.9 三档,提交 9 张对比+条件提取图。你会亲眼看到"锁多死"这个旋钮的全程——这批素材 L8 搭工作流时直接复用。
随堂测验
1. 你想让系列主角摆出一个指定的回头动作,脸和服装必须还是她。最合适的组合是?
2. 一张产品图九成满意,只有背景不对。最省额度的做法是?
3. 叠加 Pose+Depth 两个条件后产出撕裂扭曲。按本课方法第一步该做什么?
4. 「参考图管内容,空间条件管结构」这个分工,解决了参考图体系(L4/L6)的什么盲区?
划选正文任意文字可高亮、批注或加入复习卡
讨论
载入中…