Be Known通知设置

课程库 AI 视觉生成 控制与一致性 › 第 3

结构化控制与精确编辑——让构图听话

工具课55 分钟

本课导读

L6 解决的是"像不像"——身份、造型、风格的一致。但还有一类抱怨它管不了:"人是同一个人,可我要她坐在窗边左侧、侧身回头,模型偏给我正面站姿。"这是结构问题:东西在画面的哪里、摆什么姿势、占多大——语言对空间关系的描述和对长相一样欠定("左边一点"到底是多少?)。本课补上控制的第三块拼图:空间条件——让构图、姿态、布局精确听话;顺带学会三件精确编辑武器,让"九成满意的图"不再靠重抽。预计 55 分钟。

控制的第三块拼图

把 unit-1 至今的控制手段排一排,每种锚住的东西不同:

手段锚住什么锚不住什么
文字提示(L2/L3)内容主题、氛围一切精确的东西
参考图(L4/L6)身份、造型、风格——"长什么样"构图、姿态——"摆在哪"
空间条件(本课)结构——边缘、深度、姿态、布局内容——贴着骨架画什么都行

参考图和空间条件是一对互补:参考图管"内容像什么",空间条件管"结构在哪里"。两者可以同时挂——角色参考图定脸,姿态骨架定动作,各锚各的。

精确编辑三件套:别再重抽好图

在讲空间条件之前,先解决一个更高频的场景:图已经九成满意,只有一处不对。你现在有三种"保住好图"的手段,精度递增——多轮编辑(L4,对话式改)、固定种子微调(L6 工具三,变化更局部)、以及本课的蒙版编辑(指哪改哪):

1. 局部重绘(inpaint):在图上刷一块蒙版,只有蒙版内的区域重新生成,其余像素一动不动。换背景、修错手、给角色换道具,都是它。要领两条:蒙版画得比目标略大一圈(给模型留衔接的余地);提示词只描述蒙版里要出现的东西,不用重复整张图。

2. 扩图(outpaint):向画布外扩展——竖版海报改横版 banner、主体太满想加留白,让模型顺着已有画面"续画"。扩图是补图不是重构图:一次扩一边、小步多次,比一次扩一圈质量稳得多。

3. 蒙版的反向用法:把蒙版刷在要保护的主体上反选重绘,等于"主体冻结、环境全换"——产品图换季节背景的标准做法,比重新生成再祈祷产品结构不变(L6 的结构清单质检)省一个数量级的额度。

提示

编辑优先于重抽,是个额度经济学问题:重抽是把整张图的不确定性再赌一遍,编辑是只赌出错的那 10%。L4 的多轮编辑、L6 的种子微调、本课的蒙版编辑,构成从「对话改」到「指哪改哪」的精度阶梯——按毛病大小选工具。

空间条件家族:给生成套上骨架

空间条件的原理一句话:从一张参考图里提取某一维度的结构骨架,生成时强制贴着骨架画——结构锁死,内容自由。开放生态里这套机制叫 ControlNet,不同的"提取维度"对应不同条件类型:

条件类型提取什么锁住什么典型场景
Canny 边缘图中所有轮廓线整体构图和物体形状照片转插画、保构图换风格
Line Art 线稿干净的艺术线稿线条走向线稿上色、草图变成品
Depth 深度每个像素的远近空间层次、前后关系保场景纵深换内容、换机位感
Pose 姿态人体骨骼关键点动作和姿势让角色摆出指定动作
Segmentation 分割区域色块(天/楼/人)大块布局概念图控制画面分区

选择逻辑:想锁得越死,选信息越密的条件(边缘 > 深度 > 姿态 > 分割)。给角色摆姿势用 Pose 最合适——它提取骨骼,脸和衣服完全交给你的参考图和提示词,不会把姿态参考图里那个人的长相也带进来;用 Canny 就会连轮廓细节一起锁死,角色反而换不了。

IP-Adapter(图像提示)是这个家族的近亲但方向相反:它不提取结构,而是把参考图的内容气质(风格、物体特征)轻量注入生成——可以理解为"参考图版的提示词"。记住分工即可:ControlNet 管结构,IP-Adapter 管内容,两者常联手。

控制强度:新旋钮与老纪律

空间条件带来一个新参数:控制强度(通常 0–1)。太高,生成物僵硬地描骨架,细节死板;太低,模型又开始自由发挥。经验起点是中档(0.5–0.7),按结果调。

多条件可以叠加(Pose 定动作 + Depth 定场景纵深),但条件之间可能打架——姿态骨架和深度图对"人在哪"给出矛盾信号时,产出会撕裂。排查方法是老纪律:一次只动一个变量(L2 实验日志)——先单条件跑通,再叠第二个,强度逐个调。这也是为什么控制强度对比要留档:它是你"这个模型听话程度"的校准数据。

说明

当前版本速览(2026-08,过时请以官网为准):ControlNet / IP-Adapter 是开放生态(Stable Diffusion、FLUX 系列)的标准组件,条件类型持续增多。封闭产品把同类能力做成了产品功能:各家的局部重绘/扩图已是标配,结构类控制以「结构参考/风格参考/角色参考」等功能名出现(如 Midjourney 的参考谱系、Firefly 的结构参考、GPT Image 的对话式精确编辑)。趋势是:开放生态叫组件名、封闭产品叫功能名,能力同源——本课讲的维度划分跨两边通用。

接回一致性系统

空间条件不是孤立技巧,它直接升级 L6 的两处:

  • 五层诊断的药方库:造型层断裂(产品结构漂了)从"重抽+结构清单质检"升级为"Canny 锁结构再生成";叙事层断裂(空间关系乱)有了 Depth/分割这样的硬手段;
  • 生产流程第②步:派生生成的公式从"参考图锚 + 风格块 + 变化描述"扩展为"参考图锚 + 风格块 + 空间条件(需要时) + 变化描述"——系列图里所有"同构图换内容"的需求(如 12 张详情图统一版式)一次锁定。

动手任务:一个构图,三把锁

基础路线(约 45 分钟,封闭产品即可):

  1. 从你 L6 的四场景系列里挑一张构图最好的图;
  2. 局部重绘:换掉其中一个元素(背景、道具或服装),主体不动,产出 2 张;
  3. 扩图:把它从方图扩成横版(如 16:9),小步扩 2–3 次,检查衔接处有没有"续画痕迹";
  4. 用你的产品/平台里最接近"结构参考"的功能,保住这张图的构图,换一个完全不同的主体(如人物场景换成产品静物),产出 2 张;
  5. 三行小结:哪一步的可控感最强?哪一步模型最不听话?对照本课的条件强度解释为什么。

进阶路线(可选,支持 ControlNet 的在线服务或本地环境):同一个视觉任务(建议:让你的主角摆出指定姿势)分别用 Canny、Depth、Pose 三类条件各跑一遍,每类跑强度 0.3 / 0.6 / 0.9 三档,提交 9 张对比+条件提取图。你会亲眼看到"锁多死"这个旋钮的全程——这批素材 L8 搭工作流时直接复用。

随堂测验

随堂测验0 / 4 题正确

1. 你想让系列主角摆出一个指定的回头动作,脸和服装必须还是她。最合适的组合是?

2. 一张产品图九成满意,只有背景不对。最省额度的做法是?

3. 叠加 Pose+Depth 两个条件后产出撕裂扭曲。按本课方法第一步该做什么?

4. 「参考图管内容,空间条件管结构」这个分工,解决了参考图体系(L4/L6)的什么盲区?

划选正文任意文字可高亮、批注或加入复习卡

讨论

载入中…