Be Known通知设置

课程库 AI 视觉生成 生成与提示基础 › 第 4

参考图、多轮对话与指令式编辑

普通课50 分钟

本课导读

前三课的输入都是纯文字。但文字有天花板:有些视觉信息根本写不出来——"就要这张脸""构图照这张来""风格像这套海报"。本课引入第二类输入:图像本身。你将学会参考图的五种用法、多轮对话式编辑的指令结构,以及一个纯文字时代不存在的新敌人——编辑漂移。学完本课,unit-1 的"生成与提示基础"就齐了:文字定规格,图像定细节,多轮对话做精修。预计 50 分钟。

为什么需要参考图:文字的信息密度不够

试着用文字描述一个具体的人脸,让别人画出来——画出的永远是"同类型的另一个人"。人脸、具体构图、微妙的风格质感,这些信息的密度远超语言的承载力。参考图就是把一整块高密度视觉信息直接塞进输入,跳过语言的有损压缩。

这也解释了参考图的适用判断:语言能低成本说清的,用文字(可控、可改、可复用);语言说不清的,用图(高保真、但整块传入难拆解)。两者混用才是完整的提示能力。

参考图的五种用法

同一张图,声明的用途不同,模型提取的信息完全不同。喂参考图时永远显式声明用途

用法你想从图里提取什么典型场景
风格参考色调、笔触、光感、"氛围""画面内容按我的提示词,风格像这张"
构图参考布局、机位、主体位置"构图照这张,内容全换"
角色参考这张脸/这个角色的身份特征系列内容里同一人物反复出现
产品参考产品的外形结构、细节电商图:产品不能变形,场景随便换
内容素材图里的实物直接进画面"把这个 logo 放到杯子上"

支持多图输入的模型可以组合用法:"角色用图 A,构图用图 B,风格用图 C。"这已经很接近艺术指导下 brief 的方式了。

两个通用要点:

  • 参考强度(各产品叫法不同:权重/相似度/strength):拉太高=复制原图,提示词失效;拉太低=参考等于没给。从中间值起步,按 L2 的单变量方法调。
  • 反推提示词:拿到一张风格很好的参考图,先用视觉理解(L1 的第四种任务形态)让模型描述它的风格要素,再把描述并入你的提示词——图转文之后,这份风格就变成了可编辑、可复用、可进实验日志的文字资产。

多轮对话式编辑:从"重新抽卡"到"逐步逼近"

对话式模型(L1 模型地图的第一层级)带来了工作方式的质变:不满意不用重写提示重抽,直接说"把背景换成黄昏,其他别动"。生成从一锤子买卖变成逐步逼近

但多轮编辑有自己的坑,需要一套指令纪律。

指令结构:保留 / 改变 / 禁止

每轮编辑指令都显式包含三部分:

【保留】人物的脸部、姿势、服装,画面构图不变
【改变】把背景从白天办公室换成黄昏的落地窗前,
        光线相应改为暖调侧逆光
【禁止】不要改变人物面部特征,不要移动主体位置,
        不要添加新的人物或物体

只说"改变"是新手写法。模型对"没提到的部分"的默认处理是随缘——它可能顺手"优化"你没让它动的地方。保留和禁止就是把随缘的部分钉死。

提示

「改变」里注意连带修改:换了黄昏背景,光线、色温、影子方向都该跟着变,否则人物还顶着白天的光站在黄昏里——合成感就是这么来的。改环境时主动把光线写进「改变」,是高级用户的标志(你在 L3 刚学完这套光线语言)。

编辑漂移:多轮编辑的复利税

漂移(drift):每轮编辑时,模型实际上是"理解画面→重新生成",哪怕只让它改背景,主体也会发生肉眼难察的微小变化。单轮看不出来,六轮之后把第一版和最后一版并排放——脸变了、材质糊了、细节丢了。这是复利:每轮 2% 的损失,十轮后面目全非。

对抗漂移的四条纪律:

  1. 锚点版本:每达到一个满意状态就保存原图。漂移超标时回到锚点重来,而不是在漂移的版本上继续修;
  2. 合并指令:三个小修改能一句话说完就别分三轮——轮数本身就是漂移的来源;
  3. 大改早做,小修晚做:换背景、改构图这种大手术放前面,微调细节放最后。顺序反了,后面的大改会把前面的精修全部洗掉;
  4. 关键特征外置:角色的脸用角色参考图锚住而不是靠"禁止改变脸"硬扛——参考图是硬约束,文字禁令是软约束(unit-2 的一致性课会把这套方法系统化)。

局部编辑:漂移的终极解法

对话式编辑是"全图重生成",而局部编辑(inpainting)只重画选中区域,未选中的像素物理上不参与生成——漂移直接归零。判断标准很简单:修改能不能用一个框圈出来?能圈就局部编辑(换商品颜色、去路人、修文字),圈不住才全图对话(整体色调、光线氛围、风格转换)。

局部编辑还有个方向兄弟:扩图(outpainting)——画布向外扩展让模型补全,横图改竖图、给海报腾文案位的标准操作。

完整工作流:四课合体

unit-1 学完,你的生产流程已经从"一句话抽卡"进化成:

① 定规格    十二槽位写出 v1 提示词(L2),镜头光线按意义选型(L3)
② 加锚点    语言说不清的部分挂参考图,声明用途和强度(本课)
③ 生成初版  选对模型层级(L1),单变量迭代到构图光线满意
④ 对话精修  保留/改变/禁止结构逐步逼近,盯住漂移,锚点常存
⑤ 局部收尾  能圈出来的瑕疵用 inpainting 点杀,需要就扩图
⑥ 记录归档  提示词、参考图、模型版本、种子进实验日志(L1/L2)

动手任务:六轮编辑马拉松

基础路线(约 50 分钟):

  1. 用 L2/L3 的方法生成一张你满意的基础图(人物或产品均可),存为锚点 v0
  2. 规划六轮编辑,每轮用完整的"保留/改变/禁止"结构,难度递增:
    • 第 1–2 轮:改颜色、去元素(小修);
    • 第 3–4 轮:换背景+连带改光线(中修);
    • 第 5–6 轮:加新元素、改整体氛围(大修)——对,这故意违反了"大改早做",就是让你亲眼看看代价;
  3. 把 v0 和 v6 并排对比,写漂移分析:哪些特征变了?从第几轮开始变的?哪一轮损失最大?
  4. 回答复盘题:如果重来一次,你会怎么重排这六轮的顺序?哪几轮应该合并?哪个修改其实该用局部编辑?

进阶路线(可选):找一个支持局部编辑的工具,把六轮里最"圈得出来"的那次修改用 inpainting 重做一遍,对比对话式编辑版本的漂移差异——你会理解为什么生产环境把 inpainting 当收尾标配。

随堂测验

随堂测验0 / 4 题正确

1. 你有一张构图绝佳的参考图,想让新图「布局照它来,但内容和风格全换」。喂图时应该?

2. 多轮编辑到第六轮,发现人脸和第一版已经明显不像了。按本课的纪律,最该做的是?

3. 以下哪个修改最适合用局部编辑(inpainting)而不是对话式全图编辑?

4. 「换背景为黄昏」之后画面出现了「合成感」——人物像贴上去的。最可能漏掉了什么?

划选正文任意文字可高亮、批注或加入复习卡

讨论

载入中…