从单张生成到批量生产——多模型策略与自动化产线
普通课约 55 分钟
本课导读
需求很少长成"给我一张图"的样子。真实的需求是:"这个活动,我要主视觉一张、横幅三尺寸、竖版海报两版、社媒方图五张、详情图六张、缩略图若干"——二十多个资产,同一套视觉语言,明天要。手工点一天也点不完,而且点到第十五张时风格已经悄悄漂了(L6 的老敌人)。本课把 unit-2 的控制体系接上产能:多模型路由(哪一步用哪个模型)、模板化批量(一次派生一批)、LLM 参与的产线(谁来检查),以及始终最重要的那个问题——人在哪一环把关。预计 55 分钟。
多模型策略:为每道工序选工具
L1 的模型分层(对话式/高审美/高质量文生图/开放)在单张生成时是"选一个用",到了产线上升级成路由:一条产线的不同工序,本来就该用不同模型。
| 工序 | 选型倾向 | 理由 |
|---|---|---|
| 概念探索、找方向 | 快而便宜的模型 | 这一步要的是量和多样性,不是质量 |
| 主视觉定稿 | 最强审美/最高质量的模型 | 一张图定调,值得用最贵的 |
| 系列派生 | 与主视觉同一模型+控制条件 | 换模型=换"方言",风格会裂(L6 进阶任务的伏笔在此兑现) |
| 精确编辑、扩图 | 编辑能力最强的模型 | 编辑和生成不是同一个能力 |
| 放大出图 | 专门的放大模型 | 生成模型不负责这件事 |
这就是"多模型"的正解:不是"哪个模型最好",而是"每道工序谁最合适"。你在 L2 的多模型基准测试里攒下的评分表,到这里终于兑现成产线配置——那张表就是你的路由依据。
提示
路由的隐藏收益是成本。一条产线里九成的生成量花在探索和废片上,一成花在定稿。把探索阶段路由到便宜模型,账单能降一个数量级,而成品质量完全不受影响——因为定稿那一成仍然走最贵的。
批量化的四件事
1. 模板化提示词。把 L6 的风格块升级成带槽位的模板:
【模板:活动视觉 v1.0】
{主体描述},置于{场景},{构图指令},
—— 以下冻结不改 ——
{风格块 v1.2},{品牌色板},{光线规范}
固定部分冻结,变量部分填槽——批量生产的本质就是"只让该变的变"。这与 L2 的提示词模板是同一件事,只是现在由程序填槽而不是手填。
2. 动态提示与批量变体。一次任务展开成一批:主体三选一 × 场景四选一 = 12 张变体一次跑完,挑好的留。节点工作流(L8)或 API 脚本都能做——你的 Python 能力在这里第一次直接派上用场。
3. 尺寸适配的正确顺序。同一视觉要出方图/竖版/横幅,不要各生成一次(三次抽卡=三种构图,风格必裂)。正确做法是:一次生成主视觉 → 用扩图(L7)向不同方向扩展 → 裁切定稿。主体像素完全一致,只是画布不同。
4. 自动命名与归档。文件名即元数据,一开始就定好规则:
{项目}_{资产类型}_{尺寸}_{版本}_{日期}.png
活动618_主视觉_1080x1080_v3_20260807.png
配合工作流文件(L8)和实验日志(L2),三者合起来才叫"可追溯的生产"。三个月后客户说"就要上次那版",你要能在十秒内找到它。
LLM 参与的产线:谁来写提示、谁来检查
批量生产的瓶颈很快从"生成"转移到"写提示"和"看图"。语言模型可以接管其中几环:
需求解析 → 提示生成 → 图像生成 → 视觉检查 → 自动修订 → 人工批准 → 输出归档
(LLM) (LLM) (图像模型) (VLM) (LLM+图像) (人) (脚本)
- 需求解析/提示生成:把一句话需求("618 大促,主打年轻人,要有活力")展开成结构化的提示词集合——这是你 AI 主线学过的能力,在这里当零件用;
- 视觉检查:视觉语言模型(VLM)可以看图回答"这张图里有几个人?文字拼对了吗?产品 logo 在不在?"——把 L6 的结构清单质检自动化,处理二十张图里明显不合格的那几张;
- 自动修订:检查不过的图,把问题描述回灌成修订提示词,重新生成或局部重绘(L7)。
但机器检查有明确的天花板:语义和事实类错误它能抓(少了个按钮、文字拼错),审美和品牌调性它抓不住,合规与安全风险更不能交给它判断。这就引出本课最重要的一节。
人工审核节点:放在哪里
自动化产线的设计难点不是"怎么自动",而是"在哪儿必须停下来等人"。三个节点不可省:
- 方向批准(开工前):主视觉定稿必须人来拍板。方向错了,后面二十个资产全是精致的废品——这是自动化最贵的失败模式;
- 抽样质检(生产中):批量产出后按比例抽检,重点看风格漂移(把第 1 张和第 20 张并排,L6 的老规矩);
- 发布前终审(交付前):合规、品牌、事实准确性,全部由人签字。AI 生成的内容,责任永远在按下发布键的人身上——这条下一课(L11)会展开成完整的审核框架。
说明
当前版本速览(2026-08,过时请以官网为准):主流图像模型均提供 API,可编程调用与批量提交;节点工作流(ComfyUI)支持 API 模式与批处理队列;视觉语言模型(各家多模态模型)已能胜任基础的图像质检问答。API 定价、并发限制与模型能力变动频繁,成本估算请以当期官网为准——本课的产线结构与人工节点设计长期有效。
成本与失败:产线的两个现实
- 成本管理:开工前先算——单张成本 × 预计生成量(含废片,按 3–5 倍成品数估)= 预算。设置额度告警,别等账单来了才知道探索阶段跑了两千张;
- 失败重试:API 会超时、会限流、会返回不合格图。批量脚本必须有重试和断点续跑,否则跑到第 180 张挂了要从头再来;
- 质量筛选:生成 3–5 倍数量再挑,是 AI 生产的常态而非浪费——废片率是成本模型的一部分,不是失败的证据。
动手任务:一个品牌,二十个资产
基础路线(约 90 分钟,手工+模板也能完成,不必写代码):
给一个虚拟品牌(自拟:咖啡店、健身 App、文具品牌均可)做一套活动视觉资产:
- 定方向:用便宜模型探索 8–10 张概念图,选一张作为主视觉方向(这一步就是路由的第一段);
- 主视觉定稿:用你手里最强的模型 + L6 风格块产出主视觉,人工拍板(节点一);
- 派生 20 个资产:横幅(宽版)、竖版海报、社媒方图、详情图、缩略图——用扩图和裁切派生,不要重新生成;
- 自动命名归档:按命名规则整理成一个文件夹,附一份资产清单表(文件名/用途/尺寸/来源模型);
- 写产线说明(本课真正的交付物):画出你这条产线的流程图,标明——哪几步用了哪个模型(路由)、哪几步是自动/半自动、三个人工节点分别在哪、你在第 20 张时有没有发现风格漂移。
进阶路线(可选):用 API 或 ComfyUI 批处理把第 3 步真正自动化,脚本包含模板填槽、批量提交、自动命名、失败重试;再加一步 VLM 自动质检(让它回答"品牌色在不在、有没有多余文字"),把不合格的挑出来。
随堂测验
1. 同一个活动视觉要出方图、竖版海报和横幅三种尺寸。正确做法是?
2. 自动化产线里,三个不可省的人工节点中最贵的失败模式对应哪一个?
3. 关于「多模型策略」,本课给出的正解是?
4. 视觉语言模型(VLM)自动质检在产线里的合理定位是?
划选正文任意文字可高亮、批注或加入复习卡
讨论
载入中…