Be Known通知设置

课程库 AI 视觉生成 生产与交付 › 第 1

LoRA、微调与专属视觉资产——什么时候该训练一个模型

工具课55 分钟

本课导读

unit-2 用参考图和空间条件把控制权一块块收回来了,但有一类需求它们仍然吃力:同一个角色要画三百次(绘本长篇、游戏立绘、品牌吉祥物),每次都挂参考图既贵又不稳;或者你要的风格根本不在模型的词汇表里(工作室独有的画风、某种冷门材质)。到这一步,才轮到最后一招——把知识训进模型本身。本课讲清楚三件事:什么时候该训(边界)、训的是什么(LoRA 原理)、训不好时怎么诊断(三种病)。unit-3 开篇,从"用模型"迈进"改模型"。预计 55 分钟。

定制手段的成本谱系

先把位置摆正。让模型产出"你要的东西",手段从轻到重排成一条线:

手段投入起效范围什么时候升级到下一档
提示词工程(L2/L3)几分钟单张到系列描述再精确也说不清时
参考图 / IP-Adapter(L4/L6)几张图单个项目每次生成都要挂图、次数多到烦
LoRA(本课)20–40 张图+一次训练长期复用的角色/风格/产品需要改变模型的基础能力时
全量微调大数据集+大算力整个模型的行为极少数人需要

判断口诀:一次性需求用提示词,项目级需求用参考图,资产级需求才训 LoRA。为一次绘本插图训模型是杀鸡用牛刀;但如果这个角色要陪你三年,训练成本第一周就回本了——和 L6"视觉圣经在第三张图回本"是同一笔账,只是量级更大。

LoRA 是什么:给模型打一个补丁

全量微调是把模型几十亿个参数全部重训一遍——贵、慢、还容易把模型原有的能力搞坏。LoRA 的思路取巧得多:冻结基座模型的全部权重不动,只在旁边训练一组很小的低秩矩阵,推理时把它的输出叠加进去。

对你来说最好用的类比是补丁:基座模型是主程序,LoRA 是一个几十兆的 diff——不修改主程序,加载时叠加生效,不想要就卸掉。由此带来三个实用性质:

  • :LoRA 文件通常几十到几百兆,基座是几个 G;
  • 可组合:一个角色 LoRA + 一个画风 LoRA 可以同时挂(但会互相干扰,见下文"概念泄漏");
  • 可插拔:基座升级换代,重训 LoRA 即可,你的数据集才是真资产。

在 unit-2 的节点图里(L8),LoRA 就是加载检查点之后的一个节点——它接在模型加载和采样之间,把"你的知识"注入这条管线。

提示

「数据集才是真资产,模型是易腐品」——这是本课最该带走的一句。模型每半年换一代,你精心整理标注过的 30 张训练图却能一路跟着迁移。所以下文的数据集规范值得你比训练参数更认真地对待。

数据集:决定成败的八成

新手总以为训练效果取决于参数,实际上参数只占两成,八成在数据集。规范如下:

数量:角色/产品 20–40 张,风格 30–100 张。少而精远胜多而杂——十张高质量比一百张随手截图强。

多样性(最容易翻车的一条):同一个主体,要覆盖不同角度(正侧背、俯仰)、不同光线(顺光逆光室内室外)、不同构图(全身半身特写)、不同背景。你不希望模型学会的东西,就必须在数据集里变化起来——如果所有训练图都是白背景,模型会把"白背景"也当成这个角色的特征学进去。

纯净:去水印、裁掉无关人物、避免重复图片(同一张图放两遍等于给它双倍权重)、分辨率统一、主体清晰。

标注与触发词:给每张图配一段描述,并统一使用一个罕见的触发词(如 zxc_mascot 而不是 cat——常见词会污染模型原有的概念)。标注的黄金法则有点反直觉:你想让模型"记住"的特征不要写,你想让它"可变"的特征才写。角色的脸不写(让它绑定到触发词上),衣服和背景要写(让它们保持可控可换)。

授权(红线):训练素材只能是你自己创作的、拿到授权的、或明确许可的。用未授权的他人作品训风格、用私人照片训人物形象,是本 Track 从视频课 L8 延续过来的同一条红线——记录每张图的来源和使用权限,这份记录和数据集一起存档。

训练的三个旋钮与三种病

参数只需要理解三个:步数(看多少遍)、学习率(每次改多狠)、数据集大小。它们共同决定落在哪种状态:

症状病名表现药方
学得不够欠拟合生成的角色只有三分像,特征抓不住加步数、加学习率、检查标注是否把该记的特征写出去了
学过头了过拟合生成图几乎复刻训练图,换个姿势就崩、背景老是那面白墙减步数、增加数据多样性、降学习率
学串了概念泄漏/风格污染触发词以外的东西也被带偏(画什么都有你的画风;提到"女孩"就出现你的角色)换更罕见的触发词、标注写得更具体、减少训练强度

诊断方法是熟悉的:固定种子,用同一组测试提示词,在不同训练步数的检查点上各跑一遍并排看——这就是 L2 实验日志+L6 并排质检在训练场景的应用。你会亲眼看到"从三分像到七分像到复刻训练图"的全过程,然后挑中间那个最佳检查点。

说明

当前版本速览(2026-08,过时请以官网为准):LoRA 是开放生态(SD 系列、FLUX 系列)的标准定制方案,训练可在本地显卡或各类云端训练服务上完成,社区模型站有海量现成 LoRA 可直接下载体验。封闭产品把同类能力做成了「自定义模型/风格训练」功能(如 Midjourney 的个性化与风格参考、部分平台的品牌模型定制),上传素材即可训练,不暴露参数。原理与数据集规范两边通用。

动手任务:先当数据总监,再当训练师

基础路线(约 45 分钟,不训练也能完成,这是本课的核心作业):

为你 L6 的主角或产品设计一套完整的 LoRA 数据集方案,交付一份文档:

  1. 可行性判断:这个主体值得训 LoRA 吗?按成本谱系写三行论证(预计复用次数、参考图方案的痛点、训练的一次性成本);
  2. 数据集清单:列出 24 张图的规格表——每张写明角度/光线/构图/背景,检查多样性有没有覆盖(这一步会让你发现自己的资产库缺什么);
  3. 来源与授权表:每张图的来源与权限状态(自己生成的也要写明"本人 AI 生成,日期");
  4. 标注方案:触发词是什么、标注里写什么不写什么,各举三例;
  5. 验收测试集:预先写好 5 条测试提示词(要覆盖训练集里没有的姿势和场景)——训练完就用它们查过拟合。

进阶路线(可选,需云端训练服务或本地显卡):真的训一个。用上面的数据集训 LoRA,在三个不同步数的检查点上跑同一组测试提示词,交付并排对比图+一行诊断:你的模型落在欠拟合、刚好、还是过拟合?

随堂测验

随堂测验0 / 4 题正确

1. 训练完的角色 LoRA,生成任何姿势时背景都是那面白墙,换场景几乎无效。最可能的病因与药方是?

2. 标注训练图时,关于角色的脸和当天穿的衣服,正确做法是?

3. 为一次性的单张海报需求训练 LoRA,问题在哪?

4. 本课说「数据集才是真资产,模型是易腐品」,实践含义是?

划选正文任意文字可高亮、批注或加入复习卡

讨论

载入中…