课程库 › AI 视频生成 › 声音、后期与自动化 › 第 2 课
开放模型、视频 LoRA 与本地工作流
工具课约 55 分钟
本课导读
到这里为止,你的所有生成都发生在别人的服务器上——按次付费、内容出域、平台说改就改、想要的定制能力没有就是没有。本课是视频版的"打开引擎盖":开放视频模型+节点工作流。姊妹 Track 的 L8 已经把节点思想讲透了,本课不重讲,只讲视频比图像多出来的那些事——多出来的管线站点、多出来的显存压力,以及 L6 埋下的钩子:视频 LoRA。工具课,预计 55 分钟。
视频管线:比图像多四站
图像管线你熟(视觉课 L8):加载 → 编码 → 采样 → 解码。视频在这条线上多插了几站:
模型加载 → 文本编码 → 图像条件(首帧) → 潜空间视频 → 采样 → VAE 解码
↓
文件输出 ← 音频合成 ← 放大 ← 帧插值
多出来的四站,正是视频的特殊性所在:
- 图像条件(首帧):L4 的图生视频在节点图里就是这一站——把一张图接进条件输入,画面从此有了锚;
- 帧插值:在已有帧之间生成中间帧,把 16fps 补到 32fps,让动作更顺滑。注意它不能修复烂动作,只能让还行的动作更丝滑;
- 放大:视频超分,逐帧放大。成本是图像的几十倍(一秒 24 帧就是 24 张图),所以永远放在最后一步,且只对定稿做;
- 音频合成:把生成或外部的音轨并进输出文件(L9 的原生音频在开放生态里也有对应节点)。
顺序不能乱:先插帧再放大,比先放大再插帧便宜得多——同样的道理,任何昂贵操作都要尽量往管线末端推。
显存:视频的第一约束
图像生成显存不够顶多慢一点,视频生成显存不够就是直接跑不了。原因很朴素:模型要同时在显存里保存几十帧的潜空间数据。三个常规手段:
| 手段 | 做什么 | 代价 |
|---|---|---|
| 量化 | 把模型权重从高精度压到低精度(如 8bit/4bit) | 显存大降,质量轻微损失 |
| 显存卸载 | 暂时用不到的模型部件挪到内存/硬盘 | 显存够用了,速度变慢 |
| 分块解码 | VAE 解码时分块处理而不是整段一次性解 | 显存平稳,速度稍慢 |
规律是用时间换空间——三招都是"跑得慢但跑得动"。加上一条最有效的土办法:降低分辨率和帧数先跑通,定稿再上高规格。这与视觉课"探索用便宜模型、定稿用最强模型"(L10 路由)是同一种资源意识。
视频 LoRA:定制动作与风格
L6 结尾埋的钩子在这里兑现。视频 LoRA 与图像 LoRA(视觉课 L9)原理完全一致——冻结基座、训练小补丁——但训练对象不同:
- 风格 LoRA:让所有输出带上特定的视觉调性(某种胶片感、某种动画风格);
- 动作 LoRA:让模型学会某个特定运动模式(一种独特的运镜、一套武术动作、某个角色的走路姿态);
- 角色 LoRA:跨镜头稳定同一个角色的形象——这是对 L5 资产系统最直接的增强,把"每次挂参考图"升级成"模型自己就记得"。
数据集规范照搬视觉课 L9(多样性、纯净、触发词、授权红线),只是素材从图片变成短视频片段,且数据准备成本高得多——这也是为什么现成的社区 LoRA 值得优先试用。
提示
判断要不要自己训:和图像一样看复用次数。一个要拍三年的品牌角色值得训角色 LoRA;一条广告里的一个特殊运镜,用参考视频(L6 动作参考)就够了。训练是资产级投入,别为一次性需求开这个成本。
开放 vs 封闭:视频领域的取舍
| 封闭平台 | 开放模型+本地 | |
|---|---|---|
| 起步成本 | 零,注册即用 | 显卡+折腾时间 |
| 单次成本 | 按次付费,量大则贵 | 电费,无限次 |
| 画质上限 | 通常更高 | 追赶中,特定任务已可用 |
| 可控性 | 平台给什么用什么 | 全管线可改、可插 LoRA、可批量 |
| 隐私 | 内容出域 | 完全本地 |
| 稳定性 | 平台改版你就得改 | 版本自己锁定 |
结论和图像课一致:学方法用封闭平台,要产能和可控性上开放生态。特别提醒两类人应该认真考虑本地:素材涉密的(企业内部、未发布产品)和要跑批量的(几百条镜头,按次付费扛不住)。
说明
当前版本速览(2026-08,过时请以官网为准):开放视频模型的主力包括 Wan 2.2、LTX-2、HunyuanVideo 1.5 等,均可在 ComfyUI 中通过官方或社区模板运行;视频 LoRA 生态与量化版本(便于小显存运行)在社区站点持续更新。显存需求随模型和分辨率差异极大,具体配置请以模型发布页的说明为准——本课的管线结构、显存策略与开放/封闭取舍长期有效。
自动化的起点
本地工作流真正的价值不在省钱,在可编程。一旦生成过程变成工作流文件,它就能被脚本调用——批量提交一百条镜头、自动命名归档、失败自动重试。这正是 L12 自动化产线的技术地基,也是你的 Python 能力在视频生产里的落点。
提示
视频比图像更需要自动化:一条 30 秒的片子可能要生成 80 条候选镜头,手工点击提交八十次,人会先崩溃。图像的自动化是效率问题,视频的自动化是可行性问题。
动手任务:跑通一条本地或云端管线
基础路线(约 45 分钟,云端 ComfyUI,不装任何东西):
- 载入官方视频生成模板(图生视频),用你 L5 资产库里的一张首帧图跑通第一条;
- 读图说话:对照本课管线图,指出哪个节点是图像条件、哪个是采样、插帧和放大在哪(没有就说明模板简化了哪几站);
- 单变量实验:固定其他参数,只改分辨率/帧数各跑一次,记录生成耗时的变化——建立"什么最烧资源"的体感;
- 挂一个社区视频 LoRA(风格类即可)再跑一次,对比有无 LoRA 的差异。
进阶路线(可选,本地显卡):搭一条完整管线——参考图输入 → 生成 → 插帧或放大 → 合成音频 → 自动命名保存,导出工作流文件+三组结果,并记录你为跑通它做了哪些显存妥协(量化?卸载?降分辨率?)。这条工作流是 L12 自动化作业的底座。
随堂测验
1. 一条镜头动作抖顿不自然,有人建议「加帧插值就好了」。这个判断的问题在哪?
2. 本地跑视频生成时显存不足。以下哪组是本课给出的常规手段?
3. L6 提到的「视频 LoRA 可定制动作风格」,与图像 LoRA 相比最主要的实务差异是?
4. 本课说「图像的自动化是效率问题,视频的自动化是可行性问题」,依据是?
划选正文任意文字可高亮、批注或加入复习卡
讨论
载入中…