Be Known通知设置

课程库 AI 视频生成 从创意到镜头 › 第 4

图生视频、首尾帧与镜头设计

普通课50 分钟

本课导读

L1 埋过一个结论:图生视频是当前生产的主力形态。本课把它展开成完整方法:首帧怎么设计才"适合动"、尾帧控制和首尾帧过渡怎么用、静态资产(角色图/产品图/L2 的分镜图)怎么镜头化,以及图生视频特有的敌人——画面漂移(你在视觉课 L4 见过它的图像版,视频里它按帧发生)。学完本课,unit-1 闭环:你已经能从一句话创意走到"分镜图动起来"的四镜头系列。预计 50 分钟。

图生视频的本质:把"长什么样"和"怎么动"解耦

纯文生视频要求模型同时解决两个问题:画面长什么样 + 画面怎么动。图生视频把第一个问题提前用图像工作流解决掉——而图像那边你已经有整套武器(十二槽位、摄影语言、参考图、多轮精修),可以廉价地反复打磨到满意。

于是分工变成:

图像模型(视觉课全部技能) →  首帧:构图、光线、风格、主体细节
视频模型(上一课十槽位)   →  运动:动作、运镜、节奏、声音

提示词也随之瘦身:首帧已经锁定的信息(主体外观、场景、构图、光线)不必在视频提示里重复,重复反而可能引导模型"重新理解"画面导致偏离。图生视频的提示词重心压在 ④ 动作、⑤ 运镜、⑦ 节奏、⑨ 结束状态上——描述变化,而不是描述画面。

首帧设计:一张"适合动"的图和一张"好看"的图不是一回事

拿视觉课的标准生成的精美图片直接丢进视频模型,经常动不起来或动得很怪。因为静态审美和动态潜力是两套标准,首帧要额外检查四件事:

1. 运动空间。主体要动,画面里得有地方给它动。人物快步向右走,右侧就要留出画面空间;构图顶格、四边贴死的图,动作一开始就出画。视觉课学的负空间构图在这里有了新用途:留白的方向就是运动的方向。

2. 动作预备态。首帧最好是"动作即将发生"的瞬间,而不是"动作已完成"的瞬间:微微前倾的身体比立正站直的更容易被推进成"走";抬到一半的手比垂下的手更容易接"挥手"。模型会从姿态里读出运动趋势——给它一个已经上膛的画面

3. 景深与运镜的兼容。浅景深大虚化的图很高级,但要做"推近"或"环绕"时,虚掉的背景没有信息可供模型脑补,容易糊成一片或凭空捏造。计划做大幅度运镜的镜头,首帧适当收一点景深。

4. 边缘完整性。运镜会暴露首帧画面外的世界(拉远、横移尤其如此),画外内容全靠模型编。首帧边缘上被裁一半的物体(半张桌子、半个人)是漂移和变形的高发区——要么裁干净,要么在视频提示里说明画外是什么。

提示

实用自查:盯着首帧问三个问题——"什么要动?往哪动?画面里给它留了路吗?"三问有一问答不上来,回图像工作流改图,别急着烧视频额度。

尾帧与首尾帧过渡

部分模型支持同时给首帧+尾帧,模型负责生成中间的过渡。这解锁三类玩法:

  • 精确的状态变化:首帧空杯子、尾帧满杯子——中间自动长出倒咖啡的过程;
  • 可控的运镜终点:首帧全景、尾帧同场景近景——运镜的起点终点都被钉死,比纯文字描述运镜可控一个量级;
  • 镜头间的无缝衔接:镜 A 的尾帧当镜 B 的首帧,多镜头串成视觉接力(L7 多镜头叙事的基建之一)。

代价是过渡路径不可控:两帧之间怎么变是模型自由发挥,可能出现瞬移、形变、物理捷径。首尾帧差异越大,路径越容易鬼畜。经验法则:首尾帧之间只变一个主要维度(位置或状态或景别),多个维度同时大变就拆成两段。

上一课的 ③ 初始状态和 ⑨ 结束状态在这里图像化了:文字版是"描述两端",首尾帧是"直接给两端"。控制手段的强度排序:首尾帧 〉首帧+文字结束状态 〉纯文字——L1 原则三"越会组合条件越像生产"的具体化。

静态资产镜头化

图生视频最有生产价值的三个场景:

分镜图 → 镜头:L2 动态预演里生成的分镜图,现在正式升级为各镜头的首帧。前期文档包的复利在这里兑现:分镜图不是草稿,是半成品。

产品图 → 广告镜头:电商静物图 + "缓慢环绕/推近 + 光影流动"= 详情页动图。注意产品结构是硬约束——旋转中瓶身 logo 变形、按键位置漂移是常见翻车点,产品镜头要用最保守的运镜(缓慢、单一、小幅度)。

角色图 → 表演镜头:角色立绘/人物照动起来。人脸是漂移重灾区(人眼对脸的变化极其敏感),大幅度动作+人脸特写是高危组合——脸部特写镜头动作要小,大动作镜头景别放远。unit-2 会给出系统的角色一致性方案,这里先记住风险分布。

画面漂移:视频版

视觉课 L4 的漂移是"多轮编辑逐轮累积";视频里漂移按帧累积——离首帧越远的帧,和首帧差异越大。表现为:三秒后脸悄悄换人、logo 逐渐扭曲、背景建筑缓慢"生长"。这就是 L1 说的时间漂移,图生视频给了我们首帧作为对照锚点,反而让它更容易被诊断。

对抗手段(和图像版的纪律一脉相承):

  1. 短镜头:5 秒内漂移通常可接受,10 秒+风险陡增。需要长镜头时,切成多段+首尾帧接力;
  2. 保守运镜:运镜幅度越大,模型重绘的画面比例越高,漂移越快;
  3. 验收看最后一秒:质检时把视频拖到最后一帧和首帧对比——漂移是单调累积的,最后一帧合格,整条大概率合格;
  4. 关键镜头多抽:漂移程度在不同采样间波动很大,同参数多生成几条挑最稳的,比试图用提示词"治好"漂移更划算。

动手任务:一图四动 + 四镜头系列

基础路线(约 60 分钟):

第一部分:一图四动(体会"同一首帧,运动设计的自由度"):

  1. 精心制作一张首帧:过"运动空间/预备态/景深/边缘"四项检查;
  2. 用同一张图生成四种运动方案:只动主体 / 只动环境(风、光、背景人流)/ 只动摄影机 / 主体+摄影机组合
  3. 每条用上一课十槽位写提示(重心在④⑤⑦⑨),记录哪种方案最稳、哪种翻车——对照上一课"安全梯度"验证。

第二部分:四镜头系列(unit-1 毕业作业):

  1. 从你 L2 文档包的分镜里挑相邻的 4 个镜头,把分镜图按本课标准修成首帧(该留运动空间的留空间,该改预备态的改姿态);
  2. 逐镜生成,方向严格按分镜表的轴线标注;支持尾帧的话,至少一对相邻镜头用"尾帧=下镜首帧"做衔接实验;
  3. 把四条按分镜顺序粗剪拼接(任何剪辑工具,不求精细),完成 unit-1 的第一条"能看的连续片段";
  4. 写三行复盘:最稳的镜头赢在哪(首帧设计?运镜保守?);最差的镜头病根在哪一层(首帧?提示?模型?);进入 unit-2 前你最想解决的连续性问题是什么——带着它开下一单元。

进阶路线(可选):把你最满意首帧的镜头再用纯文生视频(用文字尽力描述同样的画面+运动)生成一次,并排对比。这是 unit-1 的期末仪式:亲眼验证"锁住首帧,可控性质变"。

随堂测验

随堂测验0 / 4 题正确

1. 图生视频的提示词为什么建议「不要重复描述首帧里已有的画面信息」?

2. 一张构图顶格、主体四边贴死、浅景深大虚化的精美人像,拿去做「摄影机缓慢拉远」的镜头。可以预见的问题是?

3. 用首尾帧模式做「空杯子变成满杯咖啡,同时镜头从全景推到特写,人物从站着变成坐下」,过渡大概率鬼畜。经验法则是?

4. 质检一条 8 秒图生视频镜头时,「把进度条拖到最后一帧和首帧对比」这个动作利用了漂移的什么性质?

划选正文任意文字可高亮、批注或加入复习卡

讨论

载入中…