Be Known通知设置

课程库 AI 视频生成 连续性与表演 › 第 2

摄影机运动、动作控制与表演迁移

普通课50 分钟

本课导读

L3 学的运镜是"轨迹"层面的:推拉摇移跟。本课先补上"质感"层面——同样的推近,手持和轨道讲的是两种故事;再解决一个提示词永远解决不了的问题:表演。"她转身"写得出来,"她犹豫地、带着一丝释然转身"就超出语言了——微表情、节奏、身体语言的信息密度远超文字(视觉课 L4 的老结论,在动作维度再次应验)。答案也熟悉:语言说不清的,用参考——这次是用你自己的表演视频当参考。预计 50 分钟。

运镜的质感层:机器怎么"拿"决定观众怎么"感"

同一条轨迹,四种承载方式,四种叙事气质。提示词里把质感词补在 L3 的"轨迹+速度+关系"公式后面:

质感提示词短语观感与用途
手持handheld, slight camera shake呼吸感、紧张、纪实、"在场"——新闻感和惊悚片的标配
稳定器/滑轨smooth gimbal / dolly movement丝滑、高级、掌控感——广告和电影感的默认
轨道/摇臂crane / jib movement仪式感、宏大调度——开场和收尾镜头
无人机aerial drone shot上帝视角、地理交代、自由穿越

运镜速度是情绪的旋钮:慢推=紧张或专注在积聚;快推(crash zoom)=突然的惊觉;慢拉=怅然、抽离、故事结束了;缓慢环绕=审视与仪式感。写运镜时问自己 L3 就该问的问题:这个运动在替叙事做什么?答不上来就用固定机位——没有动机的运镜是视频版的"废形容词"。

提示

质感词也是治「AI 味」的偏方之一:模型默认输出偏向过分丝滑的稳定器观感,全片如此就假得均匀。刻意在纪实感镜头里加 handheld、在情绪镜头里控制运镜速度,节奏的「人味」就回来了。

动作控制的强度谱系

把 unit-1 至今所有控制动作的手段排成一条谱系,强度从左到右递增:

纯文字         首尾帧            动作参考视频        表演迁移
(L3 十槽位)    (L4 两端钉死)     (给模型看"这样动")   (逐帧驱动角色)
──────────────────────────────────────────────────→ 控制力增强
可控性最低     状态可控但         运动轨迹可控         表情口型级精确
抽卡感最强     过程仍自由发挥     细节仍有发挥         自由度最低

动作参考视频:部分平台支持上传一段视频作为"运动模板"——模型提取其中的运动模式(人物动作或镜头运动)应用到你的画面上。它和表演迁移的区别在精度:参考是"照这个感觉动",迁移是"逐帧照搬"。

表演迁移是本课主角:录一段真人表演(你自己),让它驱动任意角色——你挑眉,角色挑眉;你的口型,角色的口型。表演这个最难被语言描述的东西,绕过了语言。

说明

当前版本速览(2026-07,过时请以官网为准):Runway Act-Two 用真人表演视频驱动角色的动作与表情;Kling Motion Control 将表演视频+角色图像+文字指令组合做动作迁移。数字人口型方向(HeyGen 等)是表演迁移的近亲,L8 数字人课专讲。开放生态里视频 LoRA 也可定制动作风格(L10 展开)。

拍好你的表演素材:五条军规

迁移质量的上限在你的原始素材。用手机拍就行,但守住五条:

  1. 光线均匀,脸别糊:面部特征是追踪的原料,阴阳脸和逆光会让表情捕捉大打折扣;
  2. 机位固定,正面拍:表演素材里的相机必须不动——你的运镜应该由生成侧决定(L3 的十槽位⑤),素材里镜头晃动会被当成"动作"迁移过去;
  3. 表演放大一到两成:迁移过程有衰减,微妙的表情到角色脸上会更微妙直至消失。舞台剧式的略微夸张,落到角色上刚好;
  4. 时长和节奏对齐镜头表:素材就按目标镜头的秒数演,掐着 L2 镜头表的时长来,别指望后期变速救场;
  5. 一条素材一个表演事件:和"一个镜头一个动作"(L3)同源——想要"惊讶然后大笑",拍两条分别迁移,比一条里演两段稳定得多。

迁移目标的适配度阶梯

表演能"落"到什么角色上?结构和真人越接近,迁移越保真:

目标类型适配度注意事项
写实人物最高几乎全量保留表情细节;注意授权(用谁的脸都要有权利)
插画/动画角色风格化会吃掉部分微表情,放大表演来补
三维/拟人角色五官布局不同,口型映射开始失真
非人类角色(动物/物体)低而有趣只有大幅度动作和头部朝向能迁移;表情靠"拟人化想象",效果全看模型

规律和 L4 的首帧检查一脉相承:迁移是"映射",源和目标的结构差异越大,映射丢的信息越多。给非人类角色做表演,预期管理要提前做——能落个"神态"就算赢。

接入工作流:表演镜头的生产线

表演迁移不替代 unit-2 已建立的流程,而是嵌进去——它负责"这一镜里的动作",一致性照旧由资产系统管:

① 镜头表定表演需求   哪几镜需要精确表情/口型(通常是近景反应镜头)
② 首帧照旧派生       角色参考图+风格块 → 该镜首帧(L5 流程不变)
③ 录制表演素材       按五条军规,对着镜头表的时长演
④ 迁移生成           首帧(定角色和画面) + 表演视频(定动作) → 成镜
⑤ 验收               七层照扫,重点加验:表情幅度够不够?口型对不对?
                     动作有没有把身份层带漂?(动作越大脸越容易漂——L4 老敌人)

注意 ④ 的输入组合:首帧管"是谁、在哪",表演管"怎么动"——这是 L4"解耦"思想的第三次出现(图生视频解耦画面与运动、资产系统解耦设定与生成、表演迁移解耦角色与表演)。识别出这个模式,你就掌握了这个 Track 的底层方法论:把模型自由发挥的空间,一块一块换成你的控制条件。

动手任务:一段表演,两次投胎

基础路线(约 60 分钟):

  1. 从你 30 秒项目的分镜里挑(或加)一个近景反应镜头(如:主角看到面包店开门,惊喜一笑);
  2. 用手机按五条军规拍你自己的表演素材,3–5 秒,演两条备选;
  3. 准备两个迁移目标的首帧:你的主角标准像(写实或插画,来自 L5 资产包)+ 一个非人类角色(找个乐子:一只猫、一个拟人化的咖啡杯);
  4. 分别迁移,各生成 1–2 条;
  5. 动作误差分析(三行):哪些表演细节保住了?哪些丢了?丢失程度和"适配度阶梯"的预测一致吗?
  6. 把主角版成镜插进你的四镜头片段——你的 30 秒项目从此有了第一个真正"有表演"的镜头。

进阶路线(可选):同一条表演素材,分别用"纯文字描述这段表演"和"表演迁移"生成同一镜头,并排对比——用你自己的脸验证控制谱系两端的差距。

随堂测验

随堂测验0 / 4 题正确

1. 一个惊悚短片的追逐镜头,想要「观众也在现场逃跑」的紧张感。运镜质感上最应该选?

2. 你对着手机演了一段「从疑惑到恍然大悟」,迁移到插画角色后表情几乎看不出变化。按本课方法,最该调整的是?

3. 表演素材拍摄时要求「机位必须固定」,原因是?

4. 「首帧管是谁在哪,表演管怎么动」被称为本 Track 底层方法论的第三次出现。这个方法论是?

划选正文任意文字可高亮、批注或加入复习卡

讨论

载入中…