课程库 › AI 视频生成 › 连续性与表演 › 第 2 课
摄影机运动、动作控制与表演迁移
普通课约 50 分钟
本课导读
L3 学的运镜是"轨迹"层面的:推拉摇移跟。本课先补上"质感"层面——同样的推近,手持和轨道讲的是两种故事;再解决一个提示词永远解决不了的问题:表演。"她转身"写得出来,"她犹豫地、带着一丝释然转身"就超出语言了——微表情、节奏、身体语言的信息密度远超文字(视觉课 L4 的老结论,在动作维度再次应验)。答案也熟悉:语言说不清的,用参考——这次是用你自己的表演视频当参考。预计 50 分钟。
运镜的质感层:机器怎么"拿"决定观众怎么"感"
同一条轨迹,四种承载方式,四种叙事气质。提示词里把质感词补在 L3 的"轨迹+速度+关系"公式后面:
| 质感 | 提示词短语 | 观感与用途 |
|---|---|---|
| 手持 | handheld, slight camera shake | 呼吸感、紧张、纪实、"在场"——新闻感和惊悚片的标配 |
| 稳定器/滑轨 | smooth gimbal / dolly movement | 丝滑、高级、掌控感——广告和电影感的默认 |
| 轨道/摇臂 | crane / jib movement | 仪式感、宏大调度——开场和收尾镜头 |
| 无人机 | aerial drone shot | 上帝视角、地理交代、自由穿越 |
运镜速度是情绪的旋钮:慢推=紧张或专注在积聚;快推(crash zoom)=突然的惊觉;慢拉=怅然、抽离、故事结束了;缓慢环绕=审视与仪式感。写运镜时问自己 L3 就该问的问题:这个运动在替叙事做什么?答不上来就用固定机位——没有动机的运镜是视频版的"废形容词"。
提示
质感词也是治「AI 味」的偏方之一:模型默认输出偏向过分丝滑的稳定器观感,全片如此就假得均匀。刻意在纪实感镜头里加 handheld、在情绪镜头里控制运镜速度,节奏的「人味」就回来了。
动作控制的强度谱系
把 unit-1 至今所有控制动作的手段排成一条谱系,强度从左到右递增:
纯文字 首尾帧 动作参考视频 表演迁移
(L3 十槽位) (L4 两端钉死) (给模型看"这样动") (逐帧驱动角色)
──────────────────────────────────────────────────→ 控制力增强
可控性最低 状态可控但 运动轨迹可控 表情口型级精确
抽卡感最强 过程仍自由发挥 细节仍有发挥 自由度最低
动作参考视频:部分平台支持上传一段视频作为"运动模板"——模型提取其中的运动模式(人物动作或镜头运动)应用到你的画面上。它和表演迁移的区别在精度:参考是"照这个感觉动",迁移是"逐帧照搬"。
表演迁移是本课主角:录一段真人表演(你自己),让它驱动任意角色——你挑眉,角色挑眉;你的口型,角色的口型。表演这个最难被语言描述的东西,绕过了语言。
说明
当前版本速览(2026-07,过时请以官网为准):Runway Act-Two 用真人表演视频驱动角色的动作与表情;Kling Motion Control 将表演视频+角色图像+文字指令组合做动作迁移。数字人口型方向(HeyGen 等)是表演迁移的近亲,L8 数字人课专讲。开放生态里视频 LoRA 也可定制动作风格(L10 展开)。
拍好你的表演素材:五条军规
迁移质量的上限在你的原始素材。用手机拍就行,但守住五条:
- 光线均匀,脸别糊:面部特征是追踪的原料,阴阳脸和逆光会让表情捕捉大打折扣;
- 机位固定,正面拍:表演素材里的相机必须不动——你的运镜应该由生成侧决定(L3 的十槽位⑤),素材里镜头晃动会被当成"动作"迁移过去;
- 表演放大一到两成:迁移过程有衰减,微妙的表情到角色脸上会更微妙直至消失。舞台剧式的略微夸张,落到角色上刚好;
- 时长和节奏对齐镜头表:素材就按目标镜头的秒数演,掐着 L2 镜头表的时长来,别指望后期变速救场;
- 一条素材一个表演事件:和"一个镜头一个动作"(L3)同源——想要"惊讶然后大笑",拍两条分别迁移,比一条里演两段稳定得多。
迁移目标的适配度阶梯
表演能"落"到什么角色上?结构和真人越接近,迁移越保真:
| 目标类型 | 适配度 | 注意事项 |
|---|---|---|
| 写实人物 | 最高 | 几乎全量保留表情细节;注意授权(用谁的脸都要有权利) |
| 插画/动画角色 | 高 | 风格化会吃掉部分微表情,放大表演来补 |
| 三维/拟人角色 | 中 | 五官布局不同,口型映射开始失真 |
| 非人类角色(动物/物体) | 低而有趣 | 只有大幅度动作和头部朝向能迁移;表情靠"拟人化想象",效果全看模型 |
规律和 L4 的首帧检查一脉相承:迁移是"映射",源和目标的结构差异越大,映射丢的信息越多。给非人类角色做表演,预期管理要提前做——能落个"神态"就算赢。
接入工作流:表演镜头的生产线
表演迁移不替代 unit-2 已建立的流程,而是嵌进去——它负责"这一镜里的动作",一致性照旧由资产系统管:
① 镜头表定表演需求 哪几镜需要精确表情/口型(通常是近景反应镜头)
② 首帧照旧派生 角色参考图+风格块 → 该镜首帧(L5 流程不变)
③ 录制表演素材 按五条军规,对着镜头表的时长演
④ 迁移生成 首帧(定角色和画面) + 表演视频(定动作) → 成镜
⑤ 验收 七层照扫,重点加验:表情幅度够不够?口型对不对?
动作有没有把身份层带漂?(动作越大脸越容易漂——L4 老敌人)
注意 ④ 的输入组合:首帧管"是谁、在哪",表演管"怎么动"——这是 L4"解耦"思想的第三次出现(图生视频解耦画面与运动、资产系统解耦设定与生成、表演迁移解耦角色与表演)。识别出这个模式,你就掌握了这个 Track 的底层方法论:把模型自由发挥的空间,一块一块换成你的控制条件。
动手任务:一段表演,两次投胎
基础路线(约 60 分钟):
- 从你 30 秒项目的分镜里挑(或加)一个近景反应镜头(如:主角看到面包店开门,惊喜一笑);
- 用手机按五条军规拍你自己的表演素材,3–5 秒,演两条备选;
- 准备两个迁移目标的首帧:你的主角标准像(写实或插画,来自 L5 资产包)+ 一个非人类角色(找个乐子:一只猫、一个拟人化的咖啡杯);
- 分别迁移,各生成 1–2 条;
- 写动作误差分析(三行):哪些表演细节保住了?哪些丢了?丢失程度和"适配度阶梯"的预测一致吗?
- 把主角版成镜插进你的四镜头片段——你的 30 秒项目从此有了第一个真正"有表演"的镜头。
进阶路线(可选):同一条表演素材,分别用"纯文字描述这段表演"和"表演迁移"生成同一镜头,并排对比——用你自己的脸验证控制谱系两端的差距。
随堂测验
1. 一个惊悚短片的追逐镜头,想要「观众也在现场逃跑」的紧张感。运镜质感上最应该选?
2. 你对着手机演了一段「从疑惑到恍然大悟」,迁移到插画角色后表情几乎看不出变化。按本课方法,最该调整的是?
3. 表演素材拍摄时要求「机位必须固定」,原因是?
4. 「首帧管是谁在哪,表演管怎么动」被称为本 Track 底层方法论的第三次出现。这个方法论是?
划选正文任意文字可高亮、批注或加入复习卡
讨论
载入中…