Be Known通知设置

课程库 AI 视频生成 从创意到镜头 › 第 3

视频提示词与时间语言——描述"画面如何变化"

普通课50 分钟

本课导读

图像提示词描述"画面是什么"(视觉课 L2 的十二槽位),视频提示词要多干一件事:描述"画面如何变化"。多出来的这个时间维度,就是视频提示词全部的新难度——动作有先后、运镜有轨迹、光线会流动、镜头有起点和终点。本课给出视频提示词的十槽位结构、动作描述的四要素、运镜的相对运动写法,以及一条最重要的纪律:一个镜头,一个动作。上一课镜头表里空着的"提示词草稿"栏,学完本课就能填上。预计 50 分钟。

十槽位结构:给时间留出位置

视频提示词的推荐结构——注意它本质上是把图像十二槽位沿时间轴展开

① 主体         谁/什么(外观锁定要素写足——它要稳定存在好几秒)
② 场景         在哪里,时间天气(同图像④)
③ 初始状态     镜头开始的瞬间:主体在哪、什么姿态、看向哪
④ 动作过程     发生了什么,按时间顺序,带方向
⑤ 摄影机运动   机位怎么动:轨迹+速度+与主体的关系
⑥ 光线变化     静态光写法同图像⑦;若光线随时间变要显式说
⑦ 速度与节奏   动作快慢、匀速还是渐变(slow motion / 缓慢地 / 突然)
⑧ 声音         对白/环境音/音效(模型支持原生音频时)
⑨ 结束状态     镜头结束的瞬间画面定格在什么状态
⑩ 限制条件     不要什么:无镜头切换、无字幕、不要变形…

大纲里的示范(值得逐槽位对照读一遍):

一名穿黄色雨衣的女孩站在空旷车站(①②③)。她先看向远处,
随后缓慢转身走向摄影机(④,两个动作有明确先后和方向)。
摄影机以低机位向后平稳跟拍(⑤,机位+方向+速度),
背景列车从右向左驶过(④ 的环境动作,带方向)。
阴天自然光(⑥),轻微风声和列车摩擦声(⑧),无镜头切换(⑩)。

三个最容易空着的槽位恰恰最重要:③ 初始状态和 ⑨ 结束状态框住了镜头的两端(下一课的首尾帧控制就是它们的图像化身);⑩ 的"无镜头切换"几乎值得每条都写——不写的话,模型经常自作主张在 5 秒里剪两刀,你的分镜就被它拆了。

动作描述四要素

"她在街上走"是许愿;可执行的动作描述有四个要素:

要素反例正例
具体的动词她移动到门口快步走到门口 / 她踉跄着挪到门口
方向列车驶过列车从右向左驶过
时间顺序她转身、看表、微笑看向远处,随后缓慢转身,最后露出微笑
幅度与速度他挥手大幅度地快速挥手 / 他几不可察地抬了抬手

方向词是重中之重:上一课在分镜表里标注的运动方向(轴线纪律),就是在这里落进提示词的。分镜表写"向右",提示词就必须写"从左向右"——链条断在哪一环,成片就穿帮在哪一环。

顺序词(先/随后/接着/最后)是模型理解"时间"的抓手。没有顺序词的多动作提示,模型可能同时执行、乱序执行、或只挑一个执行。

运镜:写清"摄影机和主体的相对运动"

七种基本运镜,按"机位动不动"分两组:

运镜提示词写法叙事感受
固定机位static shot / 固定镜头冷静、客观、留给表演
摇(原地转头)pan left/right / 向左摇环视、跟随视线
slow push-in / 缓慢推近聚焦、情绪升温、"注意这里"
pull back / 缓慢拉远揭示环境、抽离、收尾感
移/跟tracking shot / 侧面跟拍陪伴主体、代入
升降crane up / 镜头升起宏大、上帝视角切换
环绕orbit around / 环绕主体强调主体、广告感

写运镜的公式:轨迹 + 速度 + 与主体的关系。"摄影机缓慢推近(轨迹+速度),始终对准她的面部(关系)"。

最容易翻车的是主体和机位同时动——"她向前跑,摄影机同时环绕她"这种双重运动对模型是高难动作,物理错误率飙升。安全梯度:静止主体+运动机位 〉运动主体+固定机位 〉运动主体+简单跟拍 〉双重复杂运动。前期分镜时就按这个梯度控制难度,把双重运动留给最值得烧额度的关键镜头。

提示

入门期最被低估的运镜是固定机位:模型不用分配算力去"演"摄影机,主体动作质量通常反而最高,而且最不容易出物理错误。大师们的定场戏也偏爱固定机位——便宜和高级有时是同一个选择。

一个镜头,一个动作

上一课讲过动作幻觉随事件数量增长。这里把它升级成本 Track 最重要的提示词纪律:

一条提示 = 一个镜头 = 一个主要动作(外加至多一个环境动作或一个运镜)。

"她走进咖啡馆,点了一杯拿铁,坐到窗边,打开笔记本电脑"——这是四个镜头的量,塞进一条提示的结果通常是:模型挑一个动作执行,或把四个动作压缩成鬼畜的三秒。正确做法回到 L2:在分镜阶段就把动作拆到镜头里,每镜一个动作,用剪辑连起来。

自查方法:数提示词里的动词。主体动词超过两个("先…随后…"算合法的两个),就该拆镜了。

提示冲突的视频版

视觉课 L2 的三种失败模式(冲突/优先级/长提示失效)在视频里全部成立,且各有时间版变体:

  • 时长冲突:5 秒的镜头写了 20 秒的事("她慢慢环顾整个房间,然后仔细阅读信件")——每个动作留 2–4 秒的预算去规划;
  • 速度冲突:⑦ 写了 slow motion,④ 里却是"迅速冲刺"——到底要快还是慢?
  • 运镜-动作冲突:⑤ 写"固定机位",④ 却要求"跟随她穿过三个房间"——固定机位跟不了人。

写完通读一遍,专查"时间账"和"空间账"能不能对上。

动手任务:五类镜头 + 迭代日志

把运镜表变成手感。设计一个简单场景(可以直接用你 L2 文档包里的场景),生成五类镜头:

基础路线(约 50 分钟):

  1. 依次生成:固定机位 / 跟拍 / 环绕 / 推近或拉远 / 一个含双重运动的复杂镜头(最后这个就是让你见识翻车率的);
  2. 每条提示词用十槽位结构写,动作带足四要素,全部加"无镜头切换";
  3. 沿用视觉课的实验日志格式记录每条:提示词、模型、结果、问题归因(提示?模型?物理幻觉?)、下一版怎么改;
  4. 复盘:五类里哪类成功率最高/最低?和本课"安全梯度"的预测一致吗?

进阶路线(可选):挑成功率最低的那类镜头,做一轮单变量降级实验——保持画面内容不变,把双重运动拆成"只动主体"和"只动机位"两条分别生成,验证"双重运动是难度倍增器"这个结论。

注意

本课作业的实验日志别丢:L2 镜头表的「提示词草稿」栏现在可以正式填写了——用十槽位把你 30 秒项目的 6–10 个镜头全部写出来,就是下一课开工前的最佳准备。

随堂测验

随堂测验0 / 4 题正确

1. 提示词写了「她推开门走进书店,浏览书架,抽出一本书翻看,然后走向收银台」。按本课纪律,问题在哪?

2. 「摄影机环绕一位正在旋转跳跃的舞者」生成失败率很高。按「安全梯度」,保住画面代价最小的降级方案是?

3. 为什么建议几乎每条视频提示词都写上「无镜头切换」?

4. 分镜表里标了「跑者从左向右」,提示词却只写「跑者跑过街道」。最可能的后果和正确做法是?

划选正文任意文字可高亮、批注或加入复习卡

讨论

载入中…