课程库 › AI 视频生成 › 从创意到镜头 › 第 3 课
视频提示词与时间语言——描述"画面如何变化"
普通课约 50 分钟
本课导读
图像提示词描述"画面是什么"(视觉课 L2 的十二槽位),视频提示词要多干一件事:描述"画面如何变化"。多出来的这个时间维度,就是视频提示词全部的新难度——动作有先后、运镜有轨迹、光线会流动、镜头有起点和终点。本课给出视频提示词的十槽位结构、动作描述的四要素、运镜的相对运动写法,以及一条最重要的纪律:一个镜头,一个动作。上一课镜头表里空着的"提示词草稿"栏,学完本课就能填上。预计 50 分钟。
十槽位结构:给时间留出位置
视频提示词的推荐结构——注意它本质上是把图像十二槽位沿时间轴展开:
① 主体 谁/什么(外观锁定要素写足——它要稳定存在好几秒)
② 场景 在哪里,时间天气(同图像④)
③ 初始状态 镜头开始的瞬间:主体在哪、什么姿态、看向哪
④ 动作过程 发生了什么,按时间顺序,带方向
⑤ 摄影机运动 机位怎么动:轨迹+速度+与主体的关系
⑥ 光线变化 静态光写法同图像⑦;若光线随时间变要显式说
⑦ 速度与节奏 动作快慢、匀速还是渐变(slow motion / 缓慢地 / 突然)
⑧ 声音 对白/环境音/音效(模型支持原生音频时)
⑨ 结束状态 镜头结束的瞬间画面定格在什么状态
⑩ 限制条件 不要什么:无镜头切换、无字幕、不要变形…
大纲里的示范(值得逐槽位对照读一遍):
一名穿黄色雨衣的女孩站在空旷车站(①②③)。她先看向远处,
随后缓慢转身走向摄影机(④,两个动作有明确先后和方向)。
摄影机以低机位向后平稳跟拍(⑤,机位+方向+速度),
背景列车从右向左驶过(④ 的环境动作,带方向)。
阴天自然光(⑥),轻微风声和列车摩擦声(⑧),无镜头切换(⑩)。
三个最容易空着的槽位恰恰最重要:③ 初始状态和 ⑨ 结束状态框住了镜头的两端(下一课的首尾帧控制就是它们的图像化身);⑩ 的"无镜头切换"几乎值得每条都写——不写的话,模型经常自作主张在 5 秒里剪两刀,你的分镜就被它拆了。
动作描述四要素
"她在街上走"是许愿;可执行的动作描述有四个要素:
| 要素 | 反例 | 正例 |
|---|---|---|
| 具体的动词 | 她移动到门口 | 她快步走到门口 / 她踉跄着挪到门口 |
| 方向 | 列车驶过 | 列车从右向左驶过 |
| 时间顺序 | 她转身、看表、微笑 | 她先看向远处,随后缓慢转身,最后露出微笑 |
| 幅度与速度 | 他挥手 | 他大幅度地快速挥手 / 他几不可察地抬了抬手 |
方向词是重中之重:上一课在分镜表里标注的运动方向(轴线纪律),就是在这里落进提示词的。分镜表写"向右",提示词就必须写"从左向右"——链条断在哪一环,成片就穿帮在哪一环。
顺序词(先/随后/接着/最后)是模型理解"时间"的抓手。没有顺序词的多动作提示,模型可能同时执行、乱序执行、或只挑一个执行。
运镜:写清"摄影机和主体的相对运动"
七种基本运镜,按"机位动不动"分两组:
| 运镜 | 提示词写法 | 叙事感受 |
|---|---|---|
| 固定机位 | static shot / 固定镜头 | 冷静、客观、留给表演 |
| 摇(原地转头) | pan left/right / 向左摇 | 环视、跟随视线 |
| 推 | slow push-in / 缓慢推近 | 聚焦、情绪升温、"注意这里" |
| 拉 | pull back / 缓慢拉远 | 揭示环境、抽离、收尾感 |
| 移/跟 | tracking shot / 侧面跟拍 | 陪伴主体、代入 |
| 升降 | crane up / 镜头升起 | 宏大、上帝视角切换 |
| 环绕 | orbit around / 环绕主体 | 强调主体、广告感 |
写运镜的公式:轨迹 + 速度 + 与主体的关系。"摄影机缓慢推近(轨迹+速度),始终对准她的面部(关系)"。
最容易翻车的是主体和机位同时动——"她向前跑,摄影机同时环绕她"这种双重运动对模型是高难动作,物理错误率飙升。安全梯度:静止主体+运动机位 〉运动主体+固定机位 〉运动主体+简单跟拍 〉双重复杂运动。前期分镜时就按这个梯度控制难度,把双重运动留给最值得烧额度的关键镜头。
提示
入门期最被低估的运镜是固定机位:模型不用分配算力去"演"摄影机,主体动作质量通常反而最高,而且最不容易出物理错误。大师们的定场戏也偏爱固定机位——便宜和高级有时是同一个选择。
一个镜头,一个动作
上一课讲过动作幻觉随事件数量增长。这里把它升级成本 Track 最重要的提示词纪律:
一条提示 = 一个镜头 = 一个主要动作(外加至多一个环境动作或一个运镜)。
"她走进咖啡馆,点了一杯拿铁,坐到窗边,打开笔记本电脑"——这是四个镜头的量,塞进一条提示的结果通常是:模型挑一个动作执行,或把四个动作压缩成鬼畜的三秒。正确做法回到 L2:在分镜阶段就把动作拆到镜头里,每镜一个动作,用剪辑连起来。
自查方法:数提示词里的动词。主体动词超过两个("先…随后…"算合法的两个),就该拆镜了。
提示冲突的视频版
视觉课 L2 的三种失败模式(冲突/优先级/长提示失效)在视频里全部成立,且各有时间版变体:
- 时长冲突:5 秒的镜头写了 20 秒的事("她慢慢环顾整个房间,然后仔细阅读信件")——每个动作留 2–4 秒的预算去规划;
- 速度冲突:⑦ 写了 slow motion,④ 里却是"迅速冲刺"——到底要快还是慢?
- 运镜-动作冲突:⑤ 写"固定机位",④ 却要求"跟随她穿过三个房间"——固定机位跟不了人。
写完通读一遍,专查"时间账"和"空间账"能不能对上。
动手任务:五类镜头 + 迭代日志
把运镜表变成手感。设计一个简单场景(可以直接用你 L2 文档包里的场景),生成五类镜头:
基础路线(约 50 分钟):
- 依次生成:固定机位 / 跟拍 / 环绕 / 推近或拉远 / 一个含双重运动的复杂镜头(最后这个就是让你见识翻车率的);
- 每条提示词用十槽位结构写,动作带足四要素,全部加"无镜头切换";
- 沿用视觉课的实验日志格式记录每条:提示词、模型、结果、问题归因(提示?模型?物理幻觉?)、下一版怎么改;
- 复盘:五类里哪类成功率最高/最低?和本课"安全梯度"的预测一致吗?
进阶路线(可选):挑成功率最低的那类镜头,做一轮单变量降级实验——保持画面内容不变,把双重运动拆成"只动主体"和"只动机位"两条分别生成,验证"双重运动是难度倍增器"这个结论。
注意
本课作业的实验日志别丢:L2 镜头表的「提示词草稿」栏现在可以正式填写了——用十槽位把你 30 秒项目的 6–10 个镜头全部写出来,就是下一课开工前的最佳准备。
随堂测验
1. 提示词写了「她推开门走进书店,浏览书架,抽出一本书翻看,然后走向收银台」。按本课纪律,问题在哪?
2. 「摄影机环绕一位正在旋转跳跃的舞者」生成失败率很高。按「安全梯度」,保住画面代价最小的降级方案是?
3. 为什么建议几乎每条视频提示词都写上「无镜头切换」?
4. 分镜表里标了「跑者从左向右」,提示词却只写「跑者跑过街道」。最可能的后果和正确做法是?
划选正文任意文字可高亮、批注或加入复习卡
讨论
载入中…