课程库 › AI 视频生成 › 从创意到镜头 › 第 2 课
从创意到剧本、分镜与动态预演
普通课约 50 分钟
本课导读
上一课说过:AI 压缩了"拍摄"成本,前期开发反而更值钱。原因很实际——生成是按秒计费的抽卡,前期每多想清楚一步,后面就少烧一轮额度。本课把传统影视的前期开发流程裁剪成适合 AI 视频的轻量版:从一句话创意到剧本、场次表、分镜、镜头表,最后做出"动态预演"。学完你会拥有一套 30 秒短片的完整前期文档——它就是 unit-1 后两课和期末项目的原材料。预计 50 分钟。
前期开发链条
创意简报 → 故事梗概 → 剧本 → 场次表 → 分镜 → 镜头表 → 动态预演
(为什么做)(讲什么)(怎么讲)(在哪拍)(画面长啥样)(生成参数)(动起来验证)
传统影视里这条链养活整个部门;AI 时代你一个人走完,但每一环的思考不能省——省掉的每一步都会在生成阶段以"抽卡次数 × 单价"的形式还回来。好消息是:每一环都可以让大语言模型当副驾驶,你出判断,它出草稿。
创意简报与故事梗概:先回答"为什么"
创意简报四问,一页纸写完:
- 给谁看?(目标观众和发布平台——竖屏 15 秒和横屏 60 秒是两个物种)
- 看完要产生什么?(情绪?记住品牌?点购买?)
- 一句话故事("一个__在__遇到__,最后__")
- 约束(时长、比例、预算/额度上限、必须出现的元素)
故事梗概则是把一句话展开成 3–5 句,检验它有没有最小叙事结构:开场状态 → 变化/冲突 → 结果。30 秒的片子也需要这个骨架,否则就只是"一组好看的镜头"——上一课原则二的另一种说法。
剧本:AI 视频的剧本要"写画面"
AI 短片剧本不需要标准剧本格式,但要遵守一条铁律:只写看得见、听得见的东西。"他很难过"模型无法执行;"他盯着手机屏幕,慢慢把它扣在桌上,靠向椅背"才是可生成的语言。这和视觉课"提示词是规格不是愿望"一脉相承——剧本就是拉长到 30 秒的规格书。
【30 秒示例剧本:晨跑者】
清晨的城市还没醒。一位女性跑者独自穿过空荡的街道,
呼吸声和脚步声清晰可闻。(开场状态)
她在路口停下,被什么吸引——街角面包店刚开门,
暖黄的灯光涌到人行道上。(变化)
她看了看手表,犹豫一秒,笑了,转身走进面包店。
门上的风铃响起。(结果)
场次表与分镜:把故事切成镜头
场次表回答"有几个空间"。上面的剧本只有两个场景:①清晨街道、②面包店门口。场景越少,unit-2 要讲的连续性管理越轻松——AI 短片主动控制场景数量是聪明的自我设限(30 秒建议不超过 3 个场景)。
分镜回答"每个镜头观众看到什么"。这里需要景别语言——你只需先掌握五种:
| 景别 | 画面内容 | 叙事功能 |
|---|---|---|
| 大远景/建立镜头 | 环境为主,人很小 | 告诉观众"我们在哪" |
| 全景 | 人物全身+环境 | 展示动作和空间关系 |
| 中景 | 膝盖/腰部以上 | 对话、动作细节,最常用 |
| 近景 | 胸部以上 | 情绪、反应 |
| 特写 | 脸部/物体局部 | 强调、转折、信息点 |
三条组合原则,够用到期末项目:
- 先建立再靠近:新场景先给建立镜头或全景,观众才知道身在何处;
- 景别要跳档:相邻镜头景别拉开差距(全景→近景),只挪一小步(中景→中近景)观众会觉得"画面跳了一下";
- 动作—反应交替:一个"发生了什么"的镜头,接一个"人物什么反应"的镜头,节奏自然出现。
轴线(180 度规则)先记一条实用简化版:同一场景里,人物运动方向和视线方向在相邻镜头中保持同侧。跑者第一镜从左往右跑,后面所有镜头她都应该朝右——除非你想表达"折返"。AI 生成的镜头方向常常随机,在分镜阶段就标注每个镜头的方向,unit-2 讲连续性时你会感谢现在的自己。
把示例剧本切成 6 镜(30 秒短片切 6–10 镜是舒适区):
镜1 [建立·大远景] 清晨空荡街道,跑者远远入画,从左向右 4s
镜2 [全景·跟拍] 侧面跟拍跑步,背景店铺连续后移,向右 5s
镜3 [近景] 呼吸与神情,晨光在脸上,运动感 4s
镜4 [中景] 路口停下,转头看向画面右侧(视线引导) 4s
镜5 [POV·全景] 她看到的:面包店开门,暖光涌出 5s
镜6 [中景→近景] 看表、微笑、转身入店,风铃声收尾 8s
注意镜 4 → 镜 5 是一对"视线—对象"组合:她往右看,下一镜就是她看到的东西。这是剪辑思维(L7)最基础的粘合剂,前期埋好,生成时才知道该要什么。
镜头表:直接翻译成生成参数
分镜是给人看的,镜头表是给模型看的——把每个镜头的信息整理成可以直接喂给生成工具的字段。这一步是 AI 工作流特有的,传统镜头表没有"提示词草稿"这一列:
镜头编号:镜2
时长:5s 画幅:16:9
景别/机位:全景,侧面平视
摄影机运动:匀速横移跟拍,与主体同速
画面内容:女性跑者晨跑,浅灰运动服,马尾辫;
背景为清晨湿润街道与卷帘门店铺
运动方向:从左向右(全片统一)
光线:清晨低角度侧光,冷调微暖
声音预设:脚步、呼吸、稀疏鸟鸣(若模型支持原生音频)
生成方式:图生视频(首帧另行生成)
提示词草稿:(L3 的作业就是把这一栏写出来)
动态预演:花小钱验证,再花大钱生成
传统动画的 animatic(把分镜草图按时长剪在一起配上参考音乐)在 AI 流程里有个高性价比版本:
- 用图像模型为每个镜头生成一张静态分镜图(便宜、快、可反复抽);
- 把 6 张图按镜头时长拖进任何剪辑工具(甚至手机 App),配上临时音乐;
- 播放这条 30 秒"幻灯片",检查:节奏对不对?镜头顺序讲得通吗?哪个镜头多余、哪里缺一拍?
在静态阶段发现问题,成本是重抽一张图;在视频阶段发现问题,成本是重生成整个镜头。这就是预演存在的全部理由。而且这些分镜图不是废品——它们正是 L4 图生视频的首帧候选。
提示
让大语言模型当前期副驾驶的正确姿势:给它创意简报四问的答案,让它出 3 版故事梗概供你挑;你定了梗概后让它草拟分镜表,然后你来砍——砍场景数、砍镜头数、砍单镜头里的动作数。模型的草稿普遍贪多,而 AI 视频生产的纪律恰恰是做减法。
动手任务:完成你的 30 秒前期文档包
选一个你真想做的 30 秒题材(产品广告/城市小品/宠物故事/一个习惯的养成…),产出四件套:
基础路线(约 60 分钟,全程只需文本工具+图像模型):
- 创意简报:四问各一句话;
- 剧本:3–5 句,只写看得见听得见的内容,含"状态→变化→结果";
- 分镜+镜头表:6–10 镜,每镜标注景别、时长、摄影机运动、运动方向,其中至少包含一个建立镜头和一对"视线—对象"组合;至少 2 个镜头填完整镜头表字段;
- 静态预演:用图像模型生成各镜分镜图(风格不必完美统一,unit-2 才解决一致性),按时长排成序列播一遍,写下你发现的 1–2 个节奏问题和修改决定。
进阶路线(可选):挑 1 个镜头直接图生视频,对比"有分镜图打底"和上一课"纯文字抽卡"的可控性差距。
注意
这套文档包不是一次性作业——L3 要为它写提示词,L4 要用它的分镜图做首帧,期末项目大概率就是它的完成版。选题材时选个你愿意相处一个月的。
随堂测验
1. 为什么说 AI 视频时代「前期每多想一步,后面就少烧一轮额度」?
2. 剧本里写「她很失落」,按本课的铁律应该改成?
3. 分镜里跑者第一镜从左向右跑,第三镜突然从右向左跑(并非剧情折返)。观众的直觉感受和问题根源是?
4. 动态预演(静态分镜图按时长剪成序列)在 AI 工作流里的核心价值是?
划选正文任意文字可高亮、批注或加入复习卡
讨论
载入中…