课程库 › AI 视频生成 › 从创意到镜头 › 第 1 课
AI 视频的能力边界与生产全流程
普通课约 45 分钟
本课导读
AI 视频是当下迭代最快、也最容易被误解的领域:演示片段一个比一个惊艳,但真上手就会发现——生成一个好看的 5 秒镜头和做出一条能用的 30 秒视频,是两件难度差一个量级的事。本课先建立三条基本原则,把"文字生成视频工具"的想象校正为"动态影像生产系统"的现实,然后给出贯穿整个 Track 的生产全流程图和模型地图。预计 45 分钟。
说明
建议先修:本 Track 与「AI 视觉生成」共享大量地基(提示结构、一致性、归因方法),两个 Track 可并行学习,但视频课会直接引用视觉课的概念而不重讲。动手任务同样分基础路线(浏览器+免费额度可完成)和进阶路线(本地部署/付费平台,可跳过)。
三条基本原则
原则一:生成不等于完成。模型输出的只是素材,不是成片。一条能发布的视频 = 生成的镜头 + 导演判断(哪条能用)+ 剪辑(顺序和节奏)+ 声音 + 字幕 + 质量控制。把生成结果直接当成品发出去,是新手和职业使用者最直观的分界线。
原则二:单镜头质量不等于叙事质量。当前模型生成一个孤立镜头已经可以很惊艳,但真正的难题在镜头之间:第二个镜头里的主角还是同一张脸吗?她从画面左侧出门,下个镜头是不是从右侧进来?光线方向、服装、道具接得上吗?AI 视频的核心战场已经从"能不能生成画面"转移到一致性、连续性和多镜头叙事——这也是本 Track 用整个 unit-2 来讲它的原因。
原则三:提示词不是唯一控制手段。视频生成的输入远比"一段文字"丰富:参考图(定人物和场景)、首帧尾帧(定起点终点)、表演视频(定动作表情)、音频(定口型节奏)、运动轨迹、以及剪辑时间线本身。越依赖纯文字,结果越像抽卡;越会组合条件,结果越像生产。
生产全流程:本 Track 的地图
整个 Track 就是沿着这条链条展开的,每一环对应后面的课程:
创意简报 → 剧本 → 角色与场景设定 → 分镜 → 动态预演
→ 单镜头生成 → 连续性管理 → 声音设计 → 剪辑合成 → 多平台交付
(L2 前期开发) (L3-L4 镜头) (L5-L8 连续性/表演) (L9 声音)
(L10-L12 工作流/后期/自动化)
注意链条的形状:生成只是中间一环。前期(剧本分镜)决定你生成什么,后期(剪辑声音)决定观众看到什么。行业里一个越来越明显的共识:AI 大幅压缩了"拍摄"的成本,于是前期和后期的功力反而变得更值钱——这正是传统影视知识在 AI 时代的复利。
四种任务形态
和图像一样,先分清你在做哪件事:
- 文生视频(text-to-video):文字 → 视频片段。从零探索,最抽卡。
- 图生视频(image-to-video):图像(+文字)→ 视频。让一张图动起来;因为首帧锁定了画面,可控性大幅高于文生视频,是目前生产中的主力形态(L4 展开)。
- 视频编辑/延展:已有视频 → 修改、延长、重打光、换风格。
- 音视频联合生成:一次生成画面+对白+环境音,口型和音效原生同步。这是近两年的关键跃迁——声音不再是纯后期贴上去的。
模型地图:按能力层级选型
| 能力层级 | 主要用途 | 关键问题 |
|---|---|---|
| 综合创作平台 | 策划、故事板、生成、自然语言剪辑一站式 | 适合走完全流程,深度控制有限 |
| 原生音视频生成 | 对白、环境音与画面同步生成 | 音画同步质量,多语言能力 |
| 专业镜头生成 | 电影感单镜头、广告镜头、运动质量 | 提示遵循、物理合理性 |
| 多镜头与叙事 | 一次生成多个镜头的连续片段 | 跨镜头一致性 |
| 表演与动作控制 | 真人表演驱动角色的动作、表情、口型 | 迁移精度,风格适配 |
| 数字人与翻译 | 讲解视频、数字分身、多语言配音 | 口型同步、授权合规 |
| 开放模型 | 本地生成、LoRA 定制、私有化 | 显存门槛、生态工具链 |
| 节点与自动化 | 批量生成、格式转换、自动质检 | 工程能力(你的 Python 直接用得上) |
提示
当前版本速览(2026-07,过时请以官网为准):综合平台——Google Flow、Adobe Firefly;原生音视频——Veo 3.1、Kling 3.0(约 15 秒+原生音频)、LTX-2;专业镜头——Runway Gen-4.5、Hailuo 2.3;多镜头叙事——Seedance 系列;表演控制——Runway Act-Two、Kling Motion Control;数字人——HeyGen Avatar IV/V、ElevenLabs Dubbing;开放模型——Wan2.2、LTX-2、HunyuanVideo-1.5;工作流——ComfyUI + FFmpeg。正文只讲层级,版本换代不影响方法。
视频特有的失败模式
图像课的"四层归因"(提示/模型/数据/工作流)在视频里依然成立,但视频多了一个维度——时间,于是多出三类图像里不存在的错误:
- 时间漂移(temporal drift):镜头开始时的人脸,五秒后悄悄变成了另一个人;背景建筑随时间"生长变形"。本质是模型在逐帧生成中累积误差。
- 物理错误:液体倒流、脚步滑冰(脚在动人没前进)、碰撞穿模、布料鬼畜、光影方向突变。模型学的是"画面像什么",不是物理定律。
- 动作幻觉:提示"她拿起杯子喝水",生成的却是杯子自己飞到嘴边,或者出现第三只手来递杯子。单镜头里塞的事件数量越多,动作幻觉越严重(L3 会给出"一个镜头一个动作"的写法纪律)。
评估一个视频模型,光看画质远远不够。从第一课就开始用这七个维度打分:提示遵循、主体稳定性(时间一致性)、动作质量、摄影机运动、物理合理性、声音效果、速度与成本。
动手任务:第一次多模型镜头测试
设计一个 5–10 秒的镜头,故意包含"一个明确的动作 + 一个摄影机运动"(这是最容易暴露模型差距的组合)。例如:"一位穿风衣的男人在雨中走向街角咖啡馆并推门进入,摄影机从背后平稳跟随。"
基础路线(约 45 分钟):
- 挑至少 3 个模型(免费额度即可;至少一个支持图生视频);
- 用相同的提示词各生成 2–4 条;
- 按七维度填写测试表:
镜头测试表 —— 镜头描述:______
日期:____ 提示词全文:(粘贴)
维度 模型A 模型B 模型C
提示遵循 _ _ _
主体稳定性 _ _ _
动作质量 _ _ _
摄影机运动 _ _ _
物理合理性 _ _ _
声音(若支持) _ _ _
速度/成本 _ _ _
最佳样本编号与一句话理由:____
- 从所有样本里挑出最好的一条和最离谱的一条,各写两句话:好在哪/错在哪一层(提示?模型?物理幻觉?)。
进阶路线(可选):先用图像模型生成一张理想首帧,再用图生视频跑同一镜头,与纯文生视频的结果对比——你会提前体会到 L4 的核心结论:锁住首帧,可控性质变。
随堂测验
1. 「AI 视频的核心难题已经从单镜头画质转向别处」——转向了哪里?
2. 生成的视频里,人物走路时双脚在滑动但身体没有前进(「滑冰步」)。这属于哪类问题?
3. 为什么说图生视频是「目前生产中的主力形态」?
4. 「AI 压缩了拍摄成本,反而让前期和后期更值钱」。以下哪项工作属于「变得更值钱」的部分?
划选正文任意文字可高亮、批注或加入复习卡
讨论
载入中…