Be Known通知设置

课程库 AI 视频生成 从创意到镜头 › 第 1

AI 视频的能力边界与生产全流程

普通课45 分钟

本课导读

AI 视频是当下迭代最快、也最容易被误解的领域:演示片段一个比一个惊艳,但真上手就会发现——生成一个好看的 5 秒镜头和做出一条能用的 30 秒视频,是两件难度差一个量级的事。本课先建立三条基本原则,把"文字生成视频工具"的想象校正为"动态影像生产系统"的现实,然后给出贯穿整个 Track 的生产全流程图和模型地图。预计 45 分钟。

说明

建议先修:本 Track 与「AI 视觉生成」共享大量地基(提示结构、一致性、归因方法),两个 Track 可并行学习,但视频课会直接引用视觉课的概念而不重讲。动手任务同样分基础路线(浏览器+免费额度可完成)和进阶路线(本地部署/付费平台,可跳过)。

三条基本原则

原则一:生成不等于完成。模型输出的只是素材,不是成片。一条能发布的视频 = 生成的镜头 + 导演判断(哪条能用)+ 剪辑(顺序和节奏)+ 声音 + 字幕 + 质量控制。把生成结果直接当成品发出去,是新手和职业使用者最直观的分界线。

原则二:单镜头质量不等于叙事质量。当前模型生成一个孤立镜头已经可以很惊艳,但真正的难题在镜头之间:第二个镜头里的主角还是同一张脸吗?她从画面左侧出门,下个镜头是不是从右侧进来?光线方向、服装、道具接得上吗?AI 视频的核心战场已经从"能不能生成画面"转移到一致性、连续性和多镜头叙事——这也是本 Track 用整个 unit-2 来讲它的原因。

原则三:提示词不是唯一控制手段。视频生成的输入远比"一段文字"丰富:参考图(定人物和场景)、首帧尾帧(定起点终点)、表演视频(定动作表情)、音频(定口型节奏)、运动轨迹、以及剪辑时间线本身。越依赖纯文字,结果越像抽卡;越会组合条件,结果越像生产。

生产全流程:本 Track 的地图

整个 Track 就是沿着这条链条展开的,每一环对应后面的课程:

创意简报 → 剧本 → 角色与场景设定 → 分镜 → 动态预演
   → 单镜头生成 → 连续性管理 → 声音设计 → 剪辑合成 → 多平台交付
  (L2 前期开发)   (L3-L4 镜头)   (L5-L8 连续性/表演) (L9 声音)
                          (L10-L12 工作流/后期/自动化)

注意链条的形状:生成只是中间一环。前期(剧本分镜)决定你生成什么,后期(剪辑声音)决定观众看到什么。行业里一个越来越明显的共识:AI 大幅压缩了"拍摄"的成本,于是前期和后期的功力反而变得更值钱——这正是传统影视知识在 AI 时代的复利。

四种任务形态

和图像一样,先分清你在做哪件事:

  1. 文生视频(text-to-video):文字 → 视频片段。从零探索,最抽卡。
  2. 图生视频(image-to-video):图像(+文字)→ 视频。让一张图动起来;因为首帧锁定了画面,可控性大幅高于文生视频,是目前生产中的主力形态(L4 展开)。
  3. 视频编辑/延展:已有视频 → 修改、延长、重打光、换风格。
  4. 音视频联合生成:一次生成画面+对白+环境音,口型和音效原生同步。这是近两年的关键跃迁——声音不再是纯后期贴上去的。

模型地图:按能力层级选型

能力层级主要用途关键问题
综合创作平台策划、故事板、生成、自然语言剪辑一站式适合走完全流程,深度控制有限
原生音视频生成对白、环境音与画面同步生成音画同步质量,多语言能力
专业镜头生成电影感单镜头、广告镜头、运动质量提示遵循、物理合理性
多镜头与叙事一次生成多个镜头的连续片段跨镜头一致性
表演与动作控制真人表演驱动角色的动作、表情、口型迁移精度,风格适配
数字人与翻译讲解视频、数字分身、多语言配音口型同步、授权合规
开放模型本地生成、LoRA 定制、私有化显存门槛、生态工具链
节点与自动化批量生成、格式转换、自动质检工程能力(你的 Python 直接用得上)

提示

当前版本速览(2026-07,过时请以官网为准):综合平台——Google Flow、Adobe Firefly;原生音视频——Veo 3.1、Kling 3.0(约 15 秒+原生音频)、LTX-2;专业镜头——Runway Gen-4.5、Hailuo 2.3;多镜头叙事——Seedance 系列;表演控制——Runway Act-Two、Kling Motion Control;数字人——HeyGen Avatar IV/V、ElevenLabs Dubbing;开放模型——Wan2.2、LTX-2、HunyuanVideo-1.5;工作流——ComfyUI + FFmpeg。正文只讲层级,版本换代不影响方法。

视频特有的失败模式

图像课的"四层归因"(提示/模型/数据/工作流)在视频里依然成立,但视频多了一个维度——时间,于是多出三类图像里不存在的错误:

  • 时间漂移(temporal drift):镜头开始时的人脸,五秒后悄悄变成了另一个人;背景建筑随时间"生长变形"。本质是模型在逐帧生成中累积误差。
  • 物理错误:液体倒流、脚步滑冰(脚在动人没前进)、碰撞穿模、布料鬼畜、光影方向突变。模型学的是"画面像什么",不是物理定律。
  • 动作幻觉:提示"她拿起杯子喝水",生成的却是杯子自己飞到嘴边,或者出现第三只手来递杯子。单镜头里塞的事件数量越多,动作幻觉越严重(L3 会给出"一个镜头一个动作"的写法纪律)。

评估一个视频模型,光看画质远远不够。从第一课就开始用这七个维度打分:提示遵循、主体稳定性(时间一致性)、动作质量、摄影机运动、物理合理性、声音效果、速度与成本

动手任务:第一次多模型镜头测试

设计一个 5–10 秒的镜头,故意包含"一个明确的动作 + 一个摄影机运动"(这是最容易暴露模型差距的组合)。例如:"一位穿风衣的男人在雨中走向街角咖啡馆并推门进入,摄影机从背后平稳跟随。"

基础路线(约 45 分钟):

  1. 挑至少 3 个模型(免费额度即可;至少一个支持图生视频);
  2. 用相同的提示词各生成 2–4 条;
  3. 按七维度填写测试表:
镜头测试表 —— 镜头描述:______
日期:____  提示词全文:(粘贴)

维度            模型A    模型B    模型C
提示遵循        _       _       _
主体稳定性      _       _       _
动作质量        _       _       _
摄影机运动      _       _       _
物理合理性      _       _       _
声音(若支持)    _       _       _
速度/成本       _       _       _
最佳样本编号与一句话理由:____
  1. 从所有样本里挑出最好的一条最离谱的一条,各写两句话:好在哪/错在哪一层(提示?模型?物理幻觉?)。

进阶路线(可选):先用图像模型生成一张理想首帧,再用图生视频跑同一镜头,与纯文生视频的结果对比——你会提前体会到 L4 的核心结论:锁住首帧,可控性质变

随堂测验

随堂测验0 / 4 题正确

1. 「AI 视频的核心难题已经从单镜头画质转向别处」——转向了哪里?

2. 生成的视频里,人物走路时双脚在滑动但身体没有前进(「滑冰步」)。这属于哪类问题?

3. 为什么说图生视频是「目前生产中的主力形态」?

4. 「AI 压缩了拍摄成本,反而让前期和后期更值钱」。以下哪项工作属于「变得更值钱」的部分?

划选正文任意文字可高亮、批注或加入复习卡

讨论

载入中…