Be Known通知设置

课程库 AI 视频生成 声音、后期与自动化 › 第 1

原生音频与声音设计——一半的观感来自耳朵

普通课55 分钟

本课导读

行业里有句老话:声音是电影的一半。放到 AI 视频上还要更极端——同一段画面,配上环境声和音乐后观感能翻倍,而无声的 AI 片子几乎总是显得"廉价、假、像素材"。L7 你已经用过一次声音桥,尝到了甜头;本课把声音完整补齐:五条轨道各干什么三种生产方式怎么选混音的层级纪律。这是 unit-3 的第一课,也是从"素材"到"成片"最划算的一步。预计 55 分钟。

五条轨道

专业的声音设计不是"配个音乐",是五类声音各司其职:

轨道内容作用AI 生产方式
对白人物说话、旁白传递信息原生生成/语音合成(L8 数字人同源)
环境声房间底噪、街声、风雨、人群建立空间真实感原生生成/素材库/生成式音效
动作音效脚步、开门、碰撞、衣物摩擦让动作有重量逐个贴(拟音思路)
音乐配乐定情绪、控节奏AI 音乐生成/授权曲库
空间感混响、声像左右、远近把前四轨"放进同一个空间"剪辑软件处理

新手最常见的做法是"只有音乐"——结果是画面和声音各说各话:人在走路却没有脚步声,室内室外切换声场毫无变化,观众的耳朵会本能地判定"这是假的",尽管说不出为什么。环境声是性价比最高的一轨:一条房间底噪就能让画面"落地"。

提示

判断一条片子有没有做过声音设计,最快的方法是把音乐静音——如果剩下一片死寂,那就是「贴了音乐」而不是「做了声音」。补齐环境声和几个关键动作音效,成本极低,观感提升立竿见影。

三种生产方式

方式一:视频模型原生生成音频。生成画面时同时生成环境音、对白甚至音效,口型与音画天然同步——这是近两年最重要的跃迁(L1 提过的"音视频联合生成")。优点是同步性完美、省事;限制是可控性差、不可分轨——你拿到的是混好的一条音轨,想单独换音乐或调低脚步声都做不到。

方式二:根据视频生成声音(video-to-audio)。把已有画面丢给模型,让它"看图配音"——生成匹配画面的音效与环境声。适合给无声素材补声音,可以多次生成挑合适的,但对精确的动作点(比如"第 1.2 秒那记关门声")仍不够听话。

方式三:剪辑阶段独立设计。传统路线:分轨铺声音,逐个对齐。最麻烦,也最可控——正式作品的默认选择。

选择逻辑还是那条老方法论:要成品快就用原生生成,要控制权就分轨设计。实践中的混合策略最常见:原生音频用作参考和临时声轨(听个大概节奏),正式成片用分轨重做,把原生音频里好的部分留下、差的换掉。

说明

当前版本速览(2026-08,过时请以官网为准):Veo 3 系列在视频生成中同步生成环境音与对白,LTX-2 采用音视频联合生成架构;video-to-audio 类工具(如各家生成式音效功能)可为无声画面配音;AI 音乐生成(Suno、Udio 等)与语音合成(ElevenLabs 等)已是成熟品类,注意商用授权条款各家不同。能力迭代快,但「五轨分工」与「同步性 vs 可控性」的取舍长期有效。

混音的三条纪律

拿到五轨素材后,混音决定成败。记住三条就够用:

1. 音量层级:对白为王。优先级永远是对白 > 关键音效 > 环境声 > 音乐。做法叫侧链压低(ducking)——有人说话时音乐自动降下去,说完再起来。新手片子最常见的毛病就是音乐盖过人声,观众听不清话就会关掉。

2. 音画同步:对齐动作点。脚步声要落在脚接触地面的那一帧,关门声要卡在门框合拢的瞬间。人眼对音画不同步极其敏感——差 0.1 秒就"感觉怪"。技巧:先放大波形对齐关键帧,再整体微调

3. 空间一致:声场要跟着画面走。室内加短混响,室外去混响加空间感,特写声音近而干、远景声音远而混。这条对应 L5 七层连续性里的声音一致层——上一镜在雨里下一镜没有雨声,和"上一镜湿衣服下一镜干衣服"是同一种穿帮。

音乐:功能优先于好听

选配乐时问三个功能性问题,而不是"这首好不好听":

  • 它在定什么情绪?与画面情绪一致还是刻意反差(欢快音乐配悲伤画面是高级手法,但要有意为之);
  • 它的节奏和你的剪辑点合得上吗?卡点剪辑之所以有效,是因为音乐的节拍给了剪辑一个骨架——先定音乐再剪画面,比剪完了再找音乐容易十倍;
  • 它有没有抢戏?背景音乐的职责是托底,旋律太强会把注意力从画面上偷走。

商用注意授权:AI 生成音乐的商用条款各平台不同,授权曲库要看清许可范围——这是 L8 授权记录习惯的延伸,音乐来源同样要进你的项目记录

声音的叙事技巧

三个立刻能用的:

  • 声音桥(L7 学过):下一镜的声音提前进来,缝合切口;
  • 画外声:只闻其声不见其人(画面在门内,门外传来脚步声)——用声音扩展画面之外的世界,成本为零的场景扩展;
  • 静默:突然的完全静音是最强的强调手法之一。全片有声时,一秒静默比任何音效都响。

动手任务:给你的 30 秒片做完整声音设计

基础路线(约 60 分钟,剪映或 DaVinci Resolve 免费版即可):

  1. 拿出你 L7 剪好的 30 秒成片,先整段静音——重新以"声音设计师"的身份看一遍,列出声音清单:每一镜需要哪些声音(对白/环境/动作音效各列);
  2. 逐轨铺声音:至少做到 4 条轨(环境声、动作音效、音乐,加对白或旁白)。素材来源不限——原生音频、生成式音效、免费音效库都行;
  3. 对齐:至少 3 个动作音效精确卡到帧;
  4. 混音:设置音量层级(有人声处压低音乐),检查场景切换时声场有没有跟着变;
  5. 交付:成片(带声音)+一份声音清单表(每镜×每轨写明用了什么、来源、是否授权);
  6. 自测:把音乐单独静音听一遍——剩下的部分能不能撑起画面?

进阶路线(可选):同一段画面做两个版本的音乐(一个情绪一致、一个刻意反差),各请一个人看,问他们"这段片子讲的是什么感觉"——用别人的反馈验证音乐对叙事的改写能力。

随堂测验

随堂测验0 / 4 题正确

1. 一条 AI 短片配了音乐后仍然「显得假」。按本课诊断,最该先补的是?

2. 视频模型的「原生音频」相比剪辑阶段分轨设计,主要代价是?

3. 混音时「对白 > 关键音效 > 环境声 > 音乐」的层级纪律,对应的常见操作是?

4. 「先定音乐再剪画面」的建议,理由是?

划选正文任意文字可高亮、批注或加入复习卡

讨论

载入中…