课程库 › AI 视频生成 › 声音、后期与自动化 › 第 1 课
原生音频与声音设计——一半的观感来自耳朵
普通课约 55 分钟
本课导读
行业里有句老话:声音是电影的一半。放到 AI 视频上还要更极端——同一段画面,配上环境声和音乐后观感能翻倍,而无声的 AI 片子几乎总是显得"廉价、假、像素材"。L7 你已经用过一次声音桥,尝到了甜头;本课把声音完整补齐:五条轨道各干什么、三种生产方式怎么选、混音的层级纪律。这是 unit-3 的第一课,也是从"素材"到"成片"最划算的一步。预计 55 分钟。
五条轨道
专业的声音设计不是"配个音乐",是五类声音各司其职:
| 轨道 | 内容 | 作用 | AI 生产方式 |
|---|---|---|---|
| 对白 | 人物说话、旁白 | 传递信息 | 原生生成/语音合成(L8 数字人同源) |
| 环境声 | 房间底噪、街声、风雨、人群 | 建立空间真实感 | 原生生成/素材库/生成式音效 |
| 动作音效 | 脚步、开门、碰撞、衣物摩擦 | 让动作有重量 | 逐个贴(拟音思路) |
| 音乐 | 配乐 | 定情绪、控节奏 | AI 音乐生成/授权曲库 |
| 空间感 | 混响、声像左右、远近 | 把前四轨"放进同一个空间" | 剪辑软件处理 |
新手最常见的做法是"只有音乐"——结果是画面和声音各说各话:人在走路却没有脚步声,室内室外切换声场毫无变化,观众的耳朵会本能地判定"这是假的",尽管说不出为什么。环境声是性价比最高的一轨:一条房间底噪就能让画面"落地"。
提示
判断一条片子有没有做过声音设计,最快的方法是把音乐静音——如果剩下一片死寂,那就是「贴了音乐」而不是「做了声音」。补齐环境声和几个关键动作音效,成本极低,观感提升立竿见影。
三种生产方式
方式一:视频模型原生生成音频。生成画面时同时生成环境音、对白甚至音效,口型与音画天然同步——这是近两年最重要的跃迁(L1 提过的"音视频联合生成")。优点是同步性完美、省事;限制是可控性差、不可分轨——你拿到的是混好的一条音轨,想单独换音乐或调低脚步声都做不到。
方式二:根据视频生成声音(video-to-audio)。把已有画面丢给模型,让它"看图配音"——生成匹配画面的音效与环境声。适合给无声素材补声音,可以多次生成挑合适的,但对精确的动作点(比如"第 1.2 秒那记关门声")仍不够听话。
方式三:剪辑阶段独立设计。传统路线:分轨铺声音,逐个对齐。最麻烦,也最可控——正式作品的默认选择。
选择逻辑还是那条老方法论:要成品快就用原生生成,要控制权就分轨设计。实践中的混合策略最常见:原生音频用作参考和临时声轨(听个大概节奏),正式成片用分轨重做,把原生音频里好的部分留下、差的换掉。
说明
当前版本速览(2026-08,过时请以官网为准):Veo 3 系列在视频生成中同步生成环境音与对白,LTX-2 采用音视频联合生成架构;video-to-audio 类工具(如各家生成式音效功能)可为无声画面配音;AI 音乐生成(Suno、Udio 等)与语音合成(ElevenLabs 等)已是成熟品类,注意商用授权条款各家不同。能力迭代快,但「五轨分工」与「同步性 vs 可控性」的取舍长期有效。
混音的三条纪律
拿到五轨素材后,混音决定成败。记住三条就够用:
1. 音量层级:对白为王。优先级永远是对白 > 关键音效 > 环境声 > 音乐。做法叫侧链压低(ducking)——有人说话时音乐自动降下去,说完再起来。新手片子最常见的毛病就是音乐盖过人声,观众听不清话就会关掉。
2. 音画同步:对齐动作点。脚步声要落在脚接触地面的那一帧,关门声要卡在门框合拢的瞬间。人眼对音画不同步极其敏感——差 0.1 秒就"感觉怪"。技巧:先放大波形对齐关键帧,再整体微调。
3. 空间一致:声场要跟着画面走。室内加短混响,室外去混响加空间感,特写声音近而干、远景声音远而混。这条对应 L5 七层连续性里的声音一致层——上一镜在雨里下一镜没有雨声,和"上一镜湿衣服下一镜干衣服"是同一种穿帮。
音乐:功能优先于好听
选配乐时问三个功能性问题,而不是"这首好不好听":
- 它在定什么情绪?与画面情绪一致还是刻意反差(欢快音乐配悲伤画面是高级手法,但要有意为之);
- 它的节奏和你的剪辑点合得上吗?卡点剪辑之所以有效,是因为音乐的节拍给了剪辑一个骨架——先定音乐再剪画面,比剪完了再找音乐容易十倍;
- 它有没有抢戏?背景音乐的职责是托底,旋律太强会把注意力从画面上偷走。
商用注意授权:AI 生成音乐的商用条款各平台不同,授权曲库要看清许可范围——这是 L8 授权记录习惯的延伸,音乐来源同样要进你的项目记录。
声音的叙事技巧
三个立刻能用的:
- 声音桥(L7 学过):下一镜的声音提前进来,缝合切口;
- 画外声:只闻其声不见其人(画面在门内,门外传来脚步声)——用声音扩展画面之外的世界,成本为零的场景扩展;
- 静默:突然的完全静音是最强的强调手法之一。全片有声时,一秒静默比任何音效都响。
动手任务:给你的 30 秒片做完整声音设计
基础路线(约 60 分钟,剪映或 DaVinci Resolve 免费版即可):
- 拿出你 L7 剪好的 30 秒成片,先整段静音——重新以"声音设计师"的身份看一遍,列出声音清单:每一镜需要哪些声音(对白/环境/动作音效各列);
- 逐轨铺声音:至少做到 4 条轨(环境声、动作音效、音乐,加对白或旁白)。素材来源不限——原生音频、生成式音效、免费音效库都行;
- 对齐:至少 3 个动作音效精确卡到帧;
- 混音:设置音量层级(有人声处压低音乐),检查场景切换时声场有没有跟着变;
- 交付:成片(带声音)+一份声音清单表(每镜×每轨写明用了什么、来源、是否授权);
- 自测:把音乐单独静音听一遍——剩下的部分能不能撑起画面?
进阶路线(可选):同一段画面做两个版本的音乐(一个情绪一致、一个刻意反差),各请一个人看,问他们"这段片子讲的是什么感觉"——用别人的反馈验证音乐对叙事的改写能力。
随堂测验
1. 一条 AI 短片配了音乐后仍然「显得假」。按本课诊断,最该先补的是?
2. 视频模型的「原生音频」相比剪辑阶段分轨设计,主要代价是?
3. 混音时「对白 > 关键音效 > 环境声 > 音乐」的层级纪律,对应的常见操作是?
4. 「先定音乐再剪画面」的建议,理由是?
划选正文任意文字可高亮、批注或加入复习卡
讨论
载入中…