课程库 › AI 视频生成 › 连续性与表演 › 第 4 课
数字人与多语言视频——口播的生产线与红线
普通课约 50 分钟
本课导读
unit-2 收官课离开叙事短片,进入 AI 视频商业落地最大的场景:口播——讲解视频、产品介绍、企业培训、课程内容。L6 结尾预告的数字人在此登场:表演迁移的产品化近亲,把"一个会说话的你"变成可以随时开工的数字资产。这也是全 Track 伦理红线最密集的一课——技术三节,红线一节,一样重要。预计 50 分钟。
数字人是什么:表演迁移的产品化
L6 的表演迁移是"你演一次,角色跟一次";数字人把它固化成可复用资产:登记一次形象,之后只喂文稿就能持续产出口播视频。当前两代形态:
| 形态 | 原料 | 能力 | 适用 |
|---|---|---|---|
| 照片数字人 | 一张正面照片 | 头部微动、口型、基础表情 | 快速上线、批量角色、成本敏感 |
| 视频数字分身 | 几分钟真人出镜素材(按平台脚本录制) | 自然手势、身体语言、个人神态 | 品牌人设、长期反复使用 |
规律与 L6 的适配度阶梯同源:给系统的原料信息越多,产出越保真。照片只有一帧的信息,分身有几分钟的动作分布——选哪代,取决于这个数字人要用多久、代表谁。
三件套解剖:形象、声音、驱动
一条数字人视频的生产线只有四站:
文稿 → 配音(合成声或克隆声) → 驱动数字人(语音驱动口型与神态) → 成片
- 形象:上一节的两代形态之一。注意平台都要求真人身份验证(本人出镜读授权声明)才能创建分身——这不是麻烦,是行业在自我保护,下文红线节展开;
- 声音:两条路——现成的合成声(多语种、稳定、无个人特征)或声音克隆(几分钟你的录音,产出"你的声音")。口播内容里声音的辨识度往往比脸更重要——听众对声音的熟悉感积累比对脸快;
- 驱动:文稿转语音后,系统对齐口型、眨眼、微表情。你在 L6 学的"表演幅度"知识在此反向应用:数字人的表情是系统生成的,文稿的语气标点和分段就是你控制表演的旋钮——句子短、有问句、有停顿的文稿,驱动出来的神态明显更自然。
多语言:一条视频的全球化
数字人体系里最"降维"的能力是视频翻译:同一条成片→自动翻译→跨语言配音(保留你的音色和语气特征)→口型重新对齐到新语言。产出是"你在流利地说西班牙语"的视频,外加字幕文件。
工程要点两条:
- 翻译质量瓶颈在文稿不在语音——术语、双关、文化梗机器容易译错,重要内容让懂目标语言的人审一遍文稿再驱动,比成片后返工便宜得多(视觉课"上游修比下游修便宜"的老原理);
- 字幕文件单独交付:平台自动生成的字幕轨(SRT 等)保留下来,它是可编辑资产——观众开不开声音你管不了,字幕永远在。
什么时候用数字人:成本决策框架
数字人不是万能替代,按内容类型决策:
| 内容特征 | 最优解 | 理由 |
|---|---|---|
| 高频更新(周报、课程迭代、产品更新) | 数字人 | 改文稿即改片,真人重拍成本随更新次数线性增长 |
| 多语言分发 | 数字人 | 翻译+口型对齐几乎零边际成本 |
| 情感浓度高(品牌故事、道歉声明、人物访谈) | 真人实拍 | 观众对「真诚」的感知阈值极高,数字人的微表情仍会露馅 |
| 一次性大制作 | 真人实拍 | 数字人的成本优势在复用,一次性用不上 |
| 不需要人脸(教程、数据讲解) | 录屏/动画+配音 | 别为了用数字人而用——没有脸反而没有恐怖谷风险 |
判断口诀:更新频率越高、语言版本越多,数字人越赢;情感浓度越高,真人越赢。
红线:授权、声明与不可做清单
这一节的分量与技术等同。数字人是全 Track 滥用潜力最大的技术,行业规则正在收紧,你的习惯要从第一天就是对的:
- 形象与声音只有两个合法来源:你自己的,或拿到书面授权的。平台的身份验证(本人录制同意声明)是底线而非上限——商用场景要另有授权文件,写明用途、范围、期限;
- AI 生成声明:成片标注"本视频由 AI 生成/数字人出演"正在从美德变成义务——多个平台已要求 AI 内容标识,法规趋势一致。声明成本是一行字,不声明的代价是信任和合规风险;
- 绝不可做:克隆未授权的真人(名人尤其)、让数字人"说"本人从未说过的话冒充其发言、伪造身份做营销或证言。这三条没有灰色地带——它们在多数司法辖区已触碰肖像权、名誉权乃至刑法;
- 留档习惯:每个数字人项目记录三件事——形象来源与授权状态、声音来源与授权状态、成片声明方式。三行字的表格,商用时它就是你的合规凭证。
说明
当前版本速览(2026-08,过时请以官网为准):HeyGen 的 Avatar IV 主打照片驱动数字人,Avatar V 侧重视频型数字分身,其视频翻译工具支持跨语言配音与口型同步;ElevenLabs 的配音(dubbing)可在翻译中保留原始音色与表演特征。各平台均已内置身份验证与内容审核流程。此类产品迭代极快,能力以当期官网为准,本课的决策框架与红线长期有效。
unit-2 毕业检查
四课收官,自查一遍:拿到一个"系列视频"需求,你应该能说出——人物和场景怎么不漂(L5 资产系统)、关键表演怎么给(L6 迁移)、镜头怎么连成叙事(L7 剪辑思维)、口播场景怎么规模化且不踩红线(L8)。答得上来,进 unit-3「声音、后期与自动化」:配乐音效、升格调色,以及把这条生产线自动化。
动手任务:你的第一条数字人视频
基础路线(约 60 分钟,用平台免费额度):
- 写一份 30–60 秒的口播文稿,题材建议:介绍你 30 秒短片的幕后制作(讲你怎么用资产系统和表演迁移做出它——内容顺便成为你的作品说明书)。文稿刻意用短句、留问句和停顿;
- 用照片数字人(你自己的照片)+合成声生成第一版;
- 生成一个翻译版本(建议英语),对照检查三处:口型对齐自然吗?术语翻对了吗?字幕文件导出了吗?
- 写你的第一份授权记录(三行:形象来源/声音来源/声明方式),并在视频描述里写上 AI 生成声明——从第一条视频起就把习惯做对;
- 三行观感自评:哪个瞬间最"像你"?哪个瞬间最出戏?对照成本决策框架,这条内容适合数字人吗?
进阶路线(可选):克隆自己的声音重新驱动同一文稿,与合成声版并排对比——验证"声音辨识度比脸重要"这个论断在你自己身上成立与否;或按平台脚本录制素材,做一个视频分身版与照片版对比手势与神态的差距。
随堂测验
1. 公司产品每两周更新一次,需要配一条 1 分钟的更新讲解视频,未来还要出英语和日语版。按成本决策框架,最优解是?
2. 数字人的表情神态是系统生成的,你无法像 L6 那样亲自表演。本课给出的「表演控制旋钮」是什么?
3. 客户发来一张某知名企业家的照片:「用他做个数字人推荐我们的产品,肯定有说服力。」正确的回应是?
4. 为什么本课要求从第一条练习视频起就写「授权记录」(形象/声音/声明三行)?
划选正文任意文字可高亮、批注或加入复习卡
讨论
载入中…