AI对口型

关注
义项:AI视频对口型技术

AI对口型是让人工智能按给定语音改写视频中人物嘴部动作、使口型与语音在时间上对齐的技术,也称唇形同步或视觉配音[1]。它以语音和人物视频或静态人像为输入,输出身份、姿态、光照与背景基本不变、仅嘴部动作改变的视频[2]。2017 年研究者首次公开演示了由音频驱动的逼真口型合成[3];2020 年Wav2Lip引入唇形同步判别器监督训练,使该技术可用于任意人物视频[4]。它现已用于数字人视频、多语言配音与影视后期制作[5]。

百科 图文
目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

AI对口型处理的核心问题,是让视频中说话人的唇部运动与对应语音逐帧对齐,属于音频驱动的肖像视频生成方向[1]。按输入形式大致可分两类:一类在已有视频上改写人物嘴型,使其匹配另一段语音,通常称为视觉配音;另一类只给一张静态人像和一段语音,直接生成会说这段话的人物视频[6]。

除嘴部动作外,较新的系统还会同时生成与语音情绪相配的表情、眨眼和头部运动[6]。衡量效果的两个基本维度是口型与语音是否同步,以及人物的身份、姿态、光照和背景是否被破坏[7]。

原理

以 Wav2Lip 为代表的方法采用生成对抗网络框架:生成器由人脸编码器、语音编码器和人脸解码器组成,输入是一小段连续帧以及下半脸被遮挡的目标帧,输出与新语音匹配的人脸帧[7]。其关键设计是一个预训练的唇形同步判别器,它迫使生成器把注意力放在嘴部细节的精细校正上,而不是整体画面的重建[7]。评价唇音一致性的常用指标是 LSE-D 与 LSE-C,由 SyncNet 分别给出唇部与音频表示之间的距离和置信度[7]。

近年主流的扩散模型路线改为端到端生成:LatentSync 用 Whisper 把音频频谱转成嵌入,经交叉注意力层接入 U-Net,并把参考帧、掩码帧与含噪潜在表示在通道维拼接后一起输入,训练前还会依据人脸关键点做仿射变换以完成正面化[2]。另一些方法把口型生成与视频编辑拆成两步,先由生成模型造出“只有嘴型不同”的成对视频,再训练一个不需要掩码的编辑模型完成配音。

发展历程

2017 年,华盛顿大学的 Suwajanakorn 等人在 SIGGRAPH 上发表 Synthesizing Obama,用循环神经网络学习音频特征到嘴型的映射,再把合成的嘴部纹理按三维姿态合成到目标视频中,训练素材是美国前总统奥巴马每周演讲的影像[3]。该工作当时只能针对单个对象逐人训练,但首次让由音频生成的逼真口型视频公开可看[8][9]。

2020 年,Wav2Lip 在 ACM 多媒体会议上发表,提出用在大规模真实视频上预训练的唇形同步判别器来监督生成器,从而在任意人物、任意语音的条件下获得更准确的口型[4]。此后的改进多围绕清晰度、分辨率和嘴部区域权重展开,例如在卷积模块中加入空间与通道注意力,或引入数据增强、结构调整与新的损失函数[7][10]。

2024 年底起,扩散模型成为主流路线之一。字节跳动开源的 LatentSync 采用音频条件潜在扩散模型,端到端生成而无需中间运动表示,并用时间表示对齐技术改善帧间闪烁;其 1.5 版发布于 2025 年 3 月,1.6 版发布于同年 6 月,训练分辨率提高到 512×512[2][11]。同期,基于Transformer结构的扩散模型被用于更通用的场景:OmniSync 提出无掩码的训练方式,并建立了面向 AI 生成视频的唇形同步评测基准[1];X-Dub 则把视觉配音从掩码修复改写为视频到视频的编辑任务[12]。

多角色场景也在推进。趣丸科技的 Playmate2 提出免训练的多角色语音驱动方法,支持三人及以上同屏,其论文被 AAAI 2026 接收[13]。

应用

最常见的用途是视频本地化:把原视频语音翻译成另一种语言后,重新生成与译文匹配的口型,避免配音与嘴型不符。HeyGen 等工具支持上百种语言的翻译,并单独提供精准对嘴功能以保持原说话者的音色与语调[5]。开源工具 Linly-Dubbing 也把语音识别、机器翻译、声音克隆和数字人口型技术组合成一条流程,用于多语言视频配音与字幕翻译。

在数字人与电商直播场景中,商家上传照片、录入声音并设定文案,即可生成说外语的人物口播视频。浙江义乌国际商贸城自 2023 年起向商户提供可把录制视频自动转成 36 种外语的 AI 工具,据商城集团统计已有近 3 万经营户常态化使用[14][15]。面向东盟市场的小语种服务,也能在半小时左右生成讲越南语、口型自然的数字人视频[16]。

实时方向已有产品把口型同步与语音合成、机器翻译串联使用:Akool 的实时摄像头方案支持 150 种以上语言的实时翻译并同步说话者口型,画面延迟最低约 500 毫秒[17]。音频驱动的口型合成还被认为可用于降低视频通话带宽,以及为听障者提供基于音频的唇读[3]。

局限

对口型模型在复杂画面下仍容易失败。采用参考帧与掩码修复的早期方法,对身份一致性、姿态变化、面部遮挡和风格化内容的鲁棒性有限,且原视频的唇形信息会渗入生成结果,影响同步质量[1]。相关研究也指出,掩码会破坏时空上下文,导致身份漂移,在遮挡、动态光照等场景中出现伪影。

画质方面,扩散类方法在牙齿、嘴唇和面部毛发等高频细节上容易出现逐帧闪烁,需要额外的时间一致性约束来抑制[18]。Wav2Lip 的口型较准,但输出画面常显模糊,后续方法不得不通过提高分辨率或加入面部修复来改善[19]。

算力门槛同样明显:LatentSync 1.5 的推理最低需要 8GB 显存,1.6 版提高到 18GB[2]。数据方面,视觉配音缺少“除嘴型外其他条件完全相同”的成对训练视频,这是训练困难的根本原因之一。

该技术也存在被滥用的风险。研究者指出,音频驱动的口型合成可被用来篡改视频内容,而反向把视频输入网络,则有助于判别画面真伪[3];有研究提醒,深度伪造涉及的身份合成、授权与检测问题,在缺乏水印等机制时会带来实际隐患[20]。

参见

  • Wav2Lip —— 以唇形同步判别器监督训练的经典口型生成模型,常被后续方法用作对比基线。

  • 数字人 —— 由人工智能生成或驱动的虚拟人物形象,其口播视频常靠对口型技术实现。

  • 语音合成 —— 把文字转成语音的技术,与对口型配合可完成从文案到说话视频的流程。

  • 扩散模型 —— 通过逐步去噪生成内容的模型,是当前高保真唇形同步的主流框架之一。

  • 深度伪造 —— 用生成模型伪造人物音视频的技术,与对口型共享技术基础并伴随滥用风险。

  • 机器翻译 —— 把视频语音译为其他语言后重新匹配口型,是对口型技术的主要应用方向。

参考资料

  1. 10b99813d5992673da90a499b6bcd5f0-Abstract-Conference . nips.cc [引用日期2026-09-29]
  2. LatentSync . github.com [引用日期2026-09-29]
  3. washington.edu 上的网页 . washington.edu [引用日期2026-09-29]
  4. acm.org 上的网页 . acm.org [引用日期2026-09-29]
  5. AI實戰|3 分鐘讓外國人講流利廣東話 HeyGen 的威力有多大?|香港經濟日報 . hket.com [引用日期2026-09-29]
  6. LTX 2 19b LipSync现已登陆WaveSpeedAI . wavespeed.ai [引用日期2026-09-29]
  7. arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
  8. c_136439713 . xinhuanet.com [引用日期2026-09-29]
  9. paper_detail . nstl.gov.cn [引用日期2026-09-29]
  10. cav . wiley.com [引用日期2026-09-29]
  11. 字节跳动开源全新AI模型LatentSync 精准控制唇形同步 . chinaz.com [引用日期2026-09-29]
  12. icml.cc 上的网页 . icml.cc [引用日期2026-09-29]
  13. AAAI 2026:趣丸科技Playmate2,实现业内首个支持三人及以上同屏驱动的算法 . quwangroup.com [引用日期2026-09-29]
  14. 还得是义乌!“AI老板娘”精通36种语言,一人能运营一家公司_孙丽娟_视频_工具 . sohu.com [引用日期2026-09-29]
  15. 享受“AI红利”的外贸人(“融”观中国) . people.com.cn [引用日期2026-09-29]
  16. 东盟场景录|数字“打工人”闯南洋 . gxzf.gov.cn [引用日期2026-09-29]
  17. 硅谷跑出一匹AI应用黑马 视频实时换脸真假莫辨 背后创始人系中国90后 . chinastarmarket.cn [引用日期2026-09-29]
  18. arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
  19. LatentSync 现已登陆WaveSpeedAI . wavespeed.ai [引用日期2026-09-29]
  20. semanticscholar.org 上的网页 . semanticscholar.org [引用日期2026-09-29]
词条评价
词条统计

浏览次数:0 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-29T08:58:53Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
生成对抗网络 SyncNet 扩散模型 华盛顿大学 字节跳动 Transformer 义乌 语音合成 深度伪造 Wav2Lip 数字人 语音合成 扩散模型 深度伪造 机器翻译
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。