概述
这对于将课程和电影配音成其他语言以及修复重新录制的对话很重要。同样的技术也可以让真人看起来说出他们从未说过的话。
深入探讨
Wav2Lip 由 IIIT 海得拉巴 (ACM Multimedia) 的研究人员于 2020 年发布,是最著名的开放唇形同步模型,也是该领域的有用模板。对于每个目标帧,生成器接收三个输入:下半部分被遮盖的脸部、提供外观的同一个人的参考帧以及该时刻周围音频的短梅尔频谱图窗口。然后,编码器-解码器网络在嘴部区域进行绘制,并将结果混合回原始视频中。关键贡献是基于 SyncNet 的预训练“专家”同步鉴别器。它在训练期间保持冻结状态,并判断一小段嘴部帧是否与音频匹配。早期的方法将同步鉴别器与生成器联合训练,但这些鉴别器对同步的判断能力很差。 Wav2Lip 还使用了单独的视觉质量鉴别器。它的弱点是嘴部裁剪分辨率低、牙齿模糊以及面罩边界处可见接缝或闪烁。后来的系统,如 VideoReTalking、MuseTalk 和基于扩散的 LatentSync 旨在获得更清晰、更稳定的结果。质量可以通过多种方式来判断。 LSE-D 测量 SyncNet 的音频和视频嵌入之间的距离,越低越好。 LSE-C 衡量 SyncNet 的置信度,越高越好。 FID 和人类评级等图像质量指标涵盖真实性。一个常见的误解是,良好的同步分数意味着真实的视频。夸张的嘴部动作可以得分很高,但看起来仍然错误,因此人类评估仍然至关重要。一项挑战是许多音素共享相同的可见嘴形或视位,因此音频到嘴的映射是多对一的。滥用直接源于该技术:将克隆声音与唇形同步配对可以产生令人信服的虚假陈述。研究人员表明,音素和视素之间的不匹配,尤其是嘴唇在“m”、“b”和“p”上未能闭合,可以暴露此类假货。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
音频驱动的人工智能唇形同步的未来
口型同步正在成为配音和视频定位工具的标准功能,研究正在朝着更高分辨率、稳定的牙齿和舌头以及同步整个面部表情和头部运动而不仅仅是嘴部的方向发展。检测是一场军备竞赛:随着生成器的改进,诸如音素-视素不匹配之类的取证线索会减弱。一些司法管辖区已经开始监管欺骗性合成媒体,特别是在选举方面。所显示人员的同意、明确的披露和出处标签可能仍然是负责任使用的核心。
现实世界的实施
在线课程提供商将讲座配音成西班牙语,并使用口型同步,使讲师的嘴巴与翻译的音频相匹配,并在视频描述中注明编辑内容。
视频剪辑师在征得演员同意的情况下,将演员的嘴与拍摄后重新录制的对话同步,而不是重新拍摄场景。
一名事实核查人员检查了一段政客的病毒片段,发现他的嘴唇在发出“b”、“p”和“m”音时从未完全闭合,这是假唱的一个已知迹象。
研究人员在一组头部说话剪辑上运行 Wav2Lip,并使用 LSE-D 和 LSE-C 对结果进行评分,以将它们与较新的基于扩散的唇形同步模型进行比较。
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Audio-Driven AI Lip Sync quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
什么是音频驱动的人工智能唇形同步?
音频驱动的 AI 唇形同步可编辑面部视频,使其嘴部动作与新的语音轨迹相匹配,从而根据声音本身预测嘴部形状。这对于将课程和电影配音成其他语言以及修复重新录制的对话很重要。同样的技术也可以让真人看起来说出他们从未说过的话。
为什么 Wav2Lip 遮盖目标脸的下半部分?
由于真实的嘴被隐藏,生成器必须依靠音频来决定嘴的形状。
是什么让 Wav2Lip 的同步鉴别器与早期的方法不同?
与生成器联合训练的鉴别器对同步的判断能力较弱。冻结的专家给出了可靠的信号。
LSE-D应该怎么读?
LSE-D 是一个距离,因此较小的值意味着音频和嘴巴嵌入更接近,这意味着更好的同步。
Wav2Lip 中参考系的作用是什么?
参考系提供身份和纹理。音频提供了嘴形。
原始 Wav2Lip 的已知视觉缺陷是什么?
Wav2Lip 适用于小脸裁剪,因此在较清晰的周围框架旁边,嘴巴和牙齿通常看起来很柔软。
继续学习
相关指南
为此主题精选的更多指南