应用指南

人工智能在唇读和视觉语音识别中的应用

视觉语音识别使用人工智能来读取唇语,根据人的嘴巴、下巴和面部的运动来预测口语,有时甚至不需要任何音频。

阅读时间:2分钟最后更新

概述

It matters for noisy environments, accessibility, and combining with sound for more robust speech recognition.

深入探讨

即使对于人类来说,读唇语也很困难,因为许多声音在嘴唇上看起来是相同的。例如,/p/、/b/ 和 /m/ 声音形成单个“发音嘴型”组,在视觉上无法区分,因此上下文至关重要。像 Google DeepMind 的 LipNet 和后来的“观看、注意和拼写”系统这样的人工智能模型能够学习将嘴部区域视频帧序列映射到字符或单词,有时在基准数据集上的表现优于专业的人类唇语阅读器。最强大的系统是视听系统:它们将嘴唇的视频与音频信号融合在一起,这样当噪音破坏了声音时,视觉流就会填补空白。在光线不足、头部转动、手或面罩等遮挡以及不熟悉的扬声器的情况下,性能仍然会急剧下降。

技术洞察

典型的模型会裁剪嘴巴周围的紧密区域,然后将帧序列传递到 3D 卷积前端以捕获短运动模式,然后使用变压器或循环网络来模拟较长的时间上下文。使用 CTC 或基于注意力的序列到序列方法将输出解码为文本。视听融合结合了两种方式,因此每种方式都可以弥补对方的弱点。

战略影响

构建选择

应用级设计决定了人工智能是否能改善实际结果。

团队与工作流程

良好的工作流程集成可以创造用户值得信赖的生产力收益。

风险与安全

范围明确的用例可以减少变更疲劳和实施风险。

人工智能在唇读和视觉语音识别领域的未来

预计唇读功能将主要作为音频系统的助手而不是独立的工具嵌入,从而改善语音助手和大声场所的字幕。与说话人无关的模型、低光鲁棒性和设备上隐私处理方面的工作仍在继续。由于秘密唇读会引起明显的监视问题,因此治理和同意规范可能会像技术本身一样决定其部署地点。

现实世界的实施

在嘈杂的汽车或拥挤的房间里,通过阅读说话者的嘴唇和音频来提高语音助手的准确性

通过阅读嘴部动作帮助失声者恢复言语

改进麦克风拾取严重背景噪音时的自动字幕

法医或档案分析试图从无声或低沉的镜头中恢复对话

风险与防护栏

将损坏的流程自动化可能会加剧现有问题。

团队可能会过度自动化并消除所需的人工判断。

如果不持续评估输出,质量可能会出现偏差。

实施路线图

1

绘制当前工作流程并确定摩擦最大的步骤。

2

在完全自动化之前定义人工检查点。

3

对用户进行提示、升级路径和质量标准方面的培训。

4

跟踪任务级结果以确认持续价值。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AI in Lip Reading and Visual Speech Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

语音情感识别

常见问题

What is AI in Lip Reading and Visual Speech Recognition?

视觉语音识别使用人工智能来读取唇语,根据人的嘴巴、下巴和面部的运动来预测口语,有时甚至不需要任何音频。它对于嘈杂的环境、可访问性以及与声音相结合以实现更强大的语音识别都很重要。

什么是“视位”?

听起来像 /p/、/b/ 和 /m/ 形成一个视位,因为嘴看起来是一样的,这就是为什么唇读在没有上下文的情况下是不明确的。

为什么视听模型通常比纯口型或纯音频模型更稳健?

融合视频和音频可以让每种模式相互补偿,因此破坏音频的大噪音可以通过嘴唇抵消。

唇读模型中的 3D 卷积前端有助于捕获什么?

3D 卷积同时处理多个帧,捕捉嘴巴在短时间内的移动情况,而不是单个静态图像。

哪种情况最会降低唇读的准确性?

任何隐藏或扭曲嘴部区域的因素(例如遮挡或不良照明)都会大大降低准确性。