音频人工智能指南

波束形成和麦克风阵列

波束成形使用多个麦克风在选定的方向上监听,放大来自目标的声音,同时抑制其他声音。

阅读时间:2分钟最后更新

概述

它是空间过滤技巧,让智能音箱和会议系统能在嘈杂的房间里听到你的声音。

深入探讨

麦克风阵列在略有不同的时间捕获相同的声音,因为每个麦克风距声源的距离不同。波束成形利用了这些微小的延迟:通过对齐(延迟)和求和信号,从目标方向到达的声音相加,而来自其他方向的声音部分抵消。最简单的形式是延迟求和;更先进的自适应波束形成器,如 MVDR(最小方差无失真响应),不断调整权重以消除移动噪声源和混响。现代设备将阵列与神经网络配对,神经网络可以估计说话者的位置以及哪些时频段是语音,并将其输入波束形成器。由于波束成形添加了单个麦克风缺乏的空间信息,因此它补充而不是取代单通道降噪。

技术洞察

核心提示是麦克风之间到达的时间(或相位)差,由声速和阵列几何形状决定。延迟求和通过应用每个麦克风的延迟来控制波束,以便目标对齐;相反,MVDR 求解的权重保持固定目标增益,同时最小化总输出功率,有效地将零点置于噪声附近。更多麦克风和更宽的间距可以提高性能,但间距太宽会导致空间混叠。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

波束成形和麦克风阵列的未来

波束成形越来越多地与“神经波束成形”中的深度学习融合在一起,其中网络预测掩模或转向方向,而空间滤波器则负责物理处理。对于耳塞和 AR 眼镜来说,设备上的阵列变得越来越小,而在房间内组合电话或物联网麦克风的分布式和临时阵列是一个新兴的研究领域。期望与目标说话人提取和声学场景理解更紧密地集成。

现实世界的实施

智能扬声器(Amazon Echo、Google Nest)锁定说话者

跟踪桌子周围活跃发言者的会议室系统

助听器专注于人群中您面前的声音

汽车语音助手将驾驶员与道路和乘客噪音隔离

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Beamforming and Microphone Arrays quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

MusicLM 分层音乐生成

常见问题

什么是波束成形和麦克风阵列?

波束成形使用多个麦克风在选定的方向上监听,放大来自目标的声音,同时抑制其他声音。这是一种空间过滤技巧,可以让智能扬声器和会议系统在嘈杂的房间里听到您的声音。

波束成形主要利用什么物理线索?

声音到达每个麦克风的时间略有不同;波束成形使用这些延迟来按方向进行过滤。

最简单的波束形成技术是什么?

延迟求和将来自目标方向的信号对齐并将它们相加,以便它们相互增强。

MVDR 波束形成器的目的是什么?

MVDR 保持对目标的无失真响应,同时最大限度地减少方差,将零点置于噪声附近。

波束成形与单麦克风噪声抑制有何关系?

波束成形增加了单通道方法无法提供的方向/空间滤波,因此它们可以协同工作。

如果麦克风间距太远会出现什么问题?

相对于波长太宽的间距会导致空间混叠,从而产生模糊或错误的方向。