波束形成和麥克風陣列
波束成形使用多個麥克風在選定的方向上監聽,放大來自目標的聲音,同時抑制其他聲音。
概述
It is the spatial-filtering trick that lets smart speakers and conference systems hear you across a noisy room.
深入探討
麥克風陣列在略有不同的時間捕捉相同的聲音,因為每個麥克風與聲音來源的距離不同。波束成形利用了這些微小的延遲:透過對齊(延遲)和求和訊號,從目標方向到達的聲音相加,而來自其他方向的聲音部分抵消。最簡單的形式是延遲求和;更先進的自適應波束形成器,如 MVDR(最小方差無失真響應),不斷調整權重以消除移動噪音源和混響。現代設備將陣列與神經網路配對,神經網路可以估計說話者的位置以及哪些時頻段是語音,並將其輸入波束形成器。由於波束成形添加了單一麥克風缺乏的空間訊息,因此它補充而不是取代單通道降噪。
技術洞察
核心提示是麥克風之間到達的時間(或相位)差,由聲速和陣列幾何形狀決定。延遲求和透過應用每個麥克風的延遲來控制波束,以便目標對齊;相反,MVDR 求解的權重保持固定目標增益,同時最小化總輸出功率,有效地將零點置於噪音附近。更多麥克風和更寬的間距可以提高性能,但間距太寬會導致空間混疊。
戰略影響
交通與覆蓋範圍
它透過轉錄、旁白和語音介面提高了可訪問性。
成本與預算
媒體團隊可以用更少的預算更快地交付精美的音訊。
速度與規模
面向客戶的系統可以處理更大規模的語音互動。
波束成形和麥克風陣列的未來
波束成形越來越多地與「神經波束成形」中的深度學習融合在一起,其中網路預測掩模或轉向方向,而空間濾波器則負責物理處理。對於耳塞和 AR 眼鏡來說,設備上的陣列變得越來越小,而在房間內組合電話或物聯網麥克風的分散式和臨時陣列是一個新興的研究領域。期望與目標說話者提取和聲學場景理解更緊密地整合。
現實世界的實施
智慧揚聲器(Amazon Echo、Google Nest)鎖定說話者
追蹤桌子周圍活躍發言者的會議室系統
助聽器專注於人群中您面前的聲音
汽車語音助理將駕駛者與道路和乘客噪音隔離
風險與防護欄
如果未徵得同意,語音濫用和冒充風險就會增加。
由於口音、方言或嘈雜的環境,準確性可能會下降。
如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。
實施路線圖
獲得語音捕獲、克隆和重用的明確同意。
測試不同揚聲器和背景條件下的品質。
定義人員必須審查或批准輸出的時間。
標記合成音訊並保留來源記錄以供問責。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Beamforming and Microphone Arrays quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Beamforming and Microphone Arrays?
波束成形使用多個麥克風在選定的方向上監聽,放大來自目標的聲音,同時抑制其他聲音。這是一種空間過濾技巧,可以讓智慧揚聲器和會議系統在嘈雜的房間裡聽到您的聲音。
波束成形主要利用什麼物理線索?
聲音到達每個麥克風的時間略有不同;波束成形使用這些延遲來按方向過濾。
最簡單的波束形成技術是什麼?
延遲求和將來自目標方向的訊號對齊並將它們相加,以便它們相互增強。
MVDR 波束形成器的目的是什麼?
MVDR 保持對目標的無失真響應,同時最大限度地減少方差,將零點置於雜訊附近。
波束成形與單麥克風噪音抑制有何關係?
波束成形增加了單通道方法無法提供的方向/空間濾波,因此它們可以協同工作。
如果麥克風間距太遠會出現什麼問題?
相對於波長太寬的間距會導致空間混疊,從而產生模糊或錯誤的方向。