PRZEWODNIK AI audio

Kształtowanie wiązki i układy mikrofonów

Technologia Beamforming wykorzystuje wiele mikrofonów do nasłuchu w wybranym kierunku, wzmacniając dźwięk dochodzący z celu, jednocześnie tłumiąc wszystko inne.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It is the spatial-filtering trick that lets smart speakers and conference systems hear you across a noisy room.

Głębokie nurkowanie

Układ mikrofonów rejestruje ten sam dźwięk w nieco innym czasie, ponieważ każdy mikrofon znajduje się w innej odległości od źródła. Beamforming wykorzystuje te maleńkie opóźnienia: poprzez wyrównywanie (opóźnianie) i sumowanie sygnałów, dźwięk dochodzący z kierunku docelowego sumuje się konstruktywnie, podczas gdy dźwięk z innych kierunków częściowo się tłumi. Najprostszą formą jest opóźnienie i suma; bardziej zaawansowane adaptacyjne układy kształtujące wiązkę, takie jak MVDR (reakcja bez zniekształceń minimalnej zmienności), stale dostosowują ciężary, aby wyeliminować ruchome źródła hałasu i pogłosu. Nowoczesne urządzenia łączą macierze z sieciami neuronowymi, które szacują, gdzie znajduje się osoba mówiąca i które przedziały czasowo-częstotliwościowe to mowa, i przekazują te dane do urządzenia kształtującego wiązkę. Ponieważ dodaje informacje przestrzenne, których brakuje pojedynczemu mikrofonowi, kształtowanie wiązki uzupełnia, a nie zastępuje jednokanałowe odszumianie.

Wgląd techniczny

Podstawową wskazówką jest różnica czasu (lub fazy) dotarcia do mikrofonów, określona przez prędkość dźwięku i geometrię układu. Opóźnienie i suma sterują wiązką poprzez zastosowanie opóźnień per-mic, dzięki czemu cel jest wyrównany; Zamiast tego MVDR rozwiązuje problem wag, które utrzymują stałe wzmocnienie docelowe, minimalizując jednocześnie całkowitą moc wyjściową, skutecznie umieszczając wartości zerowe w stronę szumu. Wydajność poprawia się przy większej liczbie mikrofonów i szerszych odstępach, ale zbyt duże odstępy powodują aliasing przestrzenny.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość kształtowania wiązki i układów mikrofonowych

Kształtowanie wiązki jest w coraz większym stopniu łączone z głębokim uczeniem się w „formowaniu wiązki neuronowej”, gdzie sieci przewidują maski lub kierunki sterowania, a filtr przestrzenny zajmuje się fizyką. Macierze na urządzeniach są coraz mniejsze w przypadku słuchawek dousznych i okularów AR, natomiast macierze rozproszone i ad hoc, łączące telefony lub mikrofony IoT w pomieszczeniu, to wyłaniający się obszar badawczy. Spodziewaj się ściślejszej integracji z ekstrakcją głośników docelowych i zrozumieniem sceny akustycznej.

Implementacja w świecie rzeczywistym

Inteligentne głośniki (Amazon Echo, Google Nest) dopasowujące się do mówiącej osoby

Systemy do sal konferencyjnych, które podążają za aktywnym mówcą wokół stołu

Aparaty słuchowe skupiające się na głosie przed Tobą w tłumie

Samochodowi asystenci głosowi izolujący kierowcę od hałasu drogowego i pasażerskiego

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Beamforming and Microphone Arrays quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

MusicLM Hierarchiczne generowanie muzyki

Często zadawane pytania

What is Beamforming and Microphone Arrays?

Technologia Beamforming wykorzystuje wiele mikrofonów do nasłuchu w wybranym kierunku, wzmacniając dźwięk dochodzący z celu, jednocześnie tłumiąc wszystko inne. Jest to sztuczka filtrowania przestrzennego, która pozwala inteligentnym głośnikom i systemom konferencyjnym słyszeć Cię w hałaśliwym pomieszczeniu.

Jakie fizyczne wskazówki wykorzystuje głównie kształtowanie wiązki?

Dźwięk dociera do każdego mikrofonu w nieco innym czasie; kształtowanie wiązki wykorzystuje te opóźnienia do filtrowania według kierunku.

Jak nazywa się najprostsza technika kształtowania wiązki?

Opóźnienie i suma wyrównują sygnały z kierunku docelowego i dodają je, tak aby się wzmacniały.

Do czego służy formator wiązki MVDR?

MVDR utrzymuje pozbawioną zniekształceń reakcję na cel, jednocześnie minimalizując wariancje, umieszczając wartości zerowe w stronę szumu.

Jak kształtowanie wiązki wiąże się z tłumieniem szumów za pomocą jednego mikrofonu?

Beamforming dodaje filtrowanie kierunkowe/przestrzenne, którego nie mogą zapewnić metody jednokanałowe, więc współpracują.

Jaki problem może się pojawić, jeśli mikrofony są rozmieszczone zbyt daleko od siebie?

Zbyt duży odstęp w stosunku do długości fali powoduje aliasing przestrzenny, tworząc niejednoznaczne lub fałszywe kierunki.