Wyzwanie tłumienia głębokiego hałasu
Wyzwanie Deep Noise Suppression (DNS) to konkurs organizowany przez Microsoft, który motywuje badaczy do budowania sieci neuronowych, które w czasie rzeczywistym usuwają szum tła z mowy.
Przegląd
It set the modern benchmarks that power features like Teams and Zoom noise removal.
Głębokie nurkowanie
Konkurs DNS Challenge, zapoczątkowany przez Microsoft w 2020 r. i powtarzany przez kilka lat (często w INTERSPEECH i ICASSP), zapewnił zespołom duży, ustandaryzowany zbiór danych obejmujący czystą mowę, klipy z szumem i syntetycznie zmiksowane nagrania z szumem. Co najważniejsze, przesunęło to ocenę ze starszej matematyki dotyczącej sygnałów, takiej jak PESQ, na rzecz wyników odsłuchu człowieka i wyuczonych predyktorów postrzeganej jakości. Dodano także trudne warunki rzeczywiste: pomieszczenia z pogłosem, odgłosy niestacjonarne (pisanie na klawiaturze, psy, syreny), dźwięki tonalne i spersonalizowane scenariusze, w których model musi tłumić wszystkich z wyjątkiem zarejestrowanego głośnika docelowego. Udostępniając dane, wartości bazowe i wspólny zestaw testów, umożliwiono laboratoriom porównywanie jabłek z jabłkami i przyspieszono przejście od sztuczek filtrujących do kompleksowego głębokiego uczenia się w celu poprawy mowy.
Wgląd techniczny
Wpisy zazwyczaj zasilają krótkotrwałą transformatę Fouriera zaszumionego przebiegu w sieć rekurencyjną lub splotową, która przewiduje maskę czasowo-częstotliwościową. Mnożenie maski przez zaszumione widmo osłabia przedziały zdominowane przez hałas, zachowując te zdominowane przez mowę, a następnie odwrotna metoda STFT odbudowuje kształt fali. Reguły czasu rzeczywistego ograniczają opóźnienie algorytmiczne (około 40 ms) i wymagają przetwarzania przyczynowego, więc modele nie mogą podglądać przyszłego dźwięku podczas czyszczenia bieżącej klatki.
Wpływ strategiczny
Dostęp i zasięg
Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.
Koszt i budżet
Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.
Szybkość i skala
Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.
Wyzwanie dotyczące przyszłości tłumienia głębokiego hałasu
Należy się spodziewać, że ramy zostaną rozszerzone w kierunku spersonalizowanego i multimodalnego tłumienia, w którym ruch warg lub głos mówiącego wskazuje, czego należy się trzymać. Liczba modeli jest coraz mniejsza, aby można było je uruchamiać na urządzeniach dousznych i aparatach słuchowych, a pełnozakresowe przetwarzanie 48 kHz staje się standardem, dzięki czemu muzyka i wysokie częstotliwości przetrwają. Podejścia generatywne, które resyntetyzują czystą mowę, a nie tylko maskują hałas, stanowią aktywną i czasami kontrowersyjną granicę.
Implementacja w świecie rzeczywistym
Usuwanie szumów tła w czasie rzeczywistym w Microsoft Teams i innych aplikacjach do rozmów wideo
Czystsze przechwytywanie mowy w słuchawkach dousznych i zestawach słuchawkowych podczas dojazdów do pracy lub ruchliwych kawiarni
Wstępne przetwarzanie nagrań terenowych z zakłóceniami przed automatyczną transkrypcją lub napisami
Poprawa zrozumiałości w aparatach słuchowych i urządzeniach wspomagających słyszenie
Zagrożenia i poręcze
W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.
Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.
Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.
Plan wdrożenia
Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.
Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.
Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.
Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Deep Noise Suppression Challenge quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Głębokie uczenie się
Często zadawane pytania
What is Deep Noise Suppression Challenge?
Wyzwanie Deep Noise Suppression (DNS) to konkurs organizowany przez Microsoft, który motywuje badaczy do budowania sieci neuronowych, które w czasie rzeczywistym usuwają szum tła z mowy. Ustanawia nowoczesne standardy, które obsługują takie funkcje, jak Teams i usuwanie szumów Zoom.
Która organizacja uruchomiła wyzwanie Deep Noise Suppression (DNS)?
Microsoft uruchomił konkurs DNS Challenge w 2020 r. i przeprowadził go w miejscach takich jak INTERSPEECH i ICASSP.
Jaki jest główny cel systemów zbudowanych na potrzeby DNS Challenge?
Wyzwanie ma na celu poprawę mowy w czasie rzeczywistym, tłumienie hałasu przy jednoczesnym zachowaniu głosu mówiącego.
Dlaczego przetwarzanie DNS w czasie rzeczywistym zabrania modelom korzystania z przyszłych ramek audio?
Rozmowa na żywo wymaga przetwarzania przyczynowego i małego opóźnienia, więc model może używać tylko przeszłego i bieżącego dźwięku.
Powszechną techniką we wpisach DNS jest przewidywanie „maski”. Co robi maska?
Maska czasowo-częstotliwościowa jest mnożona przez zaszumione widmo, aby stłumić elementy zdominowane przez hałas i zachować mowę.
Jak wyzwanie DNS zmieniło sposób oceny poprawy mowy?
Wyzwanie przesunęło się w stronę testów odsłuchu na ludziach i poznania predyktorów jakości percepcyjnej zamiast samej matematyki sygnału.