Odszumianie mowy za pomocą RNNoise
RNNoise to niewielka, szybka sieć neuronowa, która w czasie rzeczywistym usuwa szum tła z mowy.
Przegląd
Created by Xiph.Org's Jean-Marc Valin, it pairs classic signal processing with a small recurrent network so it runs on ordinary CPUs and even embedded devices.
Głębokie nurkowanie
RNNoise, wydany w 2017 roku, został zaprojektowany z myślą o tłumieniu szumów o niskim opóźnieniu w połączeniach głosowych. Zamiast uczyć się wszystkiego od początku do końca, dzieli mowę na około 22 pasma częstotliwości wzorowane na ludzkim uchu (skala podobna do kory) i wykorzystuje rekurencyjną sieć neuronową z bramkowanymi jednostkami rekurencyjnymi do oszacowania wzmocnienia (0 do 1) dla każdego pasma na klatkę. Wzmocnienia te tłumią hałaśliwe pasma, zachowując nienaruszone pasma zdominowane przez mowę. Uzupełniający filtr wysokości dźwięku usuwa szum resztkowy pomiędzy harmonicznymi mowy dźwięcznej. Cały model ma około 85 000 wag, działa szybciej niż w czasie rzeczywistym na jednym rdzeniu procesora i jest oprogramowaniem typu open source na licencji BSD, dlatego został zintegrowany z projektami takimi jak ekosystem kodeków Opus, Mumble i OBS Studio.
Wgląd techniczny
Kluczowym wyborem projektowym jest działanie na wzmocnieniu pasma percepcyjnego zamiast na surowych pojemnikach widmowych. Przewidując jedynie ~22 wartości wzmocnienia na ramkę, sieć GRU pozostaje niewielka i pozwala uniknąć artefaktów szumu muzycznego, powszechnych w starszych metodach odejmowania widma. Ręcznie opracowane funkcje (energia pasma, okres wysokości tonu, korelacja wysokości tonu) zasilają sieć, łącząc wiedzę o DSP z nauką. Oddzielne wyjście do obsługi głosu pomaga we wzmocnieniu bramki podczas klatek z czystym szumem.
Wpływ strategiczny
Dostęp i zasięg
Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.
Koszt i budżet
Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.
Szybkość i skala
Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.
Przyszłość odszumiania mowy za pomocą RNNoise
RNNoise zainspirowało falę lekkich prac ulepszających w czasie rzeczywistym; jego następcy (PercepNet, DeepFilterNet) podnoszą jakość, utrzymując jednocześnie niewielkie budżety procesora. Można się spodziewać, że denoisery będą można zintegrować bezpośrednio z zestawami słuchawkowymi, aparatami słuchowymi i chipami konferencyjnymi, połączyć je z eliminacją echa i eliminowaniem pogłosu oraz wykorzystywać cele percepcyjne, a nawet generatywne. Hybrydowa receptura DSP plus mała sieć pozostaje wpływowa wszędzie tam, gdzie małe opóźnienia, mała moc i licencjonowanie typu open source mają większe znaczenie niż surowy rozmiar modelu.
Implementacja w świecie rzeczywistym
Tłumienie brzęku klawiatury i buczenia wentylatora podczas rozmów wideo w aplikacjach zawierających RNNoise.
Czyszczenie mikrofonu streamera w OBS Studio za pomocą wbudowanego filtra tłumienia szumów RNNoise.
Poprawa zrozumiałości czatu głosowego w grach i narzędziach VoIP, takich jak Mumble, na sprzęcie o niskim poborze mocy.
Wstępne przetwarzanie nagrań z szumu w terenie, aby rozpoznawanie mowy w dalszej części transmisji uzyskało czystszy sygnał.
Zagrożenia i poręcze
W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.
Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.
Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.
Plan wdrożenia
Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.
Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.
Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.
Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speech Denoising with RNNoise quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Separacja mowy i problem przyjęcia koktajlowego
Często zadawane pytania
What is Speech Denoising with RNNoise?
RNNoise to niewielka, szybka sieć neuronowa, która w czasie rzeczywistym usuwa szum tła z mowy. Stworzony przez Jean-Marca Valina z Xiph.Org, łączy w sobie klasyczne przetwarzanie sygnału z małą siecią rekurencyjną, dzięki czemu działa na zwykłych procesorach, a nawet na urządzeniach wbudowanych.
Co przede wszystkim przewiduje RNNoise dla każdej krótkiej klatki dźwięku?
RNNoise szacuje zyski na pasmo, które tłumią pasma zdominowane przez szum, zachowując pasma zdominowane przez mowę, zamiast pracować nad każdym przedziałem widmowym.
Jaki typ sieci neuronowej stanowi rdzeń RNNoise?
RNNoise wykorzystuje kompaktową, rekurencyjną sieć neuronową zbudowaną z bramkowanych jednostek rekurencyjnych, która zapewnia pamięć tymczasową, a jednocześnie pozostaje niewielka.
Dlaczego RNNoise wykorzystuje percepcyjne pasma częstotliwości zamiast surowych przedziałów widmowych?
Przewidywanie jedynie ~22 wzmocnień pasma sprawia, że sieć jest mała, szybka i mniej podatna na artefakty związane z szumem muzycznym, które są plagą metod per-bin.
Jak duży jest w przybliżeniu model RNNoise?
RNNoise ma masę rzędu 85 000, wystarczająco małą, aby działać szybciej niż w czasie rzeczywistym na pojedynczym rdzeniu procesora.
Jaka jest rola filtra wysokości dźwięku w RNNoise?
Filtr grzebieniowo-tonowy wykorzystuje strukturę harmoniczną mowy dźwięcznej do tłumienia szumów znajdujących się pomiędzy harmonicznymi, uzupełniając wzmocnienie pasma.