PRZEWODNIK AI audio

Odszumianie mowy za pomocą RNNoise

RNNoise to niewielka, szybka sieć neuronowa, która w czasie rzeczywistym usuwa szum tła z mowy.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Created by Xiph.Org's Jean-Marc Valin, it pairs classic signal processing with a small recurrent network so it runs on ordinary CPUs and even embedded devices.

Głębokie nurkowanie

RNNoise, wydany w 2017 roku, został zaprojektowany z myślą o tłumieniu szumów o niskim opóźnieniu w połączeniach głosowych. Zamiast uczyć się wszystkiego od początku do końca, dzieli mowę na około 22 pasma częstotliwości wzorowane na ludzkim uchu (skala podobna do kory) i wykorzystuje rekurencyjną sieć neuronową z bramkowanymi jednostkami rekurencyjnymi do oszacowania wzmocnienia (0 do 1) dla każdego pasma na klatkę. Wzmocnienia te tłumią hałaśliwe pasma, zachowując nienaruszone pasma zdominowane przez mowę. Uzupełniający filtr wysokości dźwięku usuwa szum resztkowy pomiędzy harmonicznymi mowy dźwięcznej. Cały model ma około 85 000 wag, działa szybciej niż w czasie rzeczywistym na jednym rdzeniu procesora i jest oprogramowaniem typu open source na licencji BSD, dlatego został zintegrowany z projektami takimi jak ekosystem kodeków Opus, Mumble i OBS Studio.

Wgląd techniczny

Kluczowym wyborem projektowym jest działanie na wzmocnieniu pasma percepcyjnego zamiast na surowych pojemnikach widmowych. Przewidując jedynie ~22 wartości wzmocnienia na ramkę, sieć GRU pozostaje niewielka i pozwala uniknąć artefaktów szumu muzycznego, powszechnych w starszych metodach odejmowania widma. Ręcznie opracowane funkcje (energia pasma, okres wysokości tonu, korelacja wysokości tonu) zasilają sieć, łącząc wiedzę o DSP z nauką. Oddzielne wyjście do obsługi głosu pomaga we wzmocnieniu bramki podczas klatek z czystym szumem.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość odszumiania mowy za pomocą RNNoise

RNNoise zainspirowało falę lekkich prac ulepszających w czasie rzeczywistym; jego następcy (PercepNet, DeepFilterNet) podnoszą jakość, utrzymując jednocześnie niewielkie budżety procesora. Można się spodziewać, że denoisery będą można zintegrować bezpośrednio z zestawami słuchawkowymi, aparatami słuchowymi i chipami konferencyjnymi, połączyć je z eliminacją echa i eliminowaniem pogłosu oraz wykorzystywać cele percepcyjne, a nawet generatywne. Hybrydowa receptura DSP plus mała sieć pozostaje wpływowa wszędzie tam, gdzie małe opóźnienia, mała moc i licencjonowanie typu open source mają większe znaczenie niż surowy rozmiar modelu.

Implementacja w świecie rzeczywistym

Tłumienie brzęku klawiatury i buczenia wentylatora podczas rozmów wideo w aplikacjach zawierających RNNoise.

Czyszczenie mikrofonu streamera w OBS Studio za pomocą wbudowanego filtra tłumienia szumów RNNoise.

Poprawa zrozumiałości czatu głosowego w grach i narzędziach VoIP, takich jak Mumble, na sprzęcie o niskim poborze mocy.

Wstępne przetwarzanie nagrań z szumu w terenie, aby rozpoznawanie mowy w dalszej części transmisji uzyskało czystszy sygnał.

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speech Denoising with RNNoise quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Separacja mowy i problem przyjęcia koktajlowego

Często zadawane pytania

What is Speech Denoising with RNNoise?

RNNoise to niewielka, szybka sieć neuronowa, która w czasie rzeczywistym usuwa szum tła z mowy. Stworzony przez Jean-Marca Valina z Xiph.Org, łączy w sobie klasyczne przetwarzanie sygnału z małą siecią rekurencyjną, dzięki czemu działa na zwykłych procesorach, a nawet na urządzeniach wbudowanych.

Co przede wszystkim przewiduje RNNoise dla każdej krótkiej klatki dźwięku?

RNNoise szacuje zyski na pasmo, które tłumią pasma zdominowane przez szum, zachowując pasma zdominowane przez mowę, zamiast pracować nad każdym przedziałem widmowym.

Jaki typ sieci neuronowej stanowi rdzeń RNNoise?

RNNoise wykorzystuje kompaktową, rekurencyjną sieć neuronową zbudowaną z bramkowanych jednostek rekurencyjnych, która zapewnia pamięć tymczasową, a jednocześnie pozostaje niewielka.

Dlaczego RNNoise wykorzystuje percepcyjne pasma częstotliwości zamiast surowych przedziałów widmowych?

Przewidywanie jedynie ~22 wzmocnień pasma sprawia, że ​​sieć jest mała, szybka i mniej podatna na artefakty związane z szumem muzycznym, które są plagą metod per-bin.

Jak duży jest w przybliżeniu model RNNoise?

RNNoise ma masę rzędu 85 000, wystarczająco małą, aby działać szybciej niż w czasie rzeczywistym na pojedynczym rdzeniu procesora.

Jaka jest rola filtra wysokości dźwięku w RNNoise?

Filtr grzebieniowo-tonowy wykorzystuje strukturę harmoniczną mowy dźwięcznej do tłumienia szumów znajdujących się pomiędzy harmonicznymi, uzupełniając wzmocnienie pasma.