Zvukový průvodce AI

Odšumování řeči pomocí RNNoise

RNNoise je malá, rychlá neuronová síť, která v reálném čase odstraňuje šum na pozadí z řeči.

2 minuty čteníNaposledy aktualizováno

Přehled

Created by Xiph.Org's Jean-Marc Valin, it pairs classic signal processing with a small recurrent network so it runs on ordinary CPUs and even embedded devices.

Hluboký ponor

RNNoise, vydaný v roce 2017, byl navržen pro potlačení hluku s nízkou latencí v hlasových hovorech. Namísto toho, aby se vše učilo od začátku do konce, rozděluje řeč do asi 22 frekvenčních pásem modelovaných podle lidského ucha (škála podobná Barkovi) a používá rekurentní neuronovou síť s Gated Recurrent Units k odhadu zisku (0 až 1) pro každé pásmo na snímek. Tyto zisky ztlumí hlučná pásma a zároveň udrží pásma s převahou řeči nedotčená. Doplňkový pitch filtr čistí zbytkový šum mezi harmonickými znělými řečmi. Celý model má zhruba 85 000 vah, běží rychleji než v reálném čase na jednom jádru CPU a je open source pod licencí BSD, a proto byl integrován do projektů, jako je ekosystém kodeků Opus, Mumble a OBS Studio.

Technický přehled

Klíčovou volbou návrhu je provoz na percepčních zesíleních pásma namísto hrubých spektrálních zásobníků. Předpovídáním pouze ~22 hodnot zisku na snímek zůstává síť GRU malá a vyhýbá se hudebně-šumovým artefaktům obvyklým u starších metod odčítání spektra. Ručně vytvořené funkce (energie pásma, perioda výšky tónu, korelace výšky tónu) napájejí síť a mísí znalosti DSP s učením. Samostatný výstup hlasové aktivity napomáhá zisku brány během čistě šumových snímků.

Strategický dopad

Přístup a dosah

Zlepšuje dostupnost prostřednictvím přepisu, vyprávění a hlasových rozhraní.

Cena a rozpočet

Mediální týmy mohou dodávat vylepšený zvuk rychleji s menšími rozpočty.

Rychlost a měřítko

Systémy orientované na zákazníky mohou zpracovávat mluvené interakce ve větším měřítku.

Budoucnost odšumování řeči s RNNoise

RNNoise inspiroval vlnu lehkých vylepšení v reálném čase; jeho následný výzkum (PercepNet, DeepFilterNet) posouvá kvalitu na vyšší úroveň a zároveň udržuje nízké rozpočty CPU. Počítejte s tím, že odšumovací zařízení se zabuduje přímo do náhlavních souprav, naslouchátek a konferenčních čipů, bude se kombinovat s potlačením ozvěny a dereverberací a bude používat vjemové a dokonce generativní cíle. Recept na hybridní DSP-plus-small-network zůstává vlivný všude tam, kde na nízké latenci, nízké spotřebě a licencování open source záleží více než na hrubé velikosti modelu.

Real-World Implementace

Potlačení klapání klávesnice a hučení ventilátoru během videohovorů v aplikacích, které obsahují RNNoise.

Vyčištění mikrofonu streamera v OBS Studio pomocí vestavěného filtru pro potlačení šumu RNNoise.

Zlepšení srozumitelnosti hlasového chatu ve hrách a nástrojů VoIP, jako je Mumble na nízkoenergetickém hardwaru.

Předzpracování zašuměných nahrávek v terénu, takže rozpoznávání řeči po proudu získá čistší signál.

Rizika a zábradlí

Pokud chybí souhlas, zvyšuje se riziko zneužití hlasu a předstírání jiné identity.

Přesnost může klesat v přízvuku, dialektech nebo hlučném prostředí.

Syntetický zvuk lze bez jasného označení zaměnit za autentickou řeč.

Plán implementace

1

Získejte výslovný souhlas se zachycením hlasu, klonováním a opětovným použitím.

2

Otestujte kvalitu napříč různými reproduktory a podmínkami pozadí.

3

Definujte, kdy musí člověk zkontrolovat nebo schválit výstupy.

4

Označte syntetický zvuk a veďte záznamy o původu pro zajištění odpovědnosti.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speech Denoising with RNNoise quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Oddělení řeči a problém koktejlové párty

Často kladené otázky

What is Speech Denoising with RNNoise?

RNNoise je malá, rychlá neuronová síť, která v reálném čase odstraňuje šum na pozadí z řeči. Vytvořil jej Jean-Marc Valin z Xiph.Org a spojuje klasické zpracování signálu s malou rekurentní sítí, takže běží na běžných CPU a dokonce i na vestavěných zařízeních.

Co RNNoise primárně předpovídá pro každý krátký snímek zvuku?

RNNoise odhaduje zisky na pásmo, které ztlumí pásma s převahou šumu a zároveň zachová pásma s převahou řeči, místo aby pracoval na každém spektrálním zásobníku.

Jaký typ neuronové sítě je jádrem RNNoise?

RNNoise využívá kompaktní rekurentní neuronovou síť postavenou s Gated Recurrent Units, která jí poskytuje dočasnou paměť a přitom zůstává malá.

Proč RNNoise používá percepční frekvenční pásma místo hrubých spektrálních košů?

Předpovídání pouze ~22 pásmových zisků udržuje síť malou, rychlou a méně náchylnou k hudebně-šumovým artefaktům, které sužují metody per-bin.

Jak velký je zhruba model RNNoise?

RNNoise má řádově 85 000 závaží, což je dostatečně malé, aby běželo rychleji než v reálném čase na jediném jádru CPU.

Jaká je role pitch filtru v RNNoise?

Hřebenový/pitch filtr využívá harmonickou strukturu mluvené řeči k potlačení šumu mezi harmonickými a doplňuje zesílení pásma.