GHID audio AI

Eliminarea zgomotului vorbirii cu RNNoise

RNNoise este o rețea neuronală mică și rapidă care elimină zgomotul de fundal din vorbire în timp real.

2 minute de lecturăUltima actualizare

Prezentare generală

Created by Xiph.Org's Jean-Marc Valin, it pairs classic signal processing with a small recurrent network so it runs on ordinary CPUs and even embedded devices.

Scufundare în profunzime

RNNoise, lansat în 2017, a fost proiectat pentru suprimarea zgomotului cu latență scăzută în apelurile vocale. În loc să învețe totul de la capăt la capăt, împarte vorbirea în aproximativ 22 de benzi de frecvență modelate pe urechea umană (o scară asemănătoare Bark) și folosește o rețea neuronală recurentă cu Gated Recurrent Units pentru a estima un câștig (0 la 1) pentru fiecare bandă pe cadru. Aceste câștiguri atenuează benzile zgomotoase, păstrând în același timp intacte benzile dominate de vorbire. Un filtru de înălțime complementar curăță zgomotul rezidual dintre armonicile vorbirii vocale. Întregul model are aproximativ 85.000 de greutăți, rulează mai rapid decât în ​​timp real pe un singur nucleu CPU și este open source sub o licență BSD, motiv pentru care a fost integrat în proiecte precum ecosistemul de codec Opus, Mumble și OBS Studio.

Perspectivă tehnică

Alegerea cheie de proiectare este operarea pe câștiguri de bandă perceptivă în loc de compartimente spectrale brute. Prevăzând doar ~22 de valori de câștig pe cadru, rețeaua GRU rămâne mică și evită artefactele de zgomot muzical comune în metodele mai vechi de scădere spectrală. Caracteristicile realizate manual (energii de bandă, perioada de pitch, corelarea tonului) alimentează rețeaua, îmbinând cunoștințele DSP cu învățarea. O ieșire separată de activitate vocală ajută la câștigurile de poartă în timpul cadrelor cu zgomot pur.

Impact strategic

Acces și acoperire

Îmbunătățește accesibilitatea prin transcriere, narațiune și interfețe vocale.

Cost și buget

Echipele media pot livra audio mai rapid cu bugete mai mici.

Viteză și scară

Sistemele orientate către clienți pot procesa interacțiunile vorbite la scară mai mare.

Viitorul reducerii zgomotului vorbirii cu RNNoise

RNNoise a inspirat un val de lucrări ușoare de îmbunătățire în timp real; cercetarea succesorului său (PercepNet, DeepFilterNet) crește calitatea, menținând în același timp bugetele CPU mici. Așteptați-vă ca dezgomozatorii să se încorporeze direct în căști, proteze auditive și cipuri de conferințe, să se combine cu anularea ecoului și dereverberarea și să folosească obiective perceptuale și chiar generative. Rețeta hibridă DSP-plus-rețea mică rămâne influentă oriunde latența scăzută, puterea scăzută și licențele open-source contează mai mult decât dimensiunea brută a modelului.

Implementare în lumea reală

Suprimarea zgomoturilor de la tastatură și a zgomotului ventilatorului în timpul apelurilor video în aplicațiile care includ RNNoise.

Curățarea microfonului unui streamer în OBS Studio prin filtrul de suprimare a zgomotului RNNoise încorporat.

Îmbunătățirea inteligibilității chat-ului vocal în jocuri și instrumente VoIP precum Mumble pe hardware cu consum redus.

Preprocesarea înregistrărilor de câmp zgomotos, astfel încât recunoașterea vorbirii în aval să primească un semnal mai curat.

Riscuri și balustrade

Riscurile de utilizare greșită a vocii și uzurpare a identității cresc atunci când lipsește consimțământul.

Precizia poate scădea în accente, dialecte sau medii zgomotoase.

Audio sintetic poate fi confundat cu vorbire autentică fără etichetare clară.

Foaia de parcurs de implementare

1

Obțineți consimțământul explicit pentru captarea, clonarea și reutilizarea vocii.

2

Testați calitatea pe diverse difuzoare și condiții de fundal.

3

Definiți când un om trebuie să revizuiască sau să aprobe rezultatele.

4

Etichetați sunetul sintetic și păstrați înregistrări de proveniență pentru responsabilitate.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speech Denoising with RNNoise quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Separarea vorbirii și problema cocktail-ului

Întrebări frecvente

What is Speech Denoising with RNNoise?

RNNoise este o rețea neuronală mică și rapidă care elimină zgomotul de fundal din vorbire în timp real. Creat de Jean-Marc Valin de la Xiph.Org, îmbină procesarea clasică a semnalului cu o rețea recurentă mică, astfel încât să ruleze pe procesoare obișnuite și chiar pe dispozitive încorporate.

Ce prezice RNNoise în primul rând pentru fiecare cadru scurt de sunet?

RNNoise estimează câștigurile pe bandă care atenuează benzile dominate de zgomot, păstrând în același timp pe cele dominate de vorbire, mai degrabă decât să lucreze la fiecare compartiment spectral.

Ce tip de rețea neuronală se află la baza RNNoise?

RNNoise folosește o rețea neuronală recurentă compactă, construită cu Gated Recurrent Units, oferindu-i memorie temporală în timp ce rămâne mică.

De ce folosește RNNoise benzi de frecvență perceptivă în loc de recipientele spectrale brute?

Prezicerea doar a aproximativ 22 de câștiguri de bandă menține rețeaua mică, rapidă și mai puțin predispusă la artefactele de zgomot muzical care afectează metodele per-bin.

Aproximativ cât de mare este modelul RNNoise?

RNNoise are de ordinul a 85.000 de greutăți, suficient de mic pentru a rula mai repede decât în ​​timp real pe un singur nucleu CPU.

Care este rolul filtrului de pitch în RNNoise?

Un filtru comb/pitch exploatează structura armonică a vorbirii vocale pentru a suprima zgomotul care se află între armonici, completând câștigurile benzii.