GHID audio AI

Provocare pentru suprimarea zgomotului profund

Provocarea Deep Noise Suppression (DNS) este o competiție organizată de Microsoft, care împinge cercetătorii să construiască rețele neuronale care să elimine zgomotul de fundal din vorbire în timp real.

2 minute de lecturăUltima actualizare

Prezentare generală

It set the modern benchmarks that power features like Teams and Zoom noise removal.

Scufundare în profunzime

Lansată de Microsoft în 2020 și repetă de câțiva ani (deseori la INTERSPEECH și ICASSP), DNS Challenge a oferit echipelor un set de date mare și standardizat de vorbire curată, clipuri de zgomot și înregistrări zgomotoase amestecate sintetic. În mod esențial, a mutat evaluarea de la matematica semnalelor mai vechi, cum ar fi PESQ, spre scorurile de ascultare umană și predictorii învățați ai calității percepute. De asemenea, a adăugat condiții dure din lumea reală: camere reverberante, zgomote nestaționare (dactilografiere, câini, sirene), zgomote tonale și scenarii personalizate în care un model trebuie să suprime pe toată lumea, cu excepția unui difuzor țintă înscris. Prin lansarea de date, linii de bază și un set comun de teste, a permis laboratoarelor să compare mere cu mere și a accelerat trecerea de la trucuri de filtrare la învățarea profundă de la capăt la capăt pentru îmbunătățirea vorbirii.

Perspectivă tehnică

Intrările alimentează de obicei transformarea Fourier de scurtă durată a formei de undă zgomotoase într-o rețea recurentă sau convoluțională care prezice o mască timp-frecvență. Înmulțirea măștii cu spectrul de zgomot atenuează binurile dominate de zgomot, păstrând în același timp pe cele dominate de vorbire, apoi un STFT invers reconstruiește forma de undă. Regulile în timp real limitează latența algoritmică (aproximativ 40 ms) și necesită procesare cauzală, astfel încât modelele nu pot arunca o privire la sunetul viitor atunci când curățează cadrul curent.

Impact strategic

Acces și acoperire

Îmbunătățește accesibilitatea prin transcriere, narațiune și interfețe vocale.

Cost și buget

Echipele media pot livra audio mai rapid cu bugete mai mici.

Viteză și scară

Sistemele orientate către clienți pot procesa interacțiunile vorbite la scară mai mare.

Viitorul provocării suprimarii zgomotului profund

Așteptați-vă ca cadrul să se extindă către o suprimare personalizată și multimodală, unde mișcarea buzelor sau amprenta vocală a difuzorului ghidează ce trebuie păstrat. Modelele se micșorează pentru a rula pe dispozitiv pentru căști și aparate auditive, iar procesarea în bandă completă de 48 kHz devine standard, astfel încât muzica și frecvențele înalte să supraviețuiască. Abordările generative care resintetizează vorbirea curată, mai degrabă decât doar mascarea zgomotului, reprezintă o frontieră activă și uneori controversată.

Implementare în lumea reală

Eliminarea zgomotului de fundal în timp real în Microsoft Teams și alte aplicații pentru apeluri video

Captură mai curată a vorbirii în căști și căști în timpul navetei sau cafenelelor aglomerate

Preprocesează înregistrările câmpurilor zgomotoase înainte de transcrierea sau subtitrarea automată

Îmbunătățirea inteligibilității în aparatele auditive și dispozitivele de asistare auditivă

Riscuri și balustrade

Riscurile de utilizare greșită a vocii și uzurpare a identității cresc atunci când lipsește consimțământul.

Precizia poate scădea în accente, dialecte sau medii zgomotoase.

Audio sintetic poate fi confundat cu vorbire autentică fără etichetare clară.

Foaia de parcurs de implementare

1

Obțineți consimțământul explicit pentru captarea, clonarea și reutilizarea vocii.

2

Testați calitatea pe diverse difuzoare și condiții de fundal.

3

Definiți când un om trebuie să revizuiască sau să aprobe rezultatele.

4

Etichetați sunetul sintetic și păstrați înregistrări de proveniență pentru responsabilitate.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Deep Noise Suppression Challenge quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Învățare profundă

Întrebări frecvente

What is Deep Noise Suppression Challenge?

Provocarea Deep Noise Suppression (DNS) este o competiție organizată de Microsoft, care împinge cercetătorii să construiască rețele neuronale care să elimine zgomotul de fundal din vorbire în timp real. Acesta a stabilit reperele moderne pentru funcții de putere precum Teams și eliminarea zgomotului Zoom.

Ce organizație a lansat provocarea Deep Noise Suppression (DNS)?

Microsoft a lansat DNS Challenge în 2020 și a derulat-o în locații precum INTERSPEECH și ICASSP.

Care este obiectivul principal al sistemelor construite pentru DNS Challenge?

Provocarea vizează îmbunătățirea vorbirii în timp real, suprimând zgomotul, păstrând în același timp vocea vorbitorului.

De ce procesarea DNS în timp real interzice modelelor să folosească cadre audio viitoare?

Conversația live necesită procesare cauzală, cu latență scăzută, astfel încât modelul poate folosi doar sunetul trecut și actual.

O tehnică comună în intrările DNS este de a prezice o „mască”. Ce face masca?

O mască de timp-frecvență este înmulțită cu spectrul de zgomot pentru a suprima containerele dominate de zgomot și pentru a reține vorbirea.

Cum a schimbat provocarea DNS modul în care este evaluată îmbunătățirea vorbirii?

Provocarea s-a mutat către testele de ascultare umană și au învățat predictori de calitate perceptivă în loc de matematica semnalului.