Provocare pentru suprimarea zgomotului profund
Provocarea Deep Noise Suppression (DNS) este o competiție organizată de Microsoft, care împinge cercetătorii să construiască rețele neuronale care să elimine zgomotul de fundal din vorbire în timp real.
Prezentare generală
It set the modern benchmarks that power features like Teams and Zoom noise removal.
Scufundare în profunzime
Lansată de Microsoft în 2020 și repetă de câțiva ani (deseori la INTERSPEECH și ICASSP), DNS Challenge a oferit echipelor un set de date mare și standardizat de vorbire curată, clipuri de zgomot și înregistrări zgomotoase amestecate sintetic. În mod esențial, a mutat evaluarea de la matematica semnalelor mai vechi, cum ar fi PESQ, spre scorurile de ascultare umană și predictorii învățați ai calității percepute. De asemenea, a adăugat condiții dure din lumea reală: camere reverberante, zgomote nestaționare (dactilografiere, câini, sirene), zgomote tonale și scenarii personalizate în care un model trebuie să suprime pe toată lumea, cu excepția unui difuzor țintă înscris. Prin lansarea de date, linii de bază și un set comun de teste, a permis laboratoarelor să compare mere cu mere și a accelerat trecerea de la trucuri de filtrare la învățarea profundă de la capăt la capăt pentru îmbunătățirea vorbirii.
Perspectivă tehnică
Intrările alimentează de obicei transformarea Fourier de scurtă durată a formei de undă zgomotoase într-o rețea recurentă sau convoluțională care prezice o mască timp-frecvență. Înmulțirea măștii cu spectrul de zgomot atenuează binurile dominate de zgomot, păstrând în același timp pe cele dominate de vorbire, apoi un STFT invers reconstruiește forma de undă. Regulile în timp real limitează latența algoritmică (aproximativ 40 ms) și necesită procesare cauzală, astfel încât modelele nu pot arunca o privire la sunetul viitor atunci când curățează cadrul curent.
Impact strategic
Acces și acoperire
Îmbunătățește accesibilitatea prin transcriere, narațiune și interfețe vocale.
Cost și buget
Echipele media pot livra audio mai rapid cu bugete mai mici.
Viteză și scară
Sistemele orientate către clienți pot procesa interacțiunile vorbite la scară mai mare.
Viitorul provocării suprimarii zgomotului profund
Așteptați-vă ca cadrul să se extindă către o suprimare personalizată și multimodală, unde mișcarea buzelor sau amprenta vocală a difuzorului ghidează ce trebuie păstrat. Modelele se micșorează pentru a rula pe dispozitiv pentru căști și aparate auditive, iar procesarea în bandă completă de 48 kHz devine standard, astfel încât muzica și frecvențele înalte să supraviețuiască. Abordările generative care resintetizează vorbirea curată, mai degrabă decât doar mascarea zgomotului, reprezintă o frontieră activă și uneori controversată.
Implementare în lumea reală
Eliminarea zgomotului de fundal în timp real în Microsoft Teams și alte aplicații pentru apeluri video
Captură mai curată a vorbirii în căști și căști în timpul navetei sau cafenelelor aglomerate
Preprocesează înregistrările câmpurilor zgomotoase înainte de transcrierea sau subtitrarea automată
Îmbunătățirea inteligibilității în aparatele auditive și dispozitivele de asistare auditivă
Riscuri și balustrade
Riscurile de utilizare greșită a vocii și uzurpare a identității cresc atunci când lipsește consimțământul.
Precizia poate scădea în accente, dialecte sau medii zgomotoase.
Audio sintetic poate fi confundat cu vorbire autentică fără etichetare clară.
Foaia de parcurs de implementare
Obțineți consimțământul explicit pentru captarea, clonarea și reutilizarea vocii.
Testați calitatea pe diverse difuzoare și condiții de fundal.
Definiți când un om trebuie să revizuiască sau să aprobe rezultatele.
Etichetați sunetul sintetic și păstrați înregistrări de proveniență pentru responsabilitate.
Continuați să explorați
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Deep Noise Suppression Challenge quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Următorul ghid
Învățare profundă
Întrebări frecvente
What is Deep Noise Suppression Challenge?
Provocarea Deep Noise Suppression (DNS) este o competiție organizată de Microsoft, care împinge cercetătorii să construiască rețele neuronale care să elimine zgomotul de fundal din vorbire în timp real. Acesta a stabilit reperele moderne pentru funcții de putere precum Teams și eliminarea zgomotului Zoom.
Ce organizație a lansat provocarea Deep Noise Suppression (DNS)?
Microsoft a lansat DNS Challenge în 2020 și a derulat-o în locații precum INTERSPEECH și ICASSP.
Care este obiectivul principal al sistemelor construite pentru DNS Challenge?
Provocarea vizează îmbunătățirea vorbirii în timp real, suprimând zgomotul, păstrând în același timp vocea vorbitorului.
De ce procesarea DNS în timp real interzice modelelor să folosească cadre audio viitoare?
Conversația live necesită procesare cauzală, cu latență scăzută, astfel încât modelul poate folosi doar sunetul trecut și actual.
O tehnică comună în intrările DNS este de a prezice o „mască”. Ce face masca?
O mască de timp-frecvență este înmulțită cu spectrul de zgomot pentru a suprima containerele dominate de zgomot și pentru a reține vorbirea.
Cum a schimbat provocarea DNS modul în care este evaluată îmbunătățirea vorbirii?
Provocarea s-a mutat către testele de ascultare umană și au învățat predictori de calitate perceptivă în loc de matematica semnalului.