Audio AI ÚTMUTATÓ

Mély zajelnyomási kihívás

A Deep Noise Suppression (DNS) Challenge egy Microsoft által lebonyolított verseny, amely arra készteti a kutatókat, hogy neurális hálózatokat építsenek, amelyek valós időben eltávolítják a háttérzajt a beszédből.

2 perc olvasásUtoljára frissítve

Áttekintés

It set the modern benchmarks that power features like Teams and Zoom noise removal.

Mély merülés

A Microsoft által 2020-ban elindított és több éven át ismétlődő DNS-kihívás (gyakran az INTERSPEECH-nél és az ICASSP-nél) nagy, szabványosított adatkészletet adott a csapatoknak tiszta beszédből, zajklipekből és szintetikusan kevert zajos felvételekből. Döntő fontosságú, hogy az értékelést a régebbi jelmatematikáról, például a PESQ-ról az emberi hallási pontszámok és az észlelt minőség tanult előrejelzői felé tolja el. Ezenkívül kemény, valós körülményeket is hozzáadott: visszhangzó szobák, nem álló zajok (gépelés, kutyák, szirénák), ​​tónusos zajok és személyre szabott forgatókönyvek, amikor a modellnek mindenkit el kell nyomnia, kivéve egy bejegyzett célhangszórót. Az adatok, az alapvonalak és a közös tesztkészlet közzétételével lehetővé tette a laboratóriumok számára az almák és az almák összehasonlítását, és felgyorsította az elmozdulást a szűrési trükkökről a beszédjavítás érdekében a végpontok közötti mély tanulásra.

Technikai betekintés

A bejegyzések jellemzően a zajos hullámforma rövid idejű Fourier-transzformációját táplálják visszatérő vagy konvolúciós hálózattá, amely előrejelzi az idő-frekvencia maszkot. Ha a maszkot megszorozzuk a zajos spektrummal, akkor a zaj-domináns bineket csillapítja, miközben megőrzi a beszéddomináltakat, majd egy inverz STFT újraépíti a hullámformát. A valós idejű szabályok korlátozzák az algoritmus késleltetési idejét (körülbelül 40 ms), és ok-okozati feldolgozást igényelnek, így a modellek nem nézhetik meg a jövőbeli hangot az aktuális képkocka tisztításakor.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A mély zajelnyomás jövője

Várható, hogy a keret a személyre szabott és multimodális elnyomás felé terjeszkedik, ahol az ajkak mozgása vagy a hangszóró hanglenyomata irányítja, mit tartsunk meg. A modellek egyre zsugorodnak ahhoz, hogy a fülhallgatók és hallókészülékek eszközön futhassanak, és a teljes sávú 48 kHz-es feldolgozás szabványossá válik, így a zene és a magas frekvenciák túlélik. Azok a generatív megközelítések, amelyek a zaj elfedése helyett a tiszta beszédet újraszintetizálják, aktív és néha ellentmondásos határvonalat jelentenek.

Valós megvalósítás

Valós idejű háttérzaj-eltávolítás a Microsoft Teamsben és más videohívás-alkalmazásokban

Tisztább beszédrögzítés a fülhallgatókban és headsetekben ingázás vagy forgalmas kávézók során

Zajos terepi felvételek előfeldolgozása az automatikus átírás vagy feliratozás előtt

Az érthetőség javítása hallókészülékekben és hallássegítő eszközökben

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Deep Noise Suppression Challenge quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Deep Noise Suppression Challenge?

A Deep Noise Suppression (DNS) Challenge egy Microsoft által lebonyolított verseny, amely arra készteti a kutatókat, hogy neurális hálózatokat építsenek, amelyek valós időben eltávolítják a háttérzajt a beszédből. Meghatározta azokat a modern mércéket, amelyek olyan funkciókat hajtanak végre, mint a Teams és a Zoom zajcsökkentés.

Melyik szervezet indította el a Deep Noise Suppression (DNS) kihívást?

Microsoft 2020-ban indította el a DNS Challenge programot, és olyan helyszíneken futtatta, mint az INTERSPEECH és az ICASSP.

Mi a fő célja a DNS-kihíváshoz épített rendszereknek?

A kihívás a valós idejű beszédjavítást célozza meg, a zaj elnyomásával, miközben megőrzi a beszélő hangját.

Miért tiltja meg a valós idejű DNS-feldolgozás, hogy a modellek jövőbeli hangkockákat használhassanak?

Az élő beszélgetés ok-okozati, alacsony késleltetésű feldolgozást igényel, így a modell csak múltbeli és jelenlegi hangot tud használni.

A DNS-bejegyzésekben elterjedt technika a „maszk” előrejelzése. Mit csinál a maszk?

Az idő-frekvencia maszk megsokszorozva van a zajos spektrummal, hogy elnyomja a zaj által dominált tárakat és megtartsa a beszédet.

Hogyan változtatta meg a DNS-kihívás a beszédjavítás értékelését?

A kihívás az emberi hallástesztek és az észlelési minőségi előrejelzők megtanulása felé mozdult el a csupán jelmatematika helyett.