Audio AI ÚTMUTATÓ

Noise2Noise beszédjavítás

A Noise2Noise egy oktatási trükk, amely lehetővé teszi a modell számára, hogy megtanulja eltávolítani a zajt anélkül, hogy tiszta referenciát látna, azáltal, hogy ugyanazon jel különböző zajos verzióiból tanul.

2 perc olvasásUtoljára frissítve

Áttekintés

For speech enhancement it matters because clean recordings are expensive or impossible to obtain, yet noisy ones are everywhere.

Mély merülés

Az NVIDIA kutatói által 2018-ban bemutatott Noise2Noise meglepő állítást fogalmazott meg: a zajtalanítót csak hibás példák segítségével lehet betanítani. A betekintés statisztikai jellegű. Ha egy hálózatnak ugyanannak a mögöttes jelnek két zajos változatát adjuk meg, és megkérjük, hogy egy veszteséggel, például átlagos négyzetes hiba használatával képezze le egymást, a hálózat nem tudja megjósolni a véletlenszerű zajt a célpontban, így a legjobb, amit tehet, ha a várt értéket adja ki, ami a tiszta jel. Átlagos a zaj. A beszédre alkalmazva letisztult kijelentést tesz, két független zajmintát ad hozzá, és megtanítja a modellt, hogy előre jelezze az egyik zajos klipet a másikból. Következtetésképpen a modell eltávolítja a zajt a valós felvételekből. Ez kikerüli a felügyelt zajtalanítás fő szűk keresztmetszetét: tökéletesen tiszta, alap-igazság hangra van szükség.

Technikai betekintés

A matematika azon a tulajdonságon nyugszik, hogy az L2 (közép négyzetes hiba) veszteség a feltételes átlagnál minimálisra csökken. Ha a célhoz hozzáadott zaj nulla átlagos és független a bemenet zajától, akkor a megjósolhatatlan zaj csak állandó szórást okoz a veszteségben, így a gradiens süllyedés a hálózatot a mögöttes tiszta jel felé tereli. Ugyanez az ötlet más becsléseknél is működik: az L1 veszteség visszanyeri a mediánt, ami hasznos az impulzív zaj esetében.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A Noise2Noise beszédjavítás jövője

A Noise2Noise önállóan felügyelt zajtalanítási módszerek családját nyitotta meg, köztük a Noise2Voidot és a Noise2Selfet, amelyek még jobban enyhítik a követelményeket az egyedi zajos mintákból való tanulás felé. Beszéd esetén ezektől az ötletektől számítson a hallókészülékek, hívások és helyszíni felvételek eszközön történő javítására, ahol nem praktikus tiszta referenciák gyűjtése. A generatív vocoderekkel kombinálva a jövőbeli rendszerek nem csak kivonják a zajt, hanem hihetően rekonstruálják a maszkolt vagy megsemmisült beszédtartalmat, miközben hűek maradnak a beszélőhöz.

Valós megvalósítás

Olyan terepi vagy archív felvételek megtisztítása, ahol nincs tiszta hivatkozás az eredeti beszédre

A hanghívások tisztaságának javítása telefonokon és laptopokon azáltal, hogy a zajtalanítókat a valós zajos felvételekre tanítja

A hallókészülékek beszédének javítása párosított zajos felvételek segítségével az elérhetetlen tiszta hang helyett

Zajos régi podcast- vagy interjúkazetták helyreállítása, ahol csak a degradált verziók maradtak fenn

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Noise2Noise Speech Enhancement quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Kaldi beszédfelismerő eszköztár

Gyakran ismételt kérdések

What is Noise2Noise Speech Enhancement?

A Noise2Noise egy oktatási trükk, amely lehetővé teszi a modell számára, hogy megtanulja eltávolítani a zajt anélkül, hogy tiszta referenciát látna, azáltal, hogy ugyanazon jel különböző zajos verzióiból tanul. A beszédjavítás szempontjából ez azért fontos, mert a tiszta felvételek drágák vagy lehetetlenek, de zajosak mindenhol megtalálhatók.

Mi a Noise2Noise meglepő alapkövetelése?

A Noise2Noise megmutatta, hogy hatékony zajtalanítót tud kiképezni csak pár hibás példa használatával, tiszta célpontok nélkül.

Miért nem tudja a hálózat egyszerűen megjegyezni a célklipben lévő zajt?

Mivel a célpont zaja véletlenszerű és független a bemenettől, a hálózat nem tudja megjósolni azt, és ehelyett a tiszta várható értékhez konvergál.

L2 (átlagos négyzetes hiba) veszteség esetén mi felé konvergál a hálózat?

Az L2 veszteség a feltételes átlagnál minimálisra csökken, így nulla átlagú független célzaj mellett a hálózat a mögöttes tiszta jelet adja ki.

Minek kell igaznak lennie a célponthoz hozzáadott zajról, hogy a trükk működjön?

A célzajnak nulla-átlagosnak kell lennie, és statisztikailag függetlennek kell lennie a bemeneti zajtól, hogy az edzés során átlagot érjen el.

Melyik statisztika helyreállítja a hálózatot, ha L2 veszteségről L1 veszteségre vált?

Az L1 (abszolút hiba) veszteség minimálisra csökken a mediánnál, amely robusztusabb az impulzív zajjal szemben.