Audio AI ÚTMUTATÓ

MelGAN Generatív Vocoder

A MelGAN egy teljesen konvolúciós GAN-alapú vocoder, amely egyetlen gyors előrelépéssel nyers hanghullámformává alakítja a mel-spektrogramokat.

2 perc olvasásUtoljára frissítve

Áttekintés

It mattered because it proved high-quality, non-autoregressive speech synthesis could run hundreds of times faster than real time on a GPU.

Mély merülés

MelGAN, amelyet Kumar és munkatársai vezettek be. 2019-ben a WaveNet által használt lassú mintavételi ciklus nélkül állít elő hangot. Generátora transzponált konvolúciók halmaza, amely egy mel-spektrogramot (általában 80 frekvenciasávot) a hangmintavételi sebességig mintavételez, a maradék blokkokkal pedig kitágult konvolúciókat használ a befogadói mező kiszélesítésére. A kulcsfontosságú újítás a több diszkriminátorral végzett képzés volt, amelyek különböző hangskálákon működtek (az eredeti hullámforma plusz a lemintázott változatok), amelyek mindegyike az átfedő ablakokat nézte. A funkció-illesztési veszteség összehasonlítja a megkülönböztető aktiválását a valódi és a hamis hang között, stabilizálja a GAN képzést. A modell a neurális-audio szabványok szerint kicsi, és még CPU-n is gyorsabban fut, mint a valós időben, így praktikus a beágyazott és az eszközön lévő szövegfelolvasáshoz.

Technikai betekintés

A MelGAN többléptékű diszkriminátora három azonos hálózatot használ, amelyek teljes, fél- és negyedfelbontásban nézik a hangot, mindegyik más-más frekvenciatartományban rögzíti a struktúrát. Lényeges, hogy a MelGAN a jellemző-illesztési veszteségre támaszkodik (az L1 távolság a valós és a generált hang megkülönböztető jellemzőtérképei között), nem pedig explicit spektrogram rekonstrukciós veszteségre, ami arra ösztönzi a generátort, hogy rétegről rétegre egyeztesse a valódi hang statisztikáit.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A MelGAN Generative Vocoder jövője

A MelGAN egy GAN vokoder családot alapított. Utódai, a HiFi-GAN és az UnivNet megtartották a gyors, nem autoregresszív megközelítést, de több periódusos és többfelbontású diszkriminátorokat is hozzáadtak a tisztább magas frekvenciák érdekében. Az architektúra tovább él az eszközön és a streaming TTS-ben, ahol a késleltetés és a modell mérete számít, és megkülönböztető ötletei továbbra is befolyásolják a neurális kodekeket és a zenegeneráló rendszereket, ahol az ellenséges képzés javítja az észlelési minőséget.

Valós megvalósítás

Szövegfelolvasó az eszközön a mobil asszisztensekben, ahol egy kicsi, gyors vocoder elkerüli a felhőalapú oda-vissza utakat

Valós idejű hangkonverziós csővezetékek, amelyek a beszélő mel-spektrogramját célhanggá alakítják

Játék- és animációs eszközök, amelyek karakterpárbeszédet szintetizálnak generált spektrogramokból alacsony késleltetéssel

Az audio GAN-ok kiindulópontjainak kutatása, ahol a MelGAN funkció-illesztési veszteségét újra felhasználják zene és hangeffektusok generálására

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MelGAN Generative Vocoder quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

DiffWave diffúziós Vocoder

Gyakran ismételt kérdések

What is MelGAN Generative Vocoder?

A MelGAN egy teljesen konvolúciós GAN-alapú vocoder, amely egyetlen gyors előrelépéssel nyers hanghullámformává alakítja a mel-spektrogramokat. Ez azért számított, mert bebizonyosodott, hogy a kiváló minőségű, nem autoregresszív beszédszintézis több százszor gyorsabban tud futni, mint a valós időben egy GPU-n.

Milyen bemenetet alakít át a MelGAN nyers hanghullámformává?

A MelGAN egy vokóder: egy akusztikus jellemző reprezentációt, a mel-spektrogramot vesz fel, és szintetizálja a megfelelő hullámformát.

Miért sokkal gyorsabb a MelGAN, mint a WaveNet?

A WaveNet egyenként, autoregresszíven generál mintákat; A MelGAN konvolúciós generátora a teljes hullámformát egyetlen párhuzamos előremenetben állítja elő.

Milyen megkülönböztető dizájnt vezetett be a MelGAN?

A MelGAN több azonos diszkriminátort használ, amelyek az eredeti hullámformát és a lemintázott változatokat vizsgálják, hogy különböző léptékű szerkezeteket rögzítsenek.

Melyik veszteség segít stabilizálni a MelGAN ellenséges edzését?

A jellemző-illesztési veszteség minimalizálja az L1 távolságot a megkülönböztető jellemzőtérképek között a valódi és a generált hanghoz, amely irányítja a generátort és stabilizálja a képzést.

Hogyan növeli a MelGAN generátor a befogadó mezőjét?

A dilatált konvolúciójú reziduális blokkok hatékonyan szélesítik a receptív mezőt, lehetővé téve a generátor számára, hogy hosszú távú időbeli struktúrát modellezzen.