Zvukový průvodce AI

Generativní vokodér MelGAN

MelGAN je plně konvoluční vokodér založený na GAN, který mění mel-spektrogramy na surové zvukové vlny v jediném rychlém průchodu vpřed.

2 minuty čteníNaposledy aktualizováno

Přehled

It mattered because it proved high-quality, non-autoregressive speech synthesis could run hundreds of times faster than real time on a GPU.

Hluboký ponor

MelGAN, představený Kumarem a kol. v roce 2019 generuje zvuk bez pomalé smyčky vzorek po vzorku, kterou používá WaveNet. Jeho generátor je hromada transponovaných konvolucí, které převzorkují mel-spektrogram (typicky 80 frekvenčních pásem) až na vzorkovací frekvenci zvuku, se zbytkovými bloky používajícími dilatované konvoluce k rozšíření přijímacího pole. Klíčovou inovací bylo trénování s více diskriminátory pracujícími v různých zvukových měřítcích (původní tvar vlny plus převzorkované verze), přičemž každý se díval na překrývající se okna. Ztráta odpovídající funkce porovnává aktivace diskriminátoru mezi skutečným a falešným zvukem a stabilizuje GAN trénink. Model je podle standardů neuronového zvuku malý a běží rychleji než v reálném čase i na CPU, takže je praktický pro vestavěný převod textu na řeč na zařízení.

Technický přehled

Víceúrovňový diskriminátor MelGAN využívá tři identické sítě sledující zvuk v plném, polovičním a čtvrtinovém rozlišení, přičemž každá zachycuje strukturu v různých frekvenčních rozsazích. Podstatné je, že MelGAN spoléhá na ztrátu přizpůsobení funkcí (vzdálenost L1 mezi mapami rozlišovacích znaků skutečného vs. generovaného zvuku) spíše než na explicitní ztrátu rekonstrukce spektrogramu, což povzbuzuje generátor, aby odpovídal statistikám skutečného zvuku vrstvu po vrstvě.

Strategický dopad

Přístup a dosah

Zlepšuje dostupnost prostřednictvím přepisu, vyprávění a hlasových rozhraní.

Cena a rozpočet

Mediální týmy mohou dodávat vylepšený zvuk rychleji s menšími rozpočty.

Rychlost a měřítko

Systémy orientované na zákazníky mohou zpracovávat mluvené interakce ve větším měřítku.

Budoucnost generativního vokodéru MelGAN

MelGAN nasadil rodinu vokodérů GAN. Jeho nástupci, HiFi-GAN a UnivNet, si ponechali rychlý neautoregresivní přístup, ale přidali víceperiodické a vícerozlišovací diskriminátory pro čistší vysoké frekvence. Architektura žije dál v zařízeních a streamovaných TTS, kde záleží na latenci a velikosti modelu, a její diskriminační nápady nadále ovlivňují neuronové kodeky a systémy generování hudby, kde trénink protivníka zlepšuje kvalitu vnímání.

Real-World Implementace

Převod textu na řeč na zařízení v mobilních asistentech, kde se malý rychlý vokodér vyhýbá okružním jízdám v cloudu

Konverzní kanály hlasu v reálném čase, které převádějí mel-spektrogram mluvčího na cílový hlas

Herní a animační nástroje, které syntetizují dialog postav z generovaných spektrogramů s nízkou latencí

Základní linie výzkumu pro audio GAN, kde je ztráta funkce MelGAN znovu použita pro generování hudby a zvukových efektů

Rizika a zábradlí

Pokud chybí souhlas, zvyšuje se riziko zneužití hlasu a předstírání jiné identity.

Přesnost může klesat v přízvuku, dialektech nebo hlučném prostředí.

Syntetický zvuk lze bez jasného označení zaměnit za autentickou řeč.

Plán implementace

1

Získejte výslovný souhlas se zachycením hlasu, klonováním a opětovným použitím.

2

Otestujte kvalitu napříč různými reproduktory a podmínkami pozadí.

3

Definujte, kdy musí člověk zkontrolovat nebo schválit výstupy.

4

Označte syntetický zvuk a veďte záznamy o původu pro zajištění odpovědnosti.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MelGAN Generative Vocoder quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Difuzní vokodér DiffWave

Často kladené otázky

What is MelGAN Generative Vocoder?

MelGAN je plně konvoluční vokodér založený na GAN, který mění mel-spektrogramy na surové zvukové vlny v jediném rychlém průchodu vpřed. Záleželo na tom, protože se ukázalo, že vysoce kvalitní, neautoregresivní syntéza řeči může běžet na GPU stokrát rychleji než v reálném čase.

Jaký vstup převádí MelGAN na nezpracovaný zvukový průběh?

MelGAN je vokodér: bere reprezentaci akustického prvku, mel-spektrogram, a syntetizuje odpovídající tvar vlny.

Proč je MelGAN mnohem rychlejší než WaveNet?

WaveNet generuje vzorky jeden po druhém autoregresivně; Konvoluční generátor MelGAN vytváří celý průběh v jediném paralelním dopředném průchodu.

Jaký výrazný design diskriminátoru představil MelGAN?

MelGAN používá více identických diskriminátorů, které zkoumají původní průběh a převzorkované verze k zachycení struktury v různých měřítcích.

Která ztráta pomáhá stabilizovat trénink protivníka MelGAN?

Ztráta přizpůsobení funkcí minimalizuje vzdálenost L1 mezi mapami vlastností diskriminátoru pro skutečný a generovaný zvuk, navádí generátor a stabilizuje trénink.

Jak zvyšuje generátor MelGAN své receptivní pole?

Zbytkové bloky s dilatovanými konvolucemi efektivně rozšiřují receptivní pole a umožňují generátoru modelovat dlouhodobou časovou strukturu.