Wokoder generatywny MelGAN
MelGAN to wokoder w pełni splotowy oparty na GAN, który zamienia spektrogramy mel w surowe przebiegi audio w jednym szybkim przebiegu do przodu.
Przegląd
It mattered because it proved high-quality, non-autoregressive speech synthesis could run hundreds of times faster than real time on a GPU.
Głębokie nurkowanie
MelGAN, wprowadzony przez Kumara i in. w 2019 r. generuje dźwięk bez powolnej pętli próbka po próbce używanej przez WaveNet. Jego generator to stos transponowanych splotów, które zwiększają próbkowanie spektrogramu mel (zwykle 80 pasm częstotliwości) do częstotliwości próbkowania audio, z blokami resztkowymi wykorzystującymi rozszerzone sploty w celu poszerzenia pola recepcyjnego. Kluczową innowacją było szkolenie z wieloma dyskryminatorami działającymi w różnych skalach audio (oryginalny przebieg plus wersje zmniejszone), każdy patrząc na nakładające się okna. Utrata dopasowania funkcji porównuje aktywacje dyskryminatora między prawdziwym i fałszywym dźwiękiem, stabilizując szkolenie GAN. Model jest niewielki jak na standardy neuronowego dźwięku i działa szybciej niż w czasie rzeczywistym nawet na procesorze, co czyni go praktycznym w przypadku zamiany tekstu na mowę osadzonej i na urządzeniu.
Wgląd techniczny
Wieloskalowy dyskryminator MelGAN wykorzystuje trzy identyczne sieci analizujące dźwięk w pełnej, połówkowej i czwartej rozdzielczości, przy czym każda przechwytuje strukturę w różnych zakresach częstotliwości. Co najważniejsze, MelGAN opiera się na utracie dopasowania cech (odległość L1 pomiędzy mapami cech dyskryminatora dźwięku rzeczywistego i wygenerowanego), a nie na wyraźnych stratach rekonstrukcji spektrogramu, co zachęca generator do dopasowywania statystyk rzeczywistego dźwięku warstwa po warstwie.
Wpływ strategiczny
Dostęp i zasięg
Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.
Koszt i budżet
Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.
Szybkość i skala
Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.
Przyszłość wokodera generatywnego MelGAN
MelGAN zapoczątkował rodzinę wokoderów GAN. Jego następcy, HiFi-GAN i UnivNet, zachowali szybkie podejście nieautoregresyjne, ale dodali dyskryminatory wielookresowe i o wielu rozdzielczościach, aby zapewnić czystsze wysokie częstotliwości. Architektura ta jest nadal obecna w TTS na urządzeniu i w transmisji strumieniowej, gdzie liczą się opóźnienia i rozmiar modelu, a koncepcje związane z dyskryminacją w dalszym ciągu wpływają na kodeki neuronowe i systemy generowania muzyki, w których trening kontradyktoryjny poprawia jakość percepcji.
Implementacja w świecie rzeczywistym
Zamiana tekstu na mowę na urządzeniu w asystentach mobilnych, gdzie mały, szybki wokoder pozwala uniknąć podróży w obie strony w chmurze
Potoki konwersji głosu w czasie rzeczywistym, które przekształcają spektrogram mel mówcy w głos docelowy
Narzędzia do gier i animacji, które syntetyzują dialogi postaci z wygenerowanych spektrogramów z niskim opóźnieniem
Badania bazowe dla audio GAN, w których utrata dopasowania funkcji MelGAN jest ponownie wykorzystywana do generowania muzyki i efektów dźwiękowych
Zagrożenia i poręcze
W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.
Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.
Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.
Plan wdrożenia
Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.
Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.
Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.
Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the MelGAN Generative Vocoder quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Wokoder dyfuzyjny DiffWave
Często zadawane pytania
What is MelGAN Generative Vocoder?
MelGAN to wokoder w pełni splotowy oparty na GAN, który zamienia spektrogramy mel w surowe przebiegi audio w jednym szybkim przebiegu do przodu. Miało to znaczenie, ponieważ udowodniło, że wysokiej jakości, nieautoregresywna synteza mowy może działać setki razy szybciej niż w czasie rzeczywistym na procesorze graficznym.
Jakie dane wejściowe MelGAN konwertuje na surowy przebieg audio?
MelGAN jest wokoderem: pobiera reprezentację cech akustycznych, spektrogram mel, i syntetyzuje odpowiedni kształt fali.
Dlaczego MelGAN jest znacznie szybszy pod względem wnioskowania niż WaveNet?
WaveNet generuje próbki pojedynczo w sposób autoregresyjny; Generator splotowy MelGAN wytwarza cały przebieg w jednym równoległym przebiegu do przodu.
Jaki charakterystyczny projekt dyskryminatora wprowadził MelGAN?
MelGAN wykorzystuje wiele identycznych dyskryminatorów, które badają oryginalny przebieg i wersje zmniejszone w celu uchwycenia struktury w różnych skalach.
Która strata pomaga ustabilizować trening kontradyktoryjny MelGAN?
Utrata dopasowania funkcji minimalizuje odległość L1 pomiędzy mapami cech dyskryminatora dla rzeczywistego i wygenerowanego dźwięku, kierując generatorem i stabilizując trening.
W jaki sposób generator MelGAN zwiększa swoje pole recepcyjne?
Bloki resztkowe z rozszerzonymi zwojami skutecznie poszerzają pole recepcyjne, umożliwiając generatorowi modelowanie struktury czasowej dalekiego zasięgu.