PRZEWODNIK AI audio

Wokoder generatywny MelGAN

MelGAN to wokoder w pełni splotowy oparty na GAN, który zamienia spektrogramy mel w surowe przebiegi audio w jednym szybkim przebiegu do przodu.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It mattered because it proved high-quality, non-autoregressive speech synthesis could run hundreds of times faster than real time on a GPU.

Głębokie nurkowanie

MelGAN, wprowadzony przez Kumara i in. w 2019 r. generuje dźwięk bez powolnej pętli próbka po próbce używanej przez WaveNet. Jego generator to stos transponowanych splotów, które zwiększają próbkowanie spektrogramu mel (zwykle 80 pasm częstotliwości) do częstotliwości próbkowania audio, z blokami resztkowymi wykorzystującymi rozszerzone sploty w celu poszerzenia pola recepcyjnego. Kluczową innowacją było szkolenie z wieloma dyskryminatorami działającymi w różnych skalach audio (oryginalny przebieg plus wersje zmniejszone), każdy patrząc na nakładające się okna. Utrata dopasowania funkcji porównuje aktywacje dyskryminatora między prawdziwym i fałszywym dźwiękiem, stabilizując szkolenie GAN. Model jest niewielki jak na standardy neuronowego dźwięku i działa szybciej niż w czasie rzeczywistym nawet na procesorze, co czyni go praktycznym w przypadku zamiany tekstu na mowę osadzonej i na urządzeniu.

Wgląd techniczny

Wieloskalowy dyskryminator MelGAN wykorzystuje trzy identyczne sieci analizujące dźwięk w pełnej, połówkowej i czwartej rozdzielczości, przy czym każda przechwytuje strukturę w różnych zakresach częstotliwości. Co najważniejsze, MelGAN opiera się na utracie dopasowania cech (odległość L1 pomiędzy mapami cech dyskryminatora dźwięku rzeczywistego i wygenerowanego), a nie na wyraźnych stratach rekonstrukcji spektrogramu, co zachęca generator do dopasowywania statystyk rzeczywistego dźwięku warstwa po warstwie.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość wokodera generatywnego MelGAN

MelGAN zapoczątkował rodzinę wokoderów GAN. Jego następcy, HiFi-GAN i UnivNet, zachowali szybkie podejście nieautoregresyjne, ale dodali dyskryminatory wielookresowe i o wielu rozdzielczościach, aby zapewnić czystsze wysokie częstotliwości. Architektura ta jest nadal obecna w TTS na urządzeniu i w transmisji strumieniowej, gdzie liczą się opóźnienia i rozmiar modelu, a koncepcje związane z dyskryminacją w dalszym ciągu wpływają na kodeki neuronowe i systemy generowania muzyki, w których trening kontradyktoryjny poprawia jakość percepcji.

Implementacja w świecie rzeczywistym

Zamiana tekstu na mowę na urządzeniu w asystentach mobilnych, gdzie mały, szybki wokoder pozwala uniknąć podróży w obie strony w chmurze

Potoki konwersji głosu w czasie rzeczywistym, które przekształcają spektrogram mel mówcy w głos docelowy

Narzędzia do gier i animacji, które syntetyzują dialogi postaci z wygenerowanych spektrogramów z niskim opóźnieniem

Badania bazowe dla audio GAN, w których utrata dopasowania funkcji MelGAN jest ponownie wykorzystywana do generowania muzyki i efektów dźwiękowych

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MelGAN Generative Vocoder quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Wokoder dyfuzyjny DiffWave

Często zadawane pytania

What is MelGAN Generative Vocoder?

MelGAN to wokoder w pełni splotowy oparty na GAN, który zamienia spektrogramy mel w surowe przebiegi audio w jednym szybkim przebiegu do przodu. Miało to znaczenie, ponieważ udowodniło, że wysokiej jakości, nieautoregresywna synteza mowy może działać setki razy szybciej niż w czasie rzeczywistym na procesorze graficznym.

Jakie dane wejściowe MelGAN konwertuje na surowy przebieg audio?

MelGAN jest wokoderem: pobiera reprezentację cech akustycznych, spektrogram mel, i syntetyzuje odpowiedni kształt fali.

Dlaczego MelGAN jest znacznie szybszy pod względem wnioskowania niż WaveNet?

WaveNet generuje próbki pojedynczo w sposób autoregresyjny; Generator splotowy MelGAN wytwarza cały przebieg w jednym równoległym przebiegu do przodu.

Jaki charakterystyczny projekt dyskryminatora wprowadził MelGAN?

MelGAN wykorzystuje wiele identycznych dyskryminatorów, które badają oryginalny przebieg i wersje zmniejszone w celu uchwycenia struktury w różnych skalach.

Która strata pomaga ustabilizować trening kontradyktoryjny MelGAN?

Utrata dopasowania funkcji minimalizuje odległość L1 pomiędzy mapami cech dyskryminatora dla rzeczywistego i wygenerowanego dźwięku, kierując generatorem i stabilizując trening.

W jaki sposób generator MelGAN zwiększa swoje pole recepcyjne?

Bloki resztkowe z rozszerzonymi zwojami skutecznie poszerzają pole recepcyjne, umożliwiając generatorowi modelowanie struktury czasowej dalekiego zasięgu.