Wokoder oparty na przepływie WaveGlow
WaveGlow to wokoder neuronowy firmy NVIDIA oparty na przepływie, który syntetyzuje przebiegi mowy ze spektrogramów mel w jednym przebiegu, bez autoregresji.
Przegląd
Ma to znaczenie, ponieważ dostarcza wysokiej jakości dźwięk szybciej niż w czasie rzeczywistym, przy użyciu jedynie prostej utraty prawdopodobieństwa.
Głębokie nurkowanie
WaveGlow, wydany przez Prenger, Valle i Catanzaro w firmie NVIDIA w 2018 roku, łączy pomysły Glow i WaveNet, aby zbudować wokoder, który jest zarówno szybki, jak i łatwy w szkoleniu. W odróżnieniu od wokoderów GAN jest to przepływ normalizujący: uczy się odwracalnego mapowania pomiędzy prostym rozkładem Gaussa a przebiegiem audio, uwarunkowanym spektrogramem mel. Trening maksymalizuje dokładną logarytmiczną wiarygodność danych, zatem nie wymaga oddzielnego dyskryminatora, autoregresji ani destylacji w dwóch sieciach nauczyciel-uczeń, czego wymagały wcześniejsze równoległe podejścia WaveNet. Aby wygenerować dźwięk, próbkuj szum Gaussa i uruchamiaj sieć odwracalną w odwrotnej kolejności. WaveGlow generuje mowę o jakości porównywalnej z WaveNet, syntetyzując znacznie szybciej niż w czasie rzeczywistym na nowoczesnym procesorze graficznym.
Wgląd techniczny
WaveGlow łączy odwracalne etapy przepływu, z których każdy łączy afiniczną warstwę sprzęgającą z odwracalnym splotem 1x1 zapożyczonym z Glow. Próbki audio są grupowane w wektory za pomocą operacji ściskania, dzięki czemu warstwy sprzęgające mogą je skutecznie przekształcać. Ponieważ każdy krok jest odwracalny, kierunek do przodu oblicza prawdopodobieństwo uczenia, a kierunek odwrotny odwzorowuje szum na dźwięk w celu wnioskowania. Pojedyncza sieć i jeden cel w postaci ujemnego logarytmu wiarygodności sprawiają, że szkolenie jest szczególnie stabilne i proste.
Wpływ strategiczny
Dostęp i zasięg
Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.
Koszt i budżet
Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.
Szybkość i skala
Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.
Przyszłość wokodera opartego na przepływie WaveGlow
WaveGlow pokazał, że wokodery czystego przepływu mogą konkurować z jakością autoregresyjną, wpływając na późniejsze modele przepływu i dopasowywania przepływu. Jego prostota z pojedynczą stratą pozostaje atrakcyjna, chociaż wokodery GAN, takie jak HiFi-GAN, obecnie często wygrywają pod względem rozmiaru i szybkości. Patrząc w przyszłość, pomysły oparte na przepływie i dopasowywaniu przepływu powracają do nowoczesnych TTS przylegających do dyfuzji, a odwracalne konstrukcje w stylu WaveGlow w dalszym ciągu stanowią podstawę badań nad dokładnym prawdopodobieństwem, kontrolowanym i wydajnym generowaniem przebiegów.
Implementacja w świecie rzeczywistym
Połączenie z Tacotronem 2 w referencyjnym potoku TTS firmy NVIDIA w celu uzyskania naturalnej mowy o studyjnej jakości
Szybka synteza mowy GPU na potrzeby narracji, dubbingu i tworzenia treści
Generowanie dźwięku szkoleniowego i demonstracyjnego w badaniach, w których preferowane jest stabilne szkolenie z pojedynczą stratą
Głos w czasie rzeczywistym w systemach interaktywnych działających na sprzęcie NVIDIA
Zagrożenia i poręcze
W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.
Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.
Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.
Plan wdrożenia
Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.
Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.
Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.
Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WaveGlow Flow-Based Vocoder quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Generowanie mowy dopasowane do przepływu głosowego
Często zadawane pytania
Czym jest wokoder WaveGlow oparty na przepływie?
WaveGlow to wokoder neuronowy firmy NVIDIA oparty na przepływie, który syntetyzuje przebiegi mowy ze spektrogramów mel w jednym przebiegu, bez autoregresji. Ma to znaczenie, ponieważ zapewnia wysokiej jakości dźwięk szybciej niż w czasie rzeczywistym, wykorzystując jedynie prostą utratę prawdopodobieństwa.
WaveGlow łączy pomysły architektoniczne, z których dwóch modeli?
WaveGlow łączy odwracalną strukturę przepływu Glow z projektem modelowania dźwięku WaveNet.
Jakim modelem jest WaveGlow?
WaveGlow to przepływ normalizujący, który uczy się odwracalnego mapowania pomiędzy szumem Gaussa i dźwiękiem.
W jaki sposób WaveGlow generuje przebieg w momencie wnioskowania?
Ponieważ sieć jest odwracalna, rysujesz szum Gaussa i kierujesz przepływ do tyłu, uwarunkowany spektrogramem mel.
Jaki cel optymalizuje WaveGlow podczas treningu?
Jako przepływ, WaveGlow maksymalizuje dokładną logarytm wiarygodności, nie wymagając żadnego rozróżniacza ani destylacji.
Które dwa elementy składają się na każdy odwracalny krok w WaveGlow?
Każdy etap przepływu łączy afiniczną warstwę sprzęgającą z odwracalnym splotem 1x1 przejętym z Glow.