PRZEWODNIK AI audio

Wokoder oparty na przepływie WaveGlow

WaveGlow to wokoder neuronowy firmy NVIDIA oparty na przepływie, który syntetyzuje przebiegi mowy ze spektrogramów mel w jednym przebiegu, bez autoregresji.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Ma to znaczenie, ponieważ dostarcza wysokiej jakości dźwięk szybciej niż w czasie rzeczywistym, przy użyciu jedynie prostej utraty prawdopodobieństwa.

Głębokie nurkowanie

WaveGlow, wydany przez Prenger, Valle i Catanzaro w firmie NVIDIA w 2018 roku, łączy pomysły Glow i WaveNet, aby zbudować wokoder, który jest zarówno szybki, jak i łatwy w szkoleniu. W odróżnieniu od wokoderów GAN jest to przepływ normalizujący: uczy się odwracalnego mapowania pomiędzy prostym rozkładem Gaussa a przebiegiem audio, uwarunkowanym spektrogramem mel. Trening maksymalizuje dokładną logarytmiczną wiarygodność danych, zatem nie wymaga oddzielnego dyskryminatora, autoregresji ani destylacji w dwóch sieciach nauczyciel-uczeń, czego wymagały wcześniejsze równoległe podejścia WaveNet. Aby wygenerować dźwięk, próbkuj szum Gaussa i uruchamiaj sieć odwracalną w odwrotnej kolejności. WaveGlow generuje mowę o jakości porównywalnej z WaveNet, syntetyzując znacznie szybciej niż w czasie rzeczywistym na nowoczesnym procesorze graficznym.

Wgląd techniczny

WaveGlow łączy odwracalne etapy przepływu, z których każdy łączy afiniczną warstwę sprzęgającą z odwracalnym splotem 1x1 zapożyczonym z Glow. Próbki audio są grupowane w wektory za pomocą operacji ściskania, dzięki czemu warstwy sprzęgające mogą je skutecznie przekształcać. Ponieważ każdy krok jest odwracalny, kierunek do przodu oblicza prawdopodobieństwo uczenia, a kierunek odwrotny odwzorowuje szum na dźwięk w celu wnioskowania. Pojedyncza sieć i jeden cel w postaci ujemnego logarytmu wiarygodności sprawiają, że szkolenie jest szczególnie stabilne i proste.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość wokodera opartego na przepływie WaveGlow

WaveGlow pokazał, że wokodery czystego przepływu mogą konkurować z jakością autoregresyjną, wpływając na późniejsze modele przepływu i dopasowywania przepływu. Jego prostota z pojedynczą stratą pozostaje atrakcyjna, chociaż wokodery GAN, takie jak HiFi-GAN, obecnie często wygrywają pod względem rozmiaru i szybkości. Patrząc w przyszłość, pomysły oparte na przepływie i dopasowywaniu przepływu powracają do nowoczesnych TTS przylegających do dyfuzji, a odwracalne konstrukcje w stylu WaveGlow w dalszym ciągu stanowią podstawę badań nad dokładnym prawdopodobieństwem, kontrolowanym i wydajnym generowaniem przebiegów.

Implementacja w świecie rzeczywistym

Połączenie z Tacotronem 2 w referencyjnym potoku TTS firmy NVIDIA w celu uzyskania naturalnej mowy o studyjnej jakości

Szybka synteza mowy GPU na potrzeby narracji, dubbingu i tworzenia treści

Generowanie dźwięku szkoleniowego i demonstracyjnego w badaniach, w których preferowane jest stabilne szkolenie z pojedynczą stratą

Głos w czasie rzeczywistym w systemach interaktywnych działających na sprzęcie NVIDIA

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WaveGlow Flow-Based Vocoder quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Generowanie mowy dopasowane do przepływu głosowego

Często zadawane pytania

Czym jest wokoder WaveGlow oparty na przepływie?

WaveGlow to wokoder neuronowy firmy NVIDIA oparty na przepływie, który syntetyzuje przebiegi mowy ze spektrogramów mel w jednym przebiegu, bez autoregresji. Ma to znaczenie, ponieważ zapewnia wysokiej jakości dźwięk szybciej niż w czasie rzeczywistym, wykorzystując jedynie prostą utratę prawdopodobieństwa.

WaveGlow łączy pomysły architektoniczne, z których dwóch modeli?

WaveGlow łączy odwracalną strukturę przepływu Glow z projektem modelowania dźwięku WaveNet.

Jakim modelem jest WaveGlow?

WaveGlow to przepływ normalizujący, który uczy się odwracalnego mapowania pomiędzy szumem Gaussa i dźwiękiem.

W jaki sposób WaveGlow generuje przebieg w momencie wnioskowania?

Ponieważ sieć jest odwracalna, rysujesz szum Gaussa i kierujesz przepływ do tyłu, uwarunkowany spektrogramem mel.

Jaki cel optymalizuje WaveGlow podczas treningu?

Jako przepływ, WaveGlow maksymalizuje dokładną logarytm wiarygodności, nie wymagając żadnego rozróżniacza ani destylacji.

Które dwa elementy składają się na każdy odwracalny krok w WaveGlow?

Każdy etap przepływu łączy afiniczną warstwę sprzęgającą z odwracalnym splotem 1x1 przejętym z Glow.