PRZEWODNIK AI audio

Wokodery HiFi-GAN i GAN

HiFi-GAN to wokoder generatywno-kontradykcyjny, który niemal natychmiast przekształca spektrogram mel w surową falę audio, tworząc mowę o studyjnej jakości znacznie szybciej niż w czasie rzeczywistym.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Stało się to standardowym końcowym etapem nowoczesnego syntezu mowy na mowę, ponieważ jest szybkie, lekkie i trudne do odróżnienia od prawdziwych nagrań.

Głębokie nurkowanie

Wokoder to ostatni krok w większości potoków TTS: model taki jak Tacotron lub FastSpeech przewiduje spektrogram mel (kompaktowy obraz częstotliwości w czasie), a wokoder wypełnia rzeczywiste próbki kształtu fali. Wczesne wokodery neuronowe, takie jak WaveNet, brzmiały świetnie, ale generowały dźwięk próbka po próbce, przez co były boleśnie powolne. HiFi-GAN, wydany przez Konga, Kima i Bae w 2020 roku, zastąpił tę pętlę autoregresyjną pojedynczym generatorem sprzężenia zwrotnego wytrenowanym kontradyktoryjnie. Kluczową sztuczką jest użycie wielu dyskryminatorów, które oceniają dźwięk w różnych skalach i na podstawie różnych wzorców okresowych, zmuszając generator do uzyskania właściwej tekstury i częstotliwości tonu. Rezultatem jest mowa 22 kHz, syntetyzowana setki razy szybciej niż w czasie rzeczywistym na procesorze graficznym, z jakością porównywalną z prawdziwym dźwiękiem.

Wgląd techniczny

Generator HiFi-GAN podwyższa próbkę spektrogramu mel poprzez transponowane sploty, z ułożonymi w stos blokami pola wieloreceptywnego, które łączą różne rozmiary jądra i dylatacje, aby uchwycić różne wzory fal. Kontrolą zajmują się dwie rodziny dyskryminatorów: dyskryminator wielookresowy przekształca sygnał 1D w siatki 2D o wartościach pierwszych, takich jak 2, 3, 5, 7, 11, aby wychwycić okresowość wysokości tonu, a dyskryminator wieloskalowy bada kształt fali w kilku zmniejszonych rozdzielczościach. Spektrogram Mel i straty w dopasowaniu cech zapewniają stabilność treningu.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość wokoderów HiFi-GAN i GAN

Wokodery GAN stają się coraz mniejsze i szybsze: potomkowie, tacy jak BigVGAN, dodają aktywacje wygładzające, aby uogólnić niewidzianych wokalistów, instrumenty i języki, podczas gdy UnivNet i Vocos dążą do uniwersalnej syntezy wszystkich pasm. Wersje do przesyłania strumieniowego i na urządzenia obsługują teraz wokodowanie w telefonach i słuchawkach, co zapewnia asystentom niskie opóźnienia. Coraz częściej modele audio z funkcją dyfuzji i dopasowywania przepływu są przekształcane w jednoprzebiegowe generatory typu GAN, łącząc wierność dyfuzji z szybkością GAN. Można się spodziewać, że wokodery staną się uniwersalnymi neuronowymi kodekami audio obsługującymi zarówno mowę, jak i muzykę.

Implementacja w świecie rzeczywistym

Generowanie komunikatów głosowych wirtualnych asystentów i aplikacji nawigacyjnych, które wymagają odpowiedzi bez słyszalnego opóźnienia.

Zasilanie narzędzi do klonowania i kopiowania głosu w czasie rzeczywistym, gdzie sklonowany spektrogram mel jest renderowany w naturalnie brzmiący dźwięk.

Prowadzenie platform z narracją audiobooków i podcastów, które szybko i tanio syntetyzują godziny przemówień.

Służy jako scena przebiegu w syntezatorach głosu śpiewającego i demach muzycznych za pośrednictwem uniwersalnych wokoderów w stylu BigVGAN.

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the HiFi-GAN and GAN Vocoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Równoległy wokoder WaveGAN

Często zadawane pytania

Czym są wokodery HiFi-GAN i GAN?

HiFi-GAN to wokoder generatywno-kontradykcyjny, który niemal natychmiast przekształca spektrogram mel w surową falę audio, tworząc mowę o studyjnej jakości znacznie szybciej niż w czasie rzeczywistym. Stał się standardowym końcowym etapem współczesnego przetwarzania tekstu na mowę, ponieważ jest szybki, lekki i trudny do odróżnienia od prawdziwych nagrań.

Jakie jest główne zadanie wokodera takiego jak HiFi-GAN w potoku zamiany tekstu na mowę?

Wokoder to ostatni etap syntezy rzeczywistych próbek kształtu fali ze spektrogramu mel utworzonego przez model akustyczny.

Dlaczego HiFi-GAN jest znacznie szybszy niż wcześniejszy wokoder WaveNet?

WaveNet generował dźwięk próbka po próbce (autoregresywnie), podczas gdy generator sprzężenia zwrotnego HiFi-GAN generuje przebieg w jednym cyklu, osiągając prędkość znacznie większą niż w czasie rzeczywistym.

Co konkretnie dyskryminator wielookresowy HiFi-GAN pomaga w wychwytywaniu?

Dyskryminator wielookresowy przekształca przebieg 1D w 2D przy użyciu okresów liczb pierwszych w celu wykrycia struktury okresowej powiązanej z wysokością dźwięku.

Wokodery GAN są szkolone „przeciwstawnie”. Co to oznacza tutaj?

W konfiguracji GAN generator uczy się wytwarzać kształty fal na tyle realistyczne, aby oszukać sieci dyskryminacyjne przeszkolone do odróżniania dźwięku rzeczywistego od syntetycznego.

Który późniejszy wokoder rozszerza HiFi-GAN, aby lepiej uogólnić niewidoczne głosy, śpiew i instrumenty?

BigVGAN skaluje HiFi-GAN i dodaje okresowe aktywacje antyaliasingowe, poprawiając uogólnienie dźwięku spoza dystrybucji, takiego jak śpiew i instrumenty.