PRZEWODNIK AI audio

Wokodery neuronowe

Wokoder neuronowy to model, który przekształca zwartą reprezentację akustyczną, zwykle spektrogram melowy, w rzeczywisty kształt fali słyszalnej.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

To ostatni etap, który nadaje nowoczesnemu tekstowi na mowę i klonowaniu głosu ich naturalne, ludzkie brzmienie.

Głębokie nurkowanie

Tradycyjna synteza mowy wykorzystywała wokodery przetwarzające sygnał, które często brzmiały brzęcząco lub automatycznie. Wokodery neuronowe uczą się rekonstruować surowe próbki audio ze spektrogramu, trenując na wielu godzinach prawdziwych nagrań. Przełomem okazał się WaveNet (DeepMind, 2016), który przewidywał dźwięk jednej próbki na raz z szybkością ponad 16 000 próbek na sekundę, tworząc uderzająco naturalną mowę, ale bardzo powoli. Późniejsze modele zamieniły to autoregresyjne wąskie gardło na szybkość: WaveGlow wykorzystywał generację opartą na przepływie, Parallel WaveGAN i MelGAN wykorzystywały generatywne sieci kontradyktoryjne, a HiFi-GAN stał się popularnym standardem, generując dźwięk o wysokiej jakości 22 kHz znacznie szybciej niż w czasie rzeczywistym. Obecnie wokoder stanowi prawie zawsze drugą połowę dwustopniowego rurociągu, w połączeniu z modelem akustycznym, takim jak Tacotron 2 lub FastSpeech, który generuje spektrogram mel.

Wgląd techniczny

Spektrogram mel odrzuca informacje o fazie dźwięku, zachowując jedynie rozkład energii w pasmach częstotliwości w czasie. Ciężką pracą wokodera jest wynalezienie wiarygodnego, spójnego kształtu fali, którego widmo wielkości odpowiada wejściu. Wokodery oparte na GAN, takie jak HiFi-GAN, wykorzystują wiele dyskryminatorów, które sprawdzają sygnał w różnych skalach i okresach, zmuszając generator do wytworzenia realistycznych drobnych szczegółów, takich jak harmoniczne i ostre stany przejściowe spółgłosek.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość neuronowych wokoderów

Wokodery są coraz mniejsze i szybsze, dzięki czemu mogą działać na telefonach i urządzeniach wbudowanych bez połączenia z chmurą. Istnieje również tendencja w kierunku uniwersalnych wokoderów, które uogólniają na dowolny głośnik, język, śpiew, a nawet dźwięk inny niż mowa bez ponownego szkolenia. Równoległy trend łączy wokoder bezpośrednio z kompleksowymi systemami i kodekami neuronowymi, zacierając granicę między oddzielnymi etapami akustycznymi i falowymi oraz redukując artefakty wprowadzane przez przejście przez pośredni spektrogram.

Implementacja w świecie rzeczywistym

Generowanie końcowego dźwięku mówionego w asystentach zamiany tekstu na mowę, takich jak czytniki ekranu i aplikacje nawigacyjne

Tworzenie naturalnie brzmiących sklonowanych głosów w narzędziach do dubbingu i narracji w książkach audio

Rekonstrukcja głosów śpiewających w muzyce AI i oprogramowaniu wirtualnych wokalistów

Włączanie wyjścia głosowego na urządzeniu dla inteligentnych głośników i urządzeń ułatwiających dostęp bez konieczności przełączania serwera w obie strony

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Neural Vocoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Wokodery HiFi-GAN i GAN

Często zadawane pytania

Czym są wokodery neuronowe?

Wokoder neuronowy to model, który przekształca zwartą reprezentację akustyczną, zwykle spektrogram melowy, w rzeczywisty kształt fali słyszalnej. Jest to ostatni etap, który nadaje współczesnemu przetwarzaniu tekstu na mowę i głosowi naturalne, ludzkie brzmienie.

Jakie jest główne zadanie neuronowego wokodera?

Wokoder neuronowy wykorzystuje kompaktową funkcję akustyczną, zwykle spektrogram mel, i syntetyzuje rzeczywisty, surowy kształt fali audio, którą słyszysz.

Który model z 2016 roku był przełomem, dzięki któremu wokodery neuronowe brzmiały naturalnie?

WaveNet firmy DeepMind w 2016 r. generował próbkę dźwięku próbkę po próbce i zapewniał uderzająco naturalną mowę, rozpoczynając erę wokoderów neuronowych.

Dlaczego oryginalny WaveNet wolno generował dźwięk?

WaveNet jest autoregresyjny: każda próbka audio zależy od poprzedniej, więc generowanie dziesiątek tysięcy próbek na sekundę było kosztowne obliczeniowo.

Jakie informacje w szczególności odrzuca spektrogram mel, utrudniając zadanie wokodera?

Spektrogramy Mel zachowują wielkość (energię na pasmo częstotliwości), ale zmniejszają fazę, więc wokoder musi zrekonstruować spójny kształt fali, której faza jest wiarygodna.

W jaki sposób wokodery oparte na GAN, takie jak HiFi-GAN, poprawiają realizm?

HiFi-GAN wykorzystuje kilka dyskryminatorów sprawdzających różne skale czasowe i częstotliwości, wymuszając na generatorze wytwarzanie realistycznych harmonicznych i stanów nieustalonych.