PRZEWODNIK AI audio

Sieć WaveNet

WaveNet, wprowadzony przez DeepMind w 2016 roku, był przełomową siecią neuronową, która generuje surowy dźwięk, jedna próbka na raz, tworząc uderzająco naturalną mowę i muzykę.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It set the modern standard for high-fidelity text-to-speech.

Głębokie nurkowanie

WaveNet jest autoregresyjnym modelem generatywnym: przewiduje, że każda próbka audio jest kondycjonowana na podstawie wszystkich poprzedzających ją próbek, zazwyczaj przy 16 000 lub 24 000 próbek na sekundę. Jego podstawową innowacją jest stos rozszerzonych splotów przyczynowych. Przyczynowy oznacza, że ​​model patrzy jedynie wstecz w czasie, zachowując porządek pokoleń; dylatacja oznacza, że ​​każda warstwa pomija wykładniczo rosnącą liczbę próbek, więc skromny stos obejmuje tysiące próbek (szerokie pole recepcyjne) bez ogromnych kosztów. Opierając się na cechach językowych lub spektrogramie melowym, WaveNet wytwarza mowę znacznie bardziej naturalną niż poprzedzające go wokodery konkatenacyjne i parametryczne, zamykając znaczną część luki w nagraniach ludzkich i zasilając wczesne wersje Google Asystenta.

Wgląd techniczny

Kluczową sztuczką są rozszerzone sploty: przy współczynniku dylatacji wynoszącym 1, 2, 4, 8 itd. sieć o głębokości zaledwie kilkudziesięciu warstw może obsłużyć tysiące przeszłych próbek, przechwytując zarówno drobne szczegóły przebiegu, jak i dłuższą strukturę prozodyczną. Dane wyjściowe modelują wartość każdej próbki jako rozkład kategoryczny (pierwotnie 256 poziomów poprzez kompensację mu-law), a bramkowane jednostki aktywacyjne plus połączenia resztkowe i pomijane stabilizują szkolenie tego bardzo głębokiego stosu.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość WaveNetu

Oryginalna sieć WaveNet działała wolno, ponieważ próbkowanie odbywało się sekwencyjnie. Następcy naprawili ten problem: Parallel WaveNet i WaveRNN umożliwiły syntezę w czasie rzeczywistym, a późniejsze wokodery oparte na przepływie i GAN, takie jak WaveGlow i HiFi-GAN, a także wokodery dyfuzyjne, podniosły jakość i prędkość dalej. Autoregresyjne idee WaveNet dotyczące splotu rozszerzonego są obecne w tych systemach i wywarły wpływ na architektury wykraczające daleko poza sprzęt audio, cementując jego dziedzictwo w zakresie modelowania generatywnego.

Implementacja w świecie rzeczywistym

Generowanie naturalnie brzmiących głosów dla Google Asystenta i Google zamiany tekstu na mowę w chmurze

Działa jako wokoder neuronowy, który przekształca spektrogramy mel w kształty fal w rurociągach TTS, takich jak Tacotron 2

Syntetyzowanie realistycznej muzyki fortepianowej i instrumentalnej z surowego dźwięku

Synteza głosu dla narzędzi ułatwień dostępu i narracji w audiobooku

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WaveNet quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Wykrywanie fałszywych dźwięków

Często zadawane pytania

What is WaveNet?

WaveNet, wprowadzony przez DeepMind w 2016 roku, był przełomową siecią neuronową, która generuje surowy dźwięk, jedna próbka na raz, tworząc uderzająco naturalną mowę i muzykę. Ustanowił nowoczesny standard wysokiej jakości zamiany tekstu na mowę.

W jaki sposób WaveNet generuje dźwięk?

WaveNet jest autoregresyjny: przewiduje każdą próbkę audio na podstawie próbek poprzedzających ją.

Jaka jest kluczowa innowacja splotowa w WaveNet?

Rozszerzone sploty przyczynowe umożliwiają sieci efektywne pokrycie tysięcy przeszłych próbek, patrząc jedynie wstecz w czasie.

Dlaczego dylatacja pomaga WaveNet?

Wykładniczo rosnące współczynniki dylatacji dają szerokie pole recepcyjne dla tysięcy próbek ze stosunkowo małą liczbą warstw.

Jaka była główna praktyczna wada oryginalnego WaveNet?

Ponieważ każda próbka zależy od poprzedniej, generowanie było sekwencyjne, a zatem powolne, co motywowało Parallel WaveNet i innych następców.

W potoku zamiany tekstu na mowę WaveNet często służy jako?

WaveNet może pobrać spektrogram mel (np. z Tacotron 2) i wygenerować końcowy, naturalnie brzmiący kształt fali.