Sieć WaveNet
WaveNet, wprowadzony przez DeepMind w 2016 roku, był przełomową siecią neuronową, która generuje surowy dźwięk, jedna próbka na raz, tworząc uderzająco naturalną mowę i muzykę.
Przegląd
It set the modern standard for high-fidelity text-to-speech.
Głębokie nurkowanie
WaveNet jest autoregresyjnym modelem generatywnym: przewiduje, że każda próbka audio jest kondycjonowana na podstawie wszystkich poprzedzających ją próbek, zazwyczaj przy 16 000 lub 24 000 próbek na sekundę. Jego podstawową innowacją jest stos rozszerzonych splotów przyczynowych. Przyczynowy oznacza, że model patrzy jedynie wstecz w czasie, zachowując porządek pokoleń; dylatacja oznacza, że każda warstwa pomija wykładniczo rosnącą liczbę próbek, więc skromny stos obejmuje tysiące próbek (szerokie pole recepcyjne) bez ogromnych kosztów. Opierając się na cechach językowych lub spektrogramie melowym, WaveNet wytwarza mowę znacznie bardziej naturalną niż poprzedzające go wokodery konkatenacyjne i parametryczne, zamykając znaczną część luki w nagraniach ludzkich i zasilając wczesne wersje Google Asystenta.
Wgląd techniczny
Kluczową sztuczką są rozszerzone sploty: przy współczynniku dylatacji wynoszącym 1, 2, 4, 8 itd. sieć o głębokości zaledwie kilkudziesięciu warstw może obsłużyć tysiące przeszłych próbek, przechwytując zarówno drobne szczegóły przebiegu, jak i dłuższą strukturę prozodyczną. Dane wyjściowe modelują wartość każdej próbki jako rozkład kategoryczny (pierwotnie 256 poziomów poprzez kompensację mu-law), a bramkowane jednostki aktywacyjne plus połączenia resztkowe i pomijane stabilizują szkolenie tego bardzo głębokiego stosu.
Wpływ strategiczny
Dostęp i zasięg
Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.
Koszt i budżet
Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.
Szybkość i skala
Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.
Przyszłość WaveNetu
Oryginalna sieć WaveNet działała wolno, ponieważ próbkowanie odbywało się sekwencyjnie. Następcy naprawili ten problem: Parallel WaveNet i WaveRNN umożliwiły syntezę w czasie rzeczywistym, a późniejsze wokodery oparte na przepływie i GAN, takie jak WaveGlow i HiFi-GAN, a także wokodery dyfuzyjne, podniosły jakość i prędkość dalej. Autoregresyjne idee WaveNet dotyczące splotu rozszerzonego są obecne w tych systemach i wywarły wpływ na architektury wykraczające daleko poza sprzęt audio, cementując jego dziedzictwo w zakresie modelowania generatywnego.
Implementacja w świecie rzeczywistym
Generowanie naturalnie brzmiących głosów dla Google Asystenta i Google zamiany tekstu na mowę w chmurze
Działa jako wokoder neuronowy, który przekształca spektrogramy mel w kształty fal w rurociągach TTS, takich jak Tacotron 2
Syntetyzowanie realistycznej muzyki fortepianowej i instrumentalnej z surowego dźwięku
Synteza głosu dla narzędzi ułatwień dostępu i narracji w audiobooku
Zagrożenia i poręcze
W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.
Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.
Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.
Plan wdrożenia
Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.
Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.
Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.
Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WaveNet quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Wykrywanie fałszywych dźwięków
Często zadawane pytania
What is WaveNet?
WaveNet, wprowadzony przez DeepMind w 2016 roku, był przełomową siecią neuronową, która generuje surowy dźwięk, jedna próbka na raz, tworząc uderzająco naturalną mowę i muzykę. Ustanowił nowoczesny standard wysokiej jakości zamiany tekstu na mowę.
W jaki sposób WaveNet generuje dźwięk?
WaveNet jest autoregresyjny: przewiduje każdą próbkę audio na podstawie próbek poprzedzających ją.
Jaka jest kluczowa innowacja splotowa w WaveNet?
Rozszerzone sploty przyczynowe umożliwiają sieci efektywne pokrycie tysięcy przeszłych próbek, patrząc jedynie wstecz w czasie.
Dlaczego dylatacja pomaga WaveNet?
Wykładniczo rosnące współczynniki dylatacji dają szerokie pole recepcyjne dla tysięcy próbek ze stosunkowo małą liczbą warstw.
Jaka była główna praktyczna wada oryginalnego WaveNet?
Ponieważ każda próbka zależy od poprzedniej, generowanie było sekwencyjne, a zatem powolne, co motywowało Parallel WaveNet i innych następców.
W potoku zamiany tekstu na mowę WaveNet często służy jako?
WaveNet może pobrać spektrogram mel (np. z Tacotron 2) i wygenerować końcowy, naturalnie brzmiący kształt fali.