WaveNet
WaveNet, представлений DeepMind у 2016 році, був революційною нейронною мережею, яка генерує необроблений аудіо один семпл за раз, створюючи вражаюче природну мову та музику.
Огляд
It set the modern standard for high-fidelity text-to-speech.
Глибоке занурення
WaveNet є авторегресійною генеративною моделлю: вона передбачає кожну аудіосимплу залежно від усіх попередніх семплів, як правило, зі швидкістю 16 000 або 24 000 семплів на секунду. Його основна інновація — це набір розширених причинно-наслідкових звивин. Причинний означає, що модель дивиться лише назад у часі, зберігаючи порядок генерації; розширення означає, що кожен шар пропускає експоненціально зростаючу кількість семплів, тому скромний стек охоплює тисячі семплів (широке сприйнятливе поле) без великих витрат. Залежно від лінгвістичних особливостей або мел-спектрограми, WaveNet виробляє мовлення набагато природніше, ніж конкатенаційні та параметричні вокодери, які йому передували, закриваючи значну частину прогалин у записах, записаних людиною, і забезпечуючи роботу ранніх версій Google Assistant.
Технічне розуміння
Розширені згортки є ключовим трюком: зі швидкістю розширення 1, 2, 4, 8 і т. д. мережа, яка має лише десятки шарів, може охопити тисячі минулих зразків, захоплюючи як дрібні деталі хвилі, так і більшу прозодичну структуру. Вихідні дані моделюють значення кожного зразка як категорійний розподіл (спочатку 256 рівнів за допомогою компандування по закону mu-law), а блоки стробованої активації плюс залишкові та пропускаючі з’єднання стабілізують навчання цього дуже глибокого стеку.
Стратегічний вплив
Доступ і охоплення
Це покращує доступність завдяки транскрипції, дикторському тексту та голосовому інтерфейсу.
Вартість і бюджет
Медіа-команди можуть доставляти якісний аудіо швидше за менші бюджети.
Швидкість і масштаб
Системи, орієнтовані на клієнта, можуть обробляти голосову взаємодію у більшому масштабі.
Майбутнє WaveNet
Оригінальний WaveNet був повільним, оскільки вибірка є послідовною. Наступники виправили це: Parallel WaveNet і WaveRNN увімкнули синтез у реальному часі, а пізніші вокодери на основі потоку та GAN, такі як WaveGlow і HiFi-GAN, а також дифузійні вокодери, підвищили якість і швидкість. Ідеї WaveNet про авторегресію та розширену згортку живуть у цих системах і вплинули на архітектуру далеко за межі аудіо, цементуючи її спадок у генеративному моделюванні.
Реалізація в реальному світі
Створення природного звучання голосів для Google Assistant і Google Cloud Text-to-Speech
Діючи як нейронний вокодер, який перетворює мел-спектрограми на хвилі в конвеєрах TTS, таких як Tacotron 2
Синтез реалістичної фортепіанної та інструментальної музики з необробленого аудіо
Синтез голосу для інструментів доступності та оповідання аудіокниг
Ризики та огорожі
Ризик неправильного використання голосу та видавання себе за іншу особу зростає, якщо згоди немає.
Точність може впасти через акценти, діалекти чи шумне середовище.
Синтетичне аудіо можна прийняти за автентичне мовлення без чіткого маркування.
Дорожня карта впровадження
Отримайте чітку згоду на захоплення голосу, клонування та повторне використання.
Перевірте якість на різних динаміках і фонових умовах.
Визначте, коли людина повинна переглядати або затверджувати результати.
Позначайте синтетичне аудіо та зберігайте записи про походження для підзвітності.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WaveNet quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Виявлення аудіо Deepfake
Часті запитання
What is WaveNet?
WaveNet, представлений DeepMind у 2016 році, був революційною нейронною мережею, яка генерує необроблений аудіо один семпл за раз, створюючи вражаюче природну мову та музику. Він встановив сучасний стандарт для високоякісного перетворення тексту в мовлення.
Як WaveNet генерує звук?
WaveNet є авторегресійним: він прогнозує кожну звукову вибірку на основі попередніх.
Що є ключовим згортковим нововведенням у WaveNet?
Розширені причинно-наслідкові згортки дозволяють мережі ефективно охоплювати тисячі минулих зразків, дивлячись лише назад у часі.
Чому розширення допомагає WaveNet?
Експоненціально зростаючі швидкості розширення дають широке сприйнятливе поле для тисяч зразків із відносно невеликою кількістю шарів.
Що було головним практичним недоліком оригінальної WaveNet?
Оскільки кожен зразок залежить від попередніх, генерація була послідовною і тому повільною, що мотивувало Parallel WaveNet та інших наступників.
У конвеєрі синтезу мовлення WaveNet часто служить як?
WaveNet може взяти мел-спектрограму (наприклад, з Tacotron 2) і створити кінцеву форму хвилі природного звучання.