Аудио РУКОВОДСТВО ПО ИИ

ВейвНет

WaveNet, представленная DeepMind в 2016 году, представляла собой революционную нейронную сеть, которая генерирует необработанный звук по одному образцу за раз, создавая поразительно естественную речь и музыку.

2 минуты чтенияПоследнее обновление

Обзор

It set the modern standard for high-fidelity text-to-speech.

Глубокое погружение

WaveNet — это авторегрессионная генеративная модель: она прогнозирует каждый аудиосэмпл с учетом всех предшествующих ему семплов, обычно со скоростью 16 000 или 24 000 сэмплов в секунду. Его основная инновация — набор расширенных причинно-следственных связей. Причинность означает, что модель смотрит только назад во времени, сохраняя порядок генерации; Расширение означает, что каждый слой пропускает экспоненциально растущее количество образцов, поэтому скромный стек покрывает тысячи образцов (широкое восприимчивое поле) без огромных затрат. Благодаря лингвистическим особенностям или мел-спектрограмме WaveNet производит речь гораздо более естественной, чем предшествующие ей конкатенативные и параметрические вокодеры, сокращая большую часть разрыва с человеческими записями и обеспечивая работу ранних версий Google Assistant.

Техническая информация

Ключевым трюком являются расширенные свертки: при коэффициентах расширения 1, 2, 4, 8 и т. д. сеть глубиной всего в десятки слоев может обрабатывать тысячи прошлых выборок, улавливая как мелкие детали формы сигнала, так и более длинные просодические структуры. Выходные данные моделируют значение каждой выборки как категориальное распределение (первоначально 256 уровней посредством компандирования по мю-закону), а блоки активации, а также остаточные и пропускные соединения стабилизируют обучение этого очень глубокого стека.

Стратегическое воздействие

Доступ и охват

Это улучшает доступность за счет транскрипции, повествования и голосовых интерфейсов.

Стоимость и бюджет

Медиа-команды могут выпускать качественное аудио быстрее с меньшими бюджетами.

Скорость и масштаб

Системы, работающие с клиентами, могут обрабатывать устные взаимодействия в большем масштабе.

Будущее WaveNet

Оригинальный WaveNet работал медленно, поскольку выборка была последовательной. Преемники это исправили: Parallel WaveNet и WaveRNN обеспечили синтез в реальном времени, а более поздние вокодеры на основе потока и GAN, такие как WaveGlow и HiFi-GAN, а также диффузионные вокодеры еще больше повысили качество и скорость. Идеи авторегрессии и расширенной свертки WaveNet живут в этих системах и повлияли на архитектуру далеко за пределами аудио, закрепляя свое наследие в генеративном моделировании.

Реальная реализация

Генерация естественно звучащих голосов для Google Assistant и Google Cloud Text-to-Speech

Действует как нейронный вокодер, который превращает мел-спектрограммы в сигналы в конвейерах TTS, таких как Tacotron 2.

Синтез реалистичной фортепианной и инструментальной музыки из необработанного звука.

Синтез голоса для инструментов доступности и повествования в аудиокнигах

Риски и ограничения

Риски неправильного использования голоса и выдачи себя за другое лицо возрастают при отсутствии согласия.

Точность может снижаться из-за акцентов, диалектов или шумной обстановки.

Синтетический звук можно принять за аутентичную речь без четкой маркировки.

Дорожная карта реализации

1

Получите явное согласие на захват, клонирование и повторное использование голоса.

2

Проверьте качество звука при использовании различных динамиков и фоновых условий.

3

Определите, когда человек должен проверять или утверждать результаты.

4

Маркируйте синтетический звук и сохраняйте записи о происхождении для обеспечения ответственности.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WaveNet quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Обнаружение дипфейков аудио

Часто задаваемые вопросы

What is WaveNet?

WaveNet, представленная DeepMind в 2016 году, представляла собой революционную нейронную сеть, которая генерирует необработанный звук по одному образцу за раз, создавая поразительно естественную речь и музыку. Он установил современный стандарт высококачественного преобразования текста в речь.

Как WaveNet генерирует звук?

WaveNet является авторегрессионным: он прогнозирует каждый аудиосэмпл на основе сэмплов, которые были до него.

Какова ключевая сверточная инновация в WaveNet?

Расширенные причинные свертки позволяют сети эффективно охватывать тысячи прошлых выборок, оглядываясь только назад во времени.

Почему расширение помогает WaveNet?

Экспоненциально увеличивающаяся скорость дилатации дает широкое восприимчивое поле для тысяч образцов с относительно небольшим количеством слоев.

В чем заключался главный практический недостаток оригинальной версии WaveNet?

Поскольку каждый образец зависит от предыдущих, генерация была последовательной и, следовательно, медленной, что мотивировало Parallel WaveNet и других последователей.

В конвейере преобразования текста в речь WaveNet часто служит чем?

WaveNet может взять мел-спектрограмму (например, от Tacotron 2) и создать окончательный сигнал с естественным звучанием.