Аудио РУКОВОДСТВО ПО ИИ

Параллельная генерация звука SoundStorm

SoundStorm — это Google модель генерации звука, которая воспроизводит речь и звук параллельно, а не по одному токену за раз, что значительно ускоряет синтез высококачественного звука.

2 минуты чтенияПоследнее обновление

Обзор

It matters because it cuts generation latency for long clips from minutes to seconds without sacrificing fidelity.

Глубокое погружение

SoundStorm, представленный Google в 2023 году, генерирует звук, представленный в виде дискретных акустических токенов, из нейронного кодека SoundStream. Более ранние модели, такие как AudioLM, создавали эти токены авторегрессионно, предсказывая каждый токен последовательно, что медленно для длинного аудио. Вместо этого SoundStorm использует неавторегрессионный подход на основе масок, заимствованный из моделей генерации изображений, таких как MaskGIT. Он начинается с преимущественно замаскированных токенов и итеративно заполняет их в течение нескольких шагов декодирования, одновременно прогнозируя множество токенов. Основываясь на семантических токенах (из таких моделей, как AudioLM или SPEAR-TTS), он может синтезировать 30 секунд естественного диалога примерно за полсекунды на TPU, что примерно в 100 раз быстрее, чем базовые показатели авторегрессии, сохраняя при этом их качество и согласованность динамиков.

Техническая информация

SoundStorm моделирует иерархию уровней остаточного векторного квантования (RVQ) из SoundStream. Во время обучения случайные токены маскируются, и модель учится их предсказывать. При выводе он запускает доверительное параллельное декодирование: на каждой итерации он прогнозирует все замаскированные токены, сохраняет наиболее достоверные и повторно маскирует остальные. Сначала он декодирует грубые уровни RVQ, а затем более тонкие, достигая полного звука за гораздо меньшее количество шагов, чем генерация токенов за токенами.

Стратегическое воздействие

Доступ и охват

Это улучшает доступность за счет транскрипции, повествования и голосовых интерфейсов.

Стоимость и бюджет

Медиа-команды могут выпускать качественное аудио быстрее с меньшими бюджетами.

Скорость и масштаб

Системы, работающие с клиентами, могут обрабатывать устные взаимодействия в большем масштабе.

Будущее параллельной генерации звука SoundStorm

Параллельное декодирование на основе маски становится стандартным инструментом для быстрого и управляемого звука. Ожидайте, что он будет способствовать созданию диалоговых агентов в реальном времени, мгновенному синтезу голоса и созданию длинных подкастов или аудиокниг, где задержка когда-то делала авторегрессионные модели непрактичными. Сочетание этого с более сильной семантической обусловливанием и водяными знаками повысит реалистичность диалога и его отслеживаемость. Та же самая идея итеративного уточнения, вероятно, сольется с подходами диффузии, стирая грань между токенами кодека и генераторами непрерывного звука.

Реальная реализация

Создание 30-секундных разговорных диалогов для голосовых помощников с искусственным интеллектом менее чем за секунду

Синтезирование многооборотных разговоров с согласованными голосами говорящих для создания прототипов

Преобразование текста в речь с малой задержкой в интерактивных агентах, где модели авторегрессии отстают

Быстрое создание подробного рассказанного аудио путем параллельного заполнения акустических жетонов.

Риски и ограничения

Риски неправильного использования голоса и выдачи себя за другое лицо возрастают при отсутствии согласия.

Точность может снижаться из-за акцентов, диалектов или шумной обстановки.

Синтетический звук можно принять за аутентичную речь без четкой маркировки.

Дорожная карта реализации

1

Получите явное согласие на захват, клонирование и повторное использование голоса.

2

Проверьте качество звука при использовании различных динамиков и фоновых условий.

3

Определите, когда человек должен проверять или утверждать результаты.

4

Маркируйте синтетический звук и сохраняйте записи о происхождении для обеспечения ответственности.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SoundStorm Parallel Audio Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Стабильная скрытая диффузия звука

Часто задаваемые вопросы

What is SoundStorm Parallel Audio Generation?

SoundStorm — это Google модель генерации звука, которая воспроизводит речь и звук параллельно, а не по одному токену за раз, что значительно ускоряет синтез высококачественного звука. Это важно, поскольку сокращает задержку генерации длинных клипов с минут до секунд, не жертвуя при этом точностью воспроизведения.

Какова ключевая инновация, которая делает SoundStorm быстрее, чем AudioLM?

SoundStorm заменяет медленную авторегрессию, генерацию токенов за токенами, неавторегрессионным параллельным декодированием, прогнозируя множество токенов одновременно.

Какой метод генерации изображений адаптирует SoundStorm?

SoundStorm заимствует основанную на доверии стратегию декодирования с маской и повторным заполнением, популяризированную MaskGIT в синтезе изображений.

Какое представление генерирует SoundStorm?

SoundStorm прогнозирует дискретные акустические токены, создаваемые кодеком SoundStream, которые позже декодируются в сигнал.

Сколько примерно времени требуется SoundStorm для генерации 30 секунд звука на TPU?

SoundStorm может синтезировать 30 секунд звука примерно за 0,5 секунды, что примерно в 100 раз быстрее, чем базовые показатели авторегрессии.

Как SoundStorm решает, какие прогнозируемые токены следует сохранить во время декодирования?

На каждой итерации он сохраняет прогнозы токенов с наивысшей достоверностью и повторно маскирует неопределенные для следующего прохода.