Аудио РУКОВОДСТВО ПО ИИ

Нейронный кодек SoundStream

SoundStream — это сквозной нейронный аудиокодек Google, который сжимает речь и музыку до чрезвычайно низкого битрейта, сохраняя при этом качество.

2 минуты чтенияПоследнее обновление

Обзор

Это важно, потому что он превосходит традиционные кодеки, такие как Opus, с той же скоростью передачи данных и поддерживает современные модели генеративного аудио.

Глубокое погружение

SoundStream, представленный Google в 2021 году, представляет собой полностью нейронный кодек, построенный из трех частей, обученных вместе: сверточного кодера, который превращает необработанный сигнал в компактную последовательность векторов, квантователя вектора невязки (RVQ), который дискретизирует эти векторы, и сверточного декодера, который восстанавливает форму сигнала. Он обучен как с потерями при реконструкции, так и с состязательным дискриминатором в стиле GAN, поэтому выходные данные звучат естественно, а не просто численно близко. Отличительной особенностью является «масштабируемое» обучение или обучение без квантования: одна модель может работать при битрейтах примерно от 3 до 18 кбит/с, просто используя больше или меньше слоев квантователя при выводе, без повторного обучения. Сообщается, что при скорости 3 кбит/с он превосходит Opus при скорости 12 кбит/с в тестах на прослушивание, обработку речи, музыки и общего звука в одной модели, которая может работать в реальном времени на процессоре смартфона.

Техническая информация

Форма сигнала проходит через пошаговые свертки, которые сильно понижают дискретизацию, создавая одно встраивание на кадр (например, 75 кадров в секунду). Затем RVQ кодирует каждое вложение как стек индексов кодовой книги. Битрейт равен частоте кадров, умноженной на количество активных квантователей, умноженную на количество битов в кодовой книге. Отключение квантователя случайным образом усекает стек RVQ во время обучения, заставляя более ранние кодовые книги переносить наиболее важную информацию, поэтому кодек плавно ухудшается с более низкими скоростями.

Стратегическое воздействие

Доступ и охват

Это улучшает доступность за счет транскрипции, повествования и голосовых интерфейсов.

Стоимость и бюджет

Медиа-команды могут выпускать качественное аудио быстрее с меньшими бюджетами.

Скорость и масштаб

Системы, работающие с клиентами, могут обрабатывать устные взаимодействия в большем масштабе.

Будущее нейронного кодека SoundStream

SoundStream создал шаблон, который позже усовершенствовали такие кодеки, как EnCodec и DAC, а его дискретные токены стали основой для генеративных систем, таких как AudioLM и MusicLM. Ожидайте, что потомки будут стремиться к еще более низким битрейтам, семантически структурированным токенам, которые одновременно служат входными данными для генераторов звука в стиле языковой модели, а также к более тесному развертыванию на устройствах для живых звонков, слуховых аппаратов и потоковой передачи, где полоса пропускания и задержка жестко ограничены.

Реальная реализация

Сжатие голосовых вызовов до ~3 кбит/с с более четким звуком, чем у устаревших кодеков, при более высоких битрейтах.

Генерация дискретных аудиотокенов, которые используются в генеративных моделях AudioLM и MusicLM Google.

Потоковое аудио в режиме реального времени с низкой пропускной способностью на мобильных устройствах с кодированием и декодированием на процессоре

Эффективное хранение или передача музыки и окружающего звука в одной модели, которая обрабатывает все типы контента.

Риски и ограничения

Риски неправильного использования голоса и выдачи себя за другое лицо возрастают при отсутствии согласия.

Точность может снижаться из-за акцентов, диалектов или шумной обстановки.

Синтетический звук можно принять за аутентичную речь без четкой маркировки.

Дорожная карта реализации

1

Получите явное согласие на захват, клонирование и повторное использование голоса.

2

Проверьте качество звука при использовании различных динамиков и фоновых условий.

3

Определите, когда человек должен проверять или утверждать результаты.

4

Маркируйте синтетический звук и сохраняйте записи о происхождении для обеспечения ответственности.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SoundStream Neural Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Нейронные аудиокодеки

Часто задаваемые вопросы

Что такое нейронный кодек SoundStream?

SoundStream — это сквозной нейронный аудиокодек Google, который сжимает речь и музыку до чрезвычайно низкого битрейта, сохраняя при этом качество. Это важно, потому что он превосходит традиционные кодеки, такие как Opus, с той же скоростью передачи данных и поддерживает современные модели генеративного аудио.

Какие три компонента составляют архитектуру SoundStream?

SoundStream состоит из сверточного кодера, квантователя остаточных векторов, который дискретизирует вложения, и сверточного декодера, все из которых обучены сквозным образом.

Какой метод позволяет одной модели SoundStream обслуживать множество разных битрейтов без переобучения?

Во время обучения SoundStream случайным образом отбрасывает слои квантователя, чтобы при выводе вы могли использовать больше или меньше уровней RVQ для достижения разных битрейтов из одной модели.

В тестах прослушивания Google было обнаружено, что SoundStream со скоростью 3 кбит/с превосходит какой кодек со скоростью 12 кбит/с?

SoundStream со скоростью всего 3 кбит/с соответствовал или превосходил широко используемый кодек Opus, работающий со скоростью 12 кбит/с, по субъективным оценкам качества.

Какой дополнительный обучающий сигнал использует SoundStream, чтобы сделать звук естественным?

Помимо потерь при реконструкции, SoundStream использует состязательные дискриминаторы (GAN), поэтому реконструкции кажутся реалистичными по восприятию, а не просто численно близкими.

Как битрейт SoundStream связан с его квантователями?

Битрейт масштабируется в зависимости от количества активных слоев RVQ (умножается на частоту кадров, умножается на количество битов на кодовую книгу), поэтому добавление квантователей повышает битрейт и качество.