Сжатие звука EnCodec
EnCodec — это высококачественный нейронный аудиокодек Meta, который сжимает речь и музыку с очень низким битрейтом, обеспечивая качество, конкурирующее с гораздо более тяжелыми форматами.
Обзор
It matters because it underpins modern generative audio systems and ships in open-source form for anyone to use.
Глубокое погружение
Выпущенный Meta AI в 2022 году, EnCodec следует схеме SoundStream, состоящей из кодера, квантователя остаточного вектора (RVQ) и сквозного обученного декодера, но с добавлением нескольких усовершенствований. Он использует сверточный кодер с поддержкой потоковой передачи, многомасштабную спектрограмму и потери при реконструкции во временной области, а также состязательные дискриминаторы для качества восприятия. Заметным вкладом является небольшая энтропийная модель на основе Transformer, которая дополнительно сжимает квантованные коды без потерь, выжимая дополнительные биты без потери качества. EnCodec также представляет балансировщик, который автоматически масштабирует многие конкурирующие потери при обучении, чтобы они оставались стабильными. Он обрабатывает монофонический звук 24 кГц и стереозвук 48 кГц, работает с такими битрейтами, как 1,5, 3, 6 и 12 кбит/с, а при 6 кбит/с достигает качества, сравнимого с MP3 при 64 кбит/с. Его токены поддерживают MusicGen и AudioGen Meta.
Техническая информация
Кодер EnCodec преобразует сигнал с помощью пошаговой свертки в скрытую последовательность, которую RVQ преобразует в составные индексы кодовой книги. Облегченная языковая модель Transformer предсказывает вероятности появления этих токенов и выполняет их арифметическое кодирование, бесплатно восстанавливая дальнейшее сжатие. Балансировщик обучения изменяет масштаб вкладов градиента от реконструкции, спектральных и состязательных потерь, поэтому ни один член не доминирует, что обеспечивает стабильность многоцелевого обучения во всем диапазоне битрейта.
Стратегическое воздействие
Доступ и охват
Это улучшает доступность за счет транскрипции, повествования и голосовых интерфейсов.
Стоимость и бюджет
Медиа-команды могут выпускать качественное аудио быстрее с меньшими бюджетами.
Скорость и масштаб
Системы, работающие с клиентами, могут обрабатывать устные взаимодействия в большем масштабе.
Будущее сжатия звука EnCodec
EnCodec уже является токенизатором по умолчанию для нескольких открытых моделей генеративного аудио, а его потомки обеспечивают более высокую точность воспроизведения при более низких битрейтах, полную реконструкцию стерео и музыкального уровня, а также более тесную интеграцию с генераторами текста в аудио и текста в музыку. Ожидается более широкое распространение в области связи с низкой пропускной способностью, потоковой передачи в реальном времени, а также в качестве стандартного уровня «аудиокена», который позволяет большим архитектурам в стиле языковой модели читать и записывать звук.
Реальная реализация
Токенизация аудио для генераторов текста в аудио Meta MusicGen и AudioGen
Сжатие речи с частотой 24 кГц до 1,5–6 кбит/с для передачи с ограниченной полосой пропускания.
Кодирование стереомузыки с частотой 48 кГц с качеством, близким к MP3, при гораздо более высоких битрейтах.
Использование в качестве встраиваемого кодека с открытым исходным кодом для исследовательских и аудиоконвейеров ML через выпущенные контрольные точки.
Риски и ограничения
Риски неправильного использования голоса и выдачи себя за другое лицо возрастают при отсутствии согласия.
Точность может снижаться из-за акцентов, диалектов или шумной обстановки.
Синтетический звук можно принять за аутентичную речь без четкой маркировки.
Дорожная карта реализации
Получите явное согласие на захват, клонирование и повторное использование голоса.
Проверьте качество звука при использовании различных динамиков и фоновых условий.
Определите, когда человек должен проверять или утверждать результаты.
Маркируйте синтетический звук и сохраняйте записи о происхождении для обеспечения ответственности.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the EnCodec Audio Compression quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Эмбедирование аудио и обучение представлениям
Часто задаваемые вопросы
What is EnCodec Audio Compression?
EnCodec — это высококачественный нейронный аудиокодек Meta, который сжимает речь и музыку с очень низким битрейтом, обеспечивая качество, конкурирующее с гораздо более тяжелыми форматами. Это важно, потому что оно лежит в основе современных генеративных аудиосистем и поставляется в форме с открытым исходным кодом, чтобы каждый мог его использовать.
Какая организация выпустила EnCodec?
EnCodec был представлен Meta AI (FAIR) в 2022 году как высококачественный нейронный аудиокодек.
Какой дополнительный компонент добавляет EnCodec, чтобы без потерь выжать больше сжатия из своих токенов?
EnCodec обучает небольшой преобразователь прогнозированию вероятностей токенов и их арифметическому кодированию, обеспечивая дополнительное сжатие без потерь поверх RVQ.
При скорости примерно 6 кбит/с качество EnCodec было сопоставимо с MP3, примерно при каком битрейте?
EnCodec при скорости 6 кбит/с по субъективным ощущениям достигает качества, аналогичного MP3 при скорости 64 кбит/с, что является большим выигрышем в эффективности.
Какую проблему решает «балансировщик» EnCodec во время обучения?
При многих потерях (реконструкционных, спектральных, состязательных) балансировщик изменяет масштаб их градиентов, чтобы ни одна цель не доминировала, стабилизируя тренировку.
Какой основной метод квантования используется EnCodec и SoundStream?
Как и SoundStream, EnCodec использует остаточное векторное квантование для дискретизации вложений кодера в составные индексы кодовой книги.