EnCodec Audio Compression
EnCodec — це високоточний нейронний аудіокодек Meta, який стискає мову та музику з дуже низькими бітрейтами з якістю, що конкурує з набагато важчими форматами.
Огляд
It matters because it underpins modern generative audio systems and ships in open-source form for anyone to use.
Глибоке занурення
EnCodec, випущений Meta AI у 2022 році, відповідає схемі SoundStream кодера, залишкового векторного квантователя (RVQ) і наскрізного навчання декодеру, але додає кілька вдосконалень. Він використовує згортковий кодер із можливістю потокової передачі, багатомасштабну спектрограму та втрати реконструкції у часовій області, а також дискримінатори для сприйняття якості. Помітним внеском є невелика ентропійна модель на основі Transformer, яка додатково стискає квантовані коди без втрат, вичавлюючи додаткові біти без втрати якості. EnCodec також представляє балансир, який автоматично масштабує багато конкуруючих тренувальних втрат, щоб вони залишалися стабільними. Він обробляє монофонічне аудіо 24 кГц і стерео аудіо 48 кГц, працює на таких бітрейтах, як 1,5, 3, 6 і 12 кбіт/с, а при 6 кбіт/с досягає якості, порівнянної з MP3 при 64 кбіт/с. Його токени живлять MusicGen і AudioGen Meta.
Технічне розуміння
Кодер EnCodec знижує дискретизацію хвилі за допомогою ступінчастих згорток у латентну послідовність, яку RVQ перетворює в індекси складеної кодової книги. Легка модель мови Transformer передбачає ймовірності цих токенів і арифметично кодує їх, безкоштовно відновлюючи подальше стиснення. Тренувальний балансир перемасштабує внески градієнта від реконструкції, спектральних і протилежних втрат, тому жоден член не домінує, що зберігає багатоцільове навчання стабільним у всьому діапазоні бітрейтів.
Стратегічний вплив
Доступ і охоплення
Це покращує доступність завдяки транскрипції, дикторському тексту та голосовому інтерфейсу.
Вартість і бюджет
Медіа-команди можуть доставляти якісний аудіо швидше за менші бюджети.
Швидкість і масштаб
Системи, орієнтовані на клієнта, можуть обробляти голосову взаємодію у більшому масштабі.
Майбутнє стиснення звуку EnCodec
EnCodec уже є токенізером за замовчуванням для кількох відкритих генеративних аудіо моделей, і його нащадки просувають вищу точність при нижчих бітрейтах, повну реконструкцію стереозвуку та музичного класу та більш тісну інтеграцію з генераторами тексту в аудіо та тексту в музику. Очікуйте ширшого впровадження в зв’язку з низькою пропускною здатністю, потоковому передаванні в реальному часі та стандартному рівні «аудіотокенів», який дозволяє великим архітектурам у стилі мовної моделі читати та записувати звук.
Реалізація в реальному світі
Токенізація аудіо для генераторів перетворення тексту в аудіо Meta MusicGen і AudioGen
Стиснення мови 24 кГц до 1,5-6 кбіт/с для передачі з обмеженою смугою пропускання
Кодування стереомузики 48 кГц із якістю, близькою до MP3, із значно вищими бітрейтами
Використовується як додатковий кодек із відкритим вихідним кодом для досліджень і аудіоконвеєрів ML через випущені контрольні точки
Ризики та огорожі
Ризик неправильного використання голосу та видавання себе за іншу особу зростає, якщо згоди немає.
Точність може впасти через акценти, діалекти чи шумне середовище.
Синтетичне аудіо можна прийняти за автентичне мовлення без чіткого маркування.
Дорожня карта впровадження
Отримайте чітку згоду на захоплення голосу, клонування та повторне використання.
Перевірте якість на різних динаміках і фонових умовах.
Визначте, коли людина повинна переглядати або затверджувати результати.
Позначайте синтетичне аудіо та зберігайте записи про походження для підзвітності.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the EnCodec Audio Compression quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Вбудовування аудіо та навчання репрезентації
Часті запитання
What is EnCodec Audio Compression?
EnCodec — це високоточний нейронний аудіокодек Meta, який стискає мову та музику з дуже низькими бітрейтами з якістю, що конкурує з набагато важчими форматами. Це важливо, оскільки воно лежить в основі сучасних генеративних аудіосистем і постачається у формі відкритого коду для будь-кого.
Яка організація випустила EnCodec?
EnCodec був представлений Meta AI (FAIR) у 2022 році як високоточний нейронний аудіокодек.
Який додатковий компонент додає EnCodec, щоб без втрат отримати більше стиснення своїх токенів?
EnCodec навчає невеликий трансформатор прогнозувати ймовірності маркерів і арифметично кодує їх, досягаючи додаткового стиснення без втрат на основі RVQ.
При приблизно 6 кбіт/с якість EnCodec була порівнянна з MP3 і приблизно з яким бітрейтом?
EnCodec зі швидкістю 6 Кбіт/с досягає суб’єктивної якості, подібної до MP3 зі швидкістю 64 Кбіт/с, що є великим приростом ефективності.
Яку проблему вирішує «балансер» EnCodec під час навчання?
З багатьма втратами (реконструкцією, спектральними, змагальними) балансир змінює масштаб своїх градієнтів, щоб жодна мета не домінувала, стабілізуючи навчання.
Який основний метод квантування використовує EnCodec і SoundStream?
Подібно до SoundStream, EnCodec використовує залишкове векторне квантування для дискретизації вбудовування кодера в індекси складених кодових книг.