EnCodec аудио компресия
EnCodec е висококачественият невронен аудио кодек на Meta, който компресира реч и музика при много ниски битрейт с качество, съперничещо на много по-тежки формати.
Преглед
It matters because it underpins modern generative audio systems and ships in open-source form for anyone to use.
Дълбоко гмуркане
Издаден от Meta AI през 2022 г., EnCodec следва плана на SoundStream за енкодер, квантизатор на остатъчен вектор (RVQ) и декодер, обучен от край до край, но добавя няколко подобрения. Той използва конволюционен енкодер с възможност за стрийминг, многомащабна спектрограма и загуби при реконструкция във времеви домейн и противопоставящи се дискриминатори за перцептивно качество. Забележителен принос е малък ентропиен модел, базиран на Transformer, който допълнително компресира квантуваните кодове без загуби, изстисквайки допълнителни битове без загуба на качество. EnCodec също въвежда балансьор, който автоматично мащабира многото конкуриращи се загуби при обучение, така че да останат стабилни. Той обработва 24 kHz монофонично и 48 kHz стерео аудио, работи с битрейт като 1,5, 3, 6 и 12 kbps и при 6 kbps достига качество, сравнимо с MP3 при 64 kbps. Неговите токени захранват MusicGen и AudioGen на Meta.
Техническа информация
Енкодерът на EnCodec намалява формата на вълната със стъпаловидни навивки в латентна последователност, която RVQ преобразува в подредени индекси на кодова книга. Лек езиков модел на Transformer прогнозира вероятностите на тези токени и ги кодира аритметично, възстановявайки допълнително компресиране безплатно. Тренировъчният балансьор премащабира приносите на градиента от реконструкцията, спектралните и противопоставящите се загуби, така че нито един термин не доминира, което поддържа многообективното обучение стабилно в целия диапазон на битрейт.
Стратегическо въздействие
Access and reach
Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.
Cost and budget
Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.
Speed and scale
Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.
Бъдещето на аудио компресията EnCodec
EnCodec вече е токенизаторът по подразбиране за няколко отворени генеративни аудио модела и неговите потомци настояват за по-висока прецизност при по-ниски битрейтове, пълна реконструкция на стерео и музикален клас и по-тясна интеграция с генератори за текст към аудио и текст към музика. Очаквайте по-широко приемане при комуникация с ниска честотна лента, поточно предаване в реално време и като стандартен слой „аудио токен“, който позволява на големи архитектури в стил езиков модел да четат и записват звук.
Внедряване в реалния свят
Токенизиране на аудио за генераторите на MusicGen и AudioGen на Meta текст към аудио
Компресиране на 24 kHz реч до 1,5-6 kbps за предаване с ограничена честотна лента
Кодиране на 48 kHz стерео музика с качество, близко до MP3, при много по-висок битрейт
Служи като пускащ кодек с отворен код за изследвания и аудио ML тръбопроводи чрез пуснатите контролни точки
Рискове и предпазни огради
Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.
Точността може да спадне при акценти, диалекти или шумна среда.
Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.
Пътна карта за изпълнение
Получете изрично съгласие за улавяне на глас, клониране и повторно използване.
Тествайте качеството при различни високоговорители и фонови условия.
Определете кога човек трябва да прегледа или одобри резултатите.
Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the EnCodec Audio Compression quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Аудио вграждания и обучение за представяне
Frequently asked questions
What is EnCodec Audio Compression?
EnCodec е висококачественият невронен аудио кодек на Meta, който компресира реч и музика при много ниски битрейт с качество, съперничещо на много по-тежки формати. Има значение, защото е в основата на съвременните генеративни аудио системи и се доставя във форма с отворен код, за да може всеки да го използва.
Коя организация пусна EnCodec?
EnCodec беше представен от Meta AI (FAIR) през 2022 г. като невронен аудио кодек с висока точност.
Какъв допълнителен компонент добавя EnCodec, за да изстиска без загуби повече компресия от своите токени?
EnCodec обучава малък трансформатор да предсказва вероятностите за токени и ги кодира аритметично, като постига допълнителна компресия без загуби върху RVQ.
При приблизително 6 kbps качеството на EnCodec беше отчетено като сравнимо с MP3 при приблизително какъв битрейт?
EnCodec при 6 kbps достига субективно качество, подобно на MP3 при 64 kbps, голяма печалба в ефективността.
Какъв проблем решава „балансьорът“ на EnCodec по време на обучение?
С много загуби (реконструкция, спектрални, състезателни), балансьорът премащабира техните градиенти, така че нито една цел да не доминира, стабилизирайки обучението.
Кой основен метод за квантуване споделя EnCodec със SoundStream?
Подобно на SoundStream, EnCodec използва остатъчно векторно квантуване, за да дискретизира вграждането на енкодер в подредени индекси на кодова книга.