Аудио AI РЪКОВОДСТВО

Mimi Streaming Audio Codec

Mimi е невронен аудио кодек, който компресира речта в малък поток от дискретни токени в реално време, така че AI моделите да могат да слушат и говорят с много ниска латентност.

2 min readПоследна актуализация

Преглед

It is the audio backbone behind Kyutai's Moshi voice model.

Дълбоко гмуркане

Mimi, пуснат от френската лаборатория Kyutai през 2024 г., е невронен кодек, който превръща 24 kHz аудио в поток от дискретни токени при приблизително 1,1 kbps и само 12,5 токена в секунда. Той използва енкодер-декодер с остатъчно векторно квантуване (RVQ), разделяйки токените на „семантично“ първо ниво, дестилирано от модел на самоконтролиран говор (WavLM) плюс няколко „акустични“ нива, които улавят гласовата текстура. Най-важното е, че е изцяло поточно и причинно-следствено: излъчва жетони, когато аудиото пристигне, вместо да чака пълен клип, с около 80 ms латентност. Това позволява на езиковия модел да третира речта като текстови токени, позволявайки на Moshi да разговаря в пълен дуплекс, като същевременно поддържа реконструирания звук разбираем и естествен.

Техническа информация

Номерът на Мими е схема за split-RVQ. Първата кодова книга е обучена с дестилационна загуба, за да съответства на вграждания от WavLM, принуждавайки я да носи фонетично „смисъл“, докато паралелните акустични кодови книги възстановяват детайлите на формата на вълната. Трансформаторът работи вътре в тясното място, а противопоставящата се (GAN) загуба на декодера изостря качеството на изхода. Причинно-следствените конволюции поддържат всичко поточно, така че латентността остава близо 80 ms.

Стратегическо въздействие

Access and reach

Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.

Cost and budget

Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.

Speed and scale

Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.

Бъдещето на Mimi Streaming Audio Codec

Очаквайте кодеци като Mimi да се превърнат в стандартен интерфейс между аудио и големи езикови модели, изтласквайки гласовите асистенти в реално време към времето за реакция под 100 ms. Изследванията водят до още по-ниски проценти на токени, като същевременно запазват идентичността на говорещия, емоцията и музиката. Тъй като Kyutai предлага Mimi и Moshi с отворен код, вероятно ще създаде много отворени системи за говор към говор, асистенти на устройството и инструменти за гласова комуникация с ултра ниска честотна лента.

Внедряване в реалния свят

Захранване на пълнодуплексния гласов асистент Moshi на Kyutai, за да може да слуша и говори едновременно

Поточно предаване на речеви токени в езиков модел за превод на реч в реално време

Гласови повиквания с изключително нисък битрейт (~1,1 kbps) за лоши или претоварени мрежови условия

Токенизиране на аудио за генеративна реч и тръбопроводи за текст към реч, които разсъждават над звука като текст

Рискове и предпазни огради

Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.

Точността може да спадне при акценти, диалекти или шумна среда.

Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.

Пътна карта за изпълнение

1

Получете изрично съгласие за улавяне на глас, клониране и повторно използване.

2

Тествайте качеството при различни високоговорители и фонови условия.

3

Определете кога човек трябва да прегледа или одобри резултатите.

4

Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mimi Streaming Audio Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Невронни аудио кодеци

Frequently asked questions

What is Mimi Streaming Audio Codec?

Mimi е невронен аудио кодек, който компресира речта в малък поток от дискретни токени в реално време, така че AI моделите да могат да слушат и говорят с много ниска латентност. Това е аудио гръбнакът зад гласовия модел Moshi на Kyutai.

Коя лаборатория пусна Мими и гласовия модел на Моши?

Mimi и Moshi бяха пуснати през 2024 г. от френската изследователска лаборатория Kyutai, която отвори и двете.

Приблизително колко жетона в секунда излъчва Мими за реч?

Mimi компресира 24 kHz аудио до само около 12,5 токена в секунда при приблизително 1,1 kbps.

Какво улавя първата („семантична“) кодова книга в Mimi?

Първото RVQ ниво се обучава чрез дестилация от WavLM да носи семантично/фонетично съдържание, докато по-късните нива добавят акустични детайли.

Защо Мими е описана като „стрийминг“ или „каузална“?

Mimi обработва аудио причинно и извежда токени постепенно, като дава около 80 ms латентност, подходяща за разговор на живо.

Коя техника за квантуване използва Мими за кодиране на аудио?

Mimi използва остатъчно векторно квантуване, подреждайки множество кодови книги, така че всяка добавя по-фини детайли към предишната.