Audio AI GUIDE

Mimi Streaming Audio Codec

Mimi er en nevral lydkodek som komprimerer tale til en liten strøm av diskrete tokens i sanntid, slik at AI-modeller kan lytte og snakke med svært lav ventetid.

2 min lesingSist oppdatert

Oversikt

It is the audio backbone behind Kyutai's Moshi voice model.

Dypdykk

Mimi, utgitt av det franske laboratoriet Kyutai i 2024, er en nevral kodek som gjør 24 kHz lyd til en strøm av diskrete tokens med omtrent 1,1 kbps og bare 12,5 tokens per sekund. Den bruker en koder-dekoder med restvektorkvantisering (RVQ), og deler tokens i et 'semantisk' første nivå destillert fra en selvovervåket talemodell (WavLM) pluss flere 'akustiske' nivåer som fanger stemmetekstur. Avgjørende er det fullt strømming og årsakssammenheng: det sender ut tokens når lyden kommer frem i stedet for å vente på et fullt klipp, med omtrent 80 ms ventetid. Dette lar en språkmodell behandle tale som tekstsymboler, noe som gjør at Moshi kan snakke i full dupleks samtidig som den rekonstruerte lyden holdes forståelig og naturlig.

Teknisk innsikt

Mimis triks er en delt RVQ-ordning. Den første kodeboken er trent med et destillasjonstap for å matche innbygginger fra WavLM, noe som tvinger den til å bære fonetisk "betydning", mens parallelle akustiske kodebøker rekonstruerer bølgeformdetaljer. En transformator opererer inne i flaskehalsen, og et kontradiktorisk (GAN) tap på dekoderen skjerper utskriftskvaliteten. Årsakssvingninger holder alt strømming, så ventetiden holder seg nær 80 ms.

Strategisk innvirkning

Access and reach

Det forbedrer tilgjengeligheten gjennom transkripsjon, fortellerstemme og stemmegrensesnitt.

Cost and budget

Medieteam kan sende polert lyd raskere med mindre budsjetter.

Speed and scale

Kundevendte systemer kan behandle talte interaksjoner i større skala.

Fremtiden til Mimi Streaming Audio Codec

Forvent at kodeker som Mimi blir standardgrensesnittet mellom lyd- og store språkmodeller, og presser taleassistenter i sanntid mot under 100 ms responstider. Forskning driver token-rater enda lavere samtidig som høyttalerens identitet, følelser og musikk bevares. Fordi Kyutai åpner Mimi og Moshi, vil det sannsynligvis se mange åpne tale-til-tale-systemer, assistenter på enheten og talekommunikasjonsverktøy med ultralav båndbredde.

Real-World Implementering

Driver Kyutais Moshi full-dupleks stemmeassistent slik at den kan lytte og snakke samtidig

Streaming av taletokens til en språkmodell for sanntids tale-til-tale-oversettelse

Taleanrop med ultralav bithastighet (~1,1 kbps) for dårlige eller overbelastede nettverksforhold

Tokeniserende lyd for generativ tale og tekst-til-tale-pipelines som resonnerer over lyd som tekst

Risikoer og rekkverk

Risikoen for stemmemisbruk og etterligning øker når samtykke mangler.

Nøyaktigheten kan falle på tvers av aksenter, dialekter eller støyende omgivelser.

Syntetisk lyd kan forveksles med autentisk tale uten tydelig merking.

Veikart for implementering

1

Innhent eksplisitt samtykke for stemmefangst, kloning og gjenbruk.

2

Test kvalitet på tvers av forskjellige høyttalere og bakgrunnsforhold.

3

Definer når et menneske må gjennomgå eller godkjenne utdata.

4

Merk syntetisk lyd og oppbevar herkomstregistreringer for ansvarlighet.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mimi Streaming Audio Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Ofte stilte spørsmål

What is Mimi Streaming Audio Codec?

Mimi er en nevral lydkodek som komprimerer tale til en liten strøm av diskrete tokens i sanntid, slik at AI-modeller kan lytte og snakke med svært lav ventetid. Det er lydryggraden bak Kyutais Moshi-stemmemodell.

Hvilket laboratorium ga ut Mimi og Moshi-stemmemodellen?

Mimi og Moshi ble utgitt i 2024 av det franske forskningslaboratoriet Kyutai, som har åpen kildekode.

Omtrent hvor mange tokens per sekund avgir Mimi for tale?

Mimi komprimerer 24 kHz lyd ned til bare rundt 12,5 tokens per sekund ved omtrent 1,1 kbps.

Hva fanger den første ('semantiske') kodeboken i Mimi?

Det første RVQ-nivået trenes via destillasjon fra WavLM for å bære semantisk/fonetisk innhold, mens senere nivåer legger til akustiske detaljer.

Hvorfor beskrives Mimi som 'streaming' eller 'årsak'?

Mimi behandler lyd kausalt og sender ut tokens trinnvis, noe som gir omtrent 80 ms latency egnet for direkte samtaler.

Hvilken kvantiseringsteknikk bruker Mimi for å kode lyd?

Mimi bruker gjenværende vektorkvantisering, stabler flere kodebøker slik at hver av dem legger til finere detaljer til den forrige.