Audio AI GUIDE

Mimi Streaming Audio Codec

Mimi är en neural ljudcodec som komprimerar tal till en liten ström av diskreta tokens i realtid, så att AI-modeller kan lyssna och tala med mycket låg latens.

2 min readSenast uppdaterad

Översikt

It is the audio backbone behind Kyutai's Moshi voice model.

Djupdykning

Mimi, som släpptes av det franska labbet Kyutai 2024, är en neural codec som förvandlar 24 kHz ljud till en ström av diskreta tokens med ungefär 1,1 kbps och endast 12,5 tokens per sekund. Den använder en kodare-avkodare med restvektorkvantisering (RVQ), som delar upp tokens till en "semantisk" första nivå destillerad från en självövervakad talmodell (WavLM) plus flera "akustiska" nivåer som fångar rösttextur. Det är avgörande att det är helt streamat och orsakssamband: det sänder ut tokens när ljud anländer snarare än att vänta på ett helt klipp, med cirka 80 ms fördröjning. Detta låter en språkmodell behandla tal som texttokens, vilket gör att Moshi kan konversera i full duplex samtidigt som det rekonstruerade ljudet hålls begripligt och naturligt.

Teknisk insikt

Mimis trick är ett split-RVQ-schema. Den första kodboken tränas med en destillationsförlust för att matcha inbäddningar från WavLM, vilket tvingar den att bära fonetisk "mening", medan parallella akustiska kodböcker rekonstruerar vågformsdetaljer. En transformator fungerar inne i flaskhalsen, och en kontradiktorisk (GAN) förlust på dekodern skärper utskriftskvaliteten. Kausala veck håller allt i strömning, så latensen förblir nära 80 ms.

Strategisk inverkan

Access and reach

Det förbättrar tillgängligheten genom transkription, berättarröst och röstgränssnitt.

Cost and budget

Medieteam kan skicka polerat ljud snabbare med mindre budgetar.

Speed and scale

Kundvända system kan behandla talade interaktioner i större skala.

Framtiden för Mimi Streaming Audio Codec

Räkna med att codecs som Mimi kommer att bli standardgränssnittet mellan ljud- och stora språkmodeller, vilket driver röstassistenter i realtid mot svarstider på under 100 ms. Forskning driver tokenfrekvensen ännu lägre samtidigt som talarens identitet, känslor och musik bevaras. Eftersom Kyutai har Mimi och Moshi med öppen källkod, kommer det sannolikt att skapa många öppna tal-till-tal-system, assistenter på enheten och verktyg för röstkommunikation med ultralåg bandbredd.

Real-World Implementation

Drivs av Kyutais Moshi full-duplex röstassistent så att den kan lyssna och prata samtidigt

Streama taltokens till en språkmodell för översättning av tal till tal i realtid

Röstsamtal med ultralåg bithastighet (~1,1 kbps) för dåliga eller överbelastade nätverksförhållanden

Tokeniserande ljud för generativt tal och text-till-tal pipelines som resonerar över låter som text

Risker & skyddsräcken

Riskerna för missbruk av röst och personifiering ökar när samtycke saknas.

Noggrannheten kan sjunka över accenter, dialekter eller bullriga miljöer.

Syntetiskt ljud kan misstas för autentiskt tal utan tydlig märkning.

Färdplan för genomförande

1

Skaffa uttryckligt samtycke för röstinfångning, kloning och återanvändning.

2

Testa kvalitet över olika högtalare och bakgrundsförhållanden.

3

Definiera när en människa måste granska eller godkänna utdata.

4

Märk syntetiskt ljud och håll härkomstregister för ansvarstagande.

Fortsätt utforska

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mimi Streaming Audio Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Starta frågesport

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Neural Audio Codecs

Frequently asked questions

What is Mimi Streaming Audio Codec?

Mimi är en neural ljudcodec som komprimerar tal till en liten ström av diskreta tokens i realtid, så att AI-modeller kan lyssna och tala med mycket låg latens. Det är ljudstommen bakom Kyutais Moshi-röstmodell.

Vilket labb släppte Mimi och röstmodellen Moshi?

Mimi och Moshi släpptes 2024 av det franska forskningslaboratoriet Kyutai, som har både öppen källkod.

Ungefär hur många tokens per sekund avger Mimi för tal?

Mimi komprimerar 24 kHz ljud ner till endast cirka 12,5 tokens per sekund vid ungefär 1,1 kbps.

Vad fångar den första ('semantiska') kodboken i Mimi?

Den första RVQ-nivån tränas via destillation från WavLM för att bära semantiskt/fonetiskt innehåll, medan senare nivåer lägger till akustiska detaljer.

Varför beskrivs Mimi som "streaming" eller "causal"?

Mimi bearbetar ljud kausalt och matar ut tokens stegvis, vilket ger cirka 80 ms latens lämplig för livekonversation.

Vilken kvantiseringsteknik använder Mimi för att koda ljud?

Mimi använder kvarvarande vektorkvantisering och staplar flera kodböcker så att var och en lägger till finare detaljer till den föregående.