Mimi Streaming Audio Codec
Mimi är en neural ljudcodec som komprimerar tal till en liten ström av diskreta tokens i realtid, så att AI-modeller kan lyssna och tala med mycket låg latens.
Översikt
It is the audio backbone behind Kyutai's Moshi voice model.
Djupdykning
Mimi, som släpptes av det franska labbet Kyutai 2024, är en neural codec som förvandlar 24 kHz ljud till en ström av diskreta tokens med ungefär 1,1 kbps och endast 12,5 tokens per sekund. Den använder en kodare-avkodare med restvektorkvantisering (RVQ), som delar upp tokens till en "semantisk" första nivå destillerad från en självövervakad talmodell (WavLM) plus flera "akustiska" nivåer som fångar rösttextur. Det är avgörande att det är helt streamat och orsakssamband: det sänder ut tokens när ljud anländer snarare än att vänta på ett helt klipp, med cirka 80 ms fördröjning. Detta låter en språkmodell behandla tal som texttokens, vilket gör att Moshi kan konversera i full duplex samtidigt som det rekonstruerade ljudet hålls begripligt och naturligt.
Teknisk insikt
Mimis trick är ett split-RVQ-schema. Den första kodboken tränas med en destillationsförlust för att matcha inbäddningar från WavLM, vilket tvingar den att bära fonetisk "mening", medan parallella akustiska kodböcker rekonstruerar vågformsdetaljer. En transformator fungerar inne i flaskhalsen, och en kontradiktorisk (GAN) förlust på dekodern skärper utskriftskvaliteten. Kausala veck håller allt i strömning, så latensen förblir nära 80 ms.
Strategisk inverkan
Access and reach
Det förbättrar tillgängligheten genom transkription, berättarröst och röstgränssnitt.
Cost and budget
Medieteam kan skicka polerat ljud snabbare med mindre budgetar.
Speed and scale
Kundvända system kan behandla talade interaktioner i större skala.
Framtiden för Mimi Streaming Audio Codec
Räkna med att codecs som Mimi kommer att bli standardgränssnittet mellan ljud- och stora språkmodeller, vilket driver röstassistenter i realtid mot svarstider på under 100 ms. Forskning driver tokenfrekvensen ännu lägre samtidigt som talarens identitet, känslor och musik bevaras. Eftersom Kyutai har Mimi och Moshi med öppen källkod, kommer det sannolikt att skapa många öppna tal-till-tal-system, assistenter på enheten och verktyg för röstkommunikation med ultralåg bandbredd.
Real-World Implementation
Drivs av Kyutais Moshi full-duplex röstassistent så att den kan lyssna och prata samtidigt
Streama taltokens till en språkmodell för översättning av tal till tal i realtid
Röstsamtal med ultralåg bithastighet (~1,1 kbps) för dåliga eller överbelastade nätverksförhållanden
Tokeniserande ljud för generativt tal och text-till-tal pipelines som resonerar över låter som text
Risker & skyddsräcken
Riskerna för missbruk av röst och personifiering ökar när samtycke saknas.
Noggrannheten kan sjunka över accenter, dialekter eller bullriga miljöer.
Syntetiskt ljud kan misstas för autentiskt tal utan tydlig märkning.
Färdplan för genomförande
Skaffa uttryckligt samtycke för röstinfångning, kloning och återanvändning.
Testa kvalitet över olika högtalare och bakgrundsförhållanden.
Definiera när en människa måste granska eller godkänna utdata.
Märk syntetiskt ljud och håll härkomstregister för ansvarstagande.
Fortsätt utforska
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mimi Streaming Audio Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Neural Audio Codecs
Frequently asked questions
What is Mimi Streaming Audio Codec?
Mimi är en neural ljudcodec som komprimerar tal till en liten ström av diskreta tokens i realtid, så att AI-modeller kan lyssna och tala med mycket låg latens. Det är ljudstommen bakom Kyutais Moshi-röstmodell.
Vilket labb släppte Mimi och röstmodellen Moshi?
Mimi och Moshi släpptes 2024 av det franska forskningslaboratoriet Kyutai, som har både öppen källkod.
Ungefär hur många tokens per sekund avger Mimi för tal?
Mimi komprimerar 24 kHz ljud ner till endast cirka 12,5 tokens per sekund vid ungefär 1,1 kbps.
Vad fångar den första ('semantiska') kodboken i Mimi?
Den första RVQ-nivån tränas via destillation från WavLM för att bära semantiskt/fonetiskt innehåll, medan senare nivåer lägger till akustiska detaljer.
Varför beskrivs Mimi som "streaming" eller "causal"?
Mimi bearbetar ljud kausalt och matar ut tokens stegvis, vilket ger cirka 80 ms latens lämplig för livekonversation.
Vilken kvantiseringsteknik använder Mimi för att koda ljud?
Mimi använder kvarvarande vektorkvantisering och staplar flera kodböcker så att var och en lägger till finare detaljer till den föregående.