Codec audio in streaming Mimi
Mimi è un codec audio neurale che comprime il parlato in un minuscolo flusso di token discreti in tempo reale, in modo che i modelli di intelligenza artificiale possano ascoltare e parlare con una latenza molto bassa.
Panoramica
It is the audio backbone behind Kyutai's Moshi voice model.
Immersione profonda
Mimi, rilasciato dal laboratorio francese Kyutai nel 2024, è un codec neurale che trasforma l'audio a 24 kHz in un flusso di token discreti a circa 1,1 kbps e solo 12,5 token al secondo. Utilizza un codificatore-decodificatore con quantizzazione vettoriale residua (RVQ), suddividendo i token in un primo livello "semantico" distillato da un modello vocale autosupervisionato (WavLM) più diversi livelli "acustici" che catturano la struttura della voce. Fondamentalmente è completamente streaming e causale: emette token all'arrivo dell'audio anziché attendere una clip completa, con circa 80 ms di latenza. Ciò consente a un modello linguistico di trattare il parlato come token di testo, consentendo a Moshi di conversare in full duplex mantenendo l'audio ricostruito intelligibile e naturale.
Approfondimento tecnico
Il trucco di Mimi è uno schema RVQ diviso. Il primo codebook è addestrato con una perdita di distillazione per corrispondere agli incorporamenti di WavLM, costringendolo a portare un "significato" fonetico, mentre i codebook acustici paralleli ricostruiscono i dettagli della forma d'onda. Un trasformatore opera all'interno del collo di bottiglia e una perdita contraddittoria (GAN) sul decodificatore migliora la qualità dell'output. Le convoluzioni causali mantengono tutto in streaming, quindi la latenza rimane intorno agli 80 ms.
Impatto strategico
Accedere e raggiungere
Migliora l'accessibilità attraverso la trascrizione, la narrazione e le interfacce vocali.
Costo e budget
I team media possono fornire audio raffinato più velocemente con budget inferiori.
Velocità e scala
I sistemi rivolti al cliente possono elaborare le interazioni parlate su scala più ampia.
Il futuro del codec audio in streaming Mimi
Aspettatevi che codec come Mimi diventino l’interfaccia standard tra audio e modelli linguistici di grandi dimensioni, spingendo gli assistenti vocali in tempo reale verso tempi di risposta inferiori a 100 ms. La ricerca sta portando i tassi dei token ancora più in basso preservando l’identità, le emozioni e la musica di chi parla. Poiché Kyutai ha reso Mimi e Moshi open source, è probabile che verranno diffusi molti sistemi di sintesi vocale aperti, assistenti su dispositivo e strumenti di comunicazione vocale a larghezza di banda ultra-ridotta.
Implementazione nel mondo reale
Alimenta l'assistente vocale full-duplex Moshi di Kyutai in modo che possa ascoltare e parlare contemporaneamente
Streaming di token vocali in un modello linguistico per la traduzione da parlato a parlato in tempo reale
Chiamate vocali a bitrate ultra-basso (~1,1 kbps) per condizioni di rete scadenti o congestionate
Tokenizzazione dell'audio per pipeline di sintesi vocale e di sintesi vocale generativa che ragionano sul suono come il testo
Rischi e guardrail
I rischi di uso improprio della voce e di impersonificazione aumentano quando manca il consenso.
La precisione può diminuire se si considerano accenti, dialetti o ambienti rumorosi.
L'audio sintetico può essere confuso con un parlato autentico senza un'etichettatura chiara.
Tabella di marcia per l'implementazione
Ottieni il consenso esplicito per l'acquisizione, la clonazione e il riutilizzo della voce.
Testare la qualità su diversi altoparlanti e condizioni di fondo.
Definire quando un essere umano deve rivedere o approvare gli output.
Etichettare l'audio sintetico e conservare i registri di provenienza per responsabilità.
Continua a esplorare
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mimi Streaming Audio Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Prossima guida
Codec audio neurali
Domande frequenti
What is Mimi Streaming Audio Codec?
Mimi è un codec audio neurale che comprime il parlato in un minuscolo flusso di token discreti in tempo reale, in modo che i modelli di intelligenza artificiale possano ascoltare e parlare con una latenza molto bassa. È la spina dorsale audio dietro il modello vocale Moshi di Kyutai.
Quale laboratorio ha rilasciato Mimi e il modello vocale di Moshi?
Mimi e Moshi sono stati rilasciati nel 2024 dal laboratorio di ricerca francese Kyutai, che li ha resi open source entrambi.
Approssimativamente quanti gettoni al secondo emette Mimi per parlare?
Mimi comprime l'audio a 24 kHz fino a soli 12,5 token al secondo a circa 1,1 kbps.
Cosa cattura il primo codebook ("semantico") in Mimi?
Il primo livello RVQ viene addestrato tramite distillazione da WavLM per trasportare contenuto semantico/fonetico, mentre i livelli successivi aggiungono dettagli acustici.
Perché Mimi viene descritto come "streaming" o "causale"?
Mimi elabora l'audio in modo causale e genera token in modo incrementale, fornendo una latenza di circa 80 ms adatta per conversazioni dal vivo.
Quale tecnica di quantizzazione utilizza Mimi per codificare l'audio?
Mimi utilizza la quantizzazione vettoriale residua, impilando più codici in modo che ciascuno aggiunga dettagli più fini al precedente.