Mimi Streaming Audio Codec
Mimi ist ein neuronaler Audio-Codec, der Sprache in Echtzeit in einen winzigen Strom diskreter Token komprimiert, sodass KI-Modelle mit sehr geringer Latenz zuhören und sprechen können.
Übersicht
It is the audio backbone behind Kyutai's Moshi voice model.
Tiefer Einblick
Mimi, das 2024 vom französischen Labor Kyutai veröffentlicht wurde, ist ein neuronaler Codec, der 24-kHz-Audio in einen Strom diskreter Token mit etwa 1,1 Kbit/s und nur 12,5 Token pro Sekunde umwandelt. Es verwendet einen Encoder-Decoder mit Restvektorquantisierung (RVQ), der Token in eine „semantische“ erste Ebene aufteilt, die aus einem selbstüberwachten Sprachmodell (WavLM) destilliert wird, sowie mehrere „akustische“ Ebenen, die die Sprachtextur erfassen. Entscheidend ist, dass es vollständig streamend und kausal ist: Es gibt Token aus, wenn Audio eintrifft, anstatt auf einen vollständigen Clip zu warten, mit einer Latenz von etwa 80 ms. Dadurch kann ein Sprachmodell Sprache wie Text-Tokens behandeln und Moshi in die Lage versetzen, sich im Vollduplexmodus zu unterhalten und gleichzeitig die rekonstruierte Audioqualität verständlich und natürlich zu halten.
Technischer Einblick
Mimis Trick ist ein Split-RVQ-Schema. Das erste Codebuch wird mit einem Destillationsverlust trainiert, um mit Einbettungen von WavLM übereinzustimmen, wodurch es gezwungen wird, phonetische „Bedeutung“ zu übertragen, während parallele akustische Codebücher Wellenformdetails rekonstruieren. Innerhalb des Engpasses arbeitet ein Transformator, und ein Adversarial-Verlust (GAN) am Decoder verbessert die Ausgabequalität. Kausale Faltungen sorgen dafür, dass alles gestreamt wird, sodass die Latenz bei etwa 80 ms bleibt.
Strategische Auswirkungen
Zugang und Erreichbarkeit
Es verbessert die Zugänglichkeit durch Transkription, Erzählung und Sprachschnittstellen.
Kosten und Budget
Medienteams können mit kleineren Budgets schneller ausgefeilte Audioinhalte liefern.
Geschwindigkeit und Umfang
Kundenorientierte Systeme können gesprochene Interaktionen in größerem Maßstab verarbeiten.
Die Zukunft des Mimi Streaming Audio Codec
Erwarten Sie, dass Codecs wie Mimi zur Standardschnittstelle zwischen Audio- und großen Sprachmodellen werden und Echtzeit-Sprachassistenten Reaktionszeiten von unter 100 ms ermöglichen. Die Forschung führt dazu, dass die Token-Raten noch weiter sinken und gleichzeitig die Identität, Emotionen und Musik des Sprechers erhalten bleiben. Da Kyutai Mimi und Moshi als Open-Source-Lösungen zur Verfügung stellte, wird es wahrscheinlich viele offene Speech-to-Speech-Systeme, On-Device-Assistenten und Sprachkommunikationstools mit extrem geringer Bandbreite hervorbringen.
Reale Umsetzung
Unterstützt Kyutais Moshi-Vollduplex-Sprachassistent, sodass er gleichzeitig zuhören und sprechen kann
Streaming von Sprach-Tokens in ein Sprachmodell für die Echtzeit-Sprach-zu-Sprache-Übersetzung
Sprachanrufe mit extrem niedriger Bitrate (~1,1 Kbit/s) für schlechte oder überlastete Netzwerkbedingungen
Tokenisierung von Audio für generative Sprache und Text-zu-Sprache-Pipelines, die über Klang wie Text nachdenken
Risiken und Leitplanken
Das Risiko von Stimmmissbrauch und Identitätsdiebstahl steigt, wenn die Einwilligung fehlt.
Die Genauigkeit kann je nach Akzent, Dialekt oder lauter Umgebung abnehmen.
Synthetisches Audio kann ohne klare Kennzeichnung mit authentischer Sprache verwechselt werden.
Implementierungs-Roadmap
Holen Sie die ausdrückliche Zustimmung zur Spracherfassung, zum Klonen und zur Wiederverwendung ein.
Testen Sie die Qualität über verschiedene Lautsprecher und Hintergrundbedingungen hinweg.
Definieren Sie, wann ein Mensch Ausgaben überprüfen oder genehmigen muss.
Kennzeichnen Sie synthetisches Audio und bewahren Sie Aufzeichnungen über die Herkunft auf, um die Verantwortlichkeit zu gewährleisten.
Entdecken Sie weiter
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mimi Streaming Audio Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Nächster Leitfaden
Neuronale Audio-Codecs
Häufig gestellte Fragen
What is Mimi Streaming Audio Codec?
Mimi ist ein neuronaler Audio-Codec, der Sprache in Echtzeit in einen winzigen Strom diskreter Token komprimiert, sodass KI-Modelle mit sehr geringer Latenz zuhören und sprechen können. Es ist das Audio-Rückgrat hinter Kyutais Moshi-Sprachmodell.
Welches Labor hat Mimi und das Moshi-Sprachmodell veröffentlicht?
Mimi und Moshi wurden 2024 vom französischen Forschungslabor Kyutai veröffentlicht, das beide als Open-Source-Lösungen bereitstellte.
Wie viele Token pro Sekunde gibt Mimi ungefähr zum Sprechen aus?
Mimi komprimiert 24-kHz-Audio auf nur etwa 12,5 Token pro Sekunde bei etwa 1,1 kbps.
Was erfasst das erste („semantische“) Codebuch in Mimi?
Die erste RVQ-Ebene wird durch Destillation von WavLM darauf trainiert, semantische/phonetische Inhalte zu übertragen, während spätere Ebenen akustische Details hinzufügen.
Warum wird Mimi als „strömend“ oder „kausal“ beschrieben?
Mimi verarbeitet Audio kausal und gibt Token inkrementell aus, was eine Latenz von etwa 80 ms ergibt, die für Live-Konversationen geeignet ist.
Welche Quantisierungstechnik verwendet Mimi zum Kodieren von Audio?
Mimi verwendet die Restvektorquantisierung und stapelt mehrere Codebücher, sodass jedes dem vorherigen feinere Details hinzufügt.