Audio-KI-GUIDE

Mimi Streaming Audio Codec

Mimi ist ein neuronaler Audio-Codec, der Sprache in Echtzeit in einen winzigen Strom diskreter Token komprimiert, sodass KI-Modelle mit sehr geringer Latenz zuhören und sprechen können.

2 Minuten gelesenZuletzt aktualisiert

Übersicht

It is the audio backbone behind Kyutai's Moshi voice model.

Tiefer Einblick

Mimi, das 2024 vom französischen Labor Kyutai veröffentlicht wurde, ist ein neuronaler Codec, der 24-kHz-Audio in einen Strom diskreter Token mit etwa 1,1 Kbit/s und nur 12,5 Token pro Sekunde umwandelt. Es verwendet einen Encoder-Decoder mit Restvektorquantisierung (RVQ), der Token in eine „semantische“ erste Ebene aufteilt, die aus einem selbstüberwachten Sprachmodell (WavLM) destilliert wird, sowie mehrere „akustische“ Ebenen, die die Sprachtextur erfassen. Entscheidend ist, dass es vollständig streamend und kausal ist: Es gibt Token aus, wenn Audio eintrifft, anstatt auf einen vollständigen Clip zu warten, mit einer Latenz von etwa 80 ms. Dadurch kann ein Sprachmodell Sprache wie Text-Tokens behandeln und Moshi in die Lage versetzen, sich im Vollduplexmodus zu unterhalten und gleichzeitig die rekonstruierte Audioqualität verständlich und natürlich zu halten.

Technischer Einblick

Mimis Trick ist ein Split-RVQ-Schema. Das erste Codebuch wird mit einem Destillationsverlust trainiert, um mit Einbettungen von WavLM übereinzustimmen, wodurch es gezwungen wird, phonetische „Bedeutung“ zu übertragen, während parallele akustische Codebücher Wellenformdetails rekonstruieren. Innerhalb des Engpasses arbeitet ein Transformator, und ein Adversarial-Verlust (GAN) am Decoder verbessert die Ausgabequalität. Kausale Faltungen sorgen dafür, dass alles gestreamt wird, sodass die Latenz bei etwa 80 ms bleibt.

Strategische Auswirkungen

Zugang und Erreichbarkeit

Es verbessert die Zugänglichkeit durch Transkription, Erzählung und Sprachschnittstellen.

Kosten und Budget

Medienteams können mit kleineren Budgets schneller ausgefeilte Audioinhalte liefern.

Geschwindigkeit und Umfang

Kundenorientierte Systeme können gesprochene Interaktionen in größerem Maßstab verarbeiten.

Die Zukunft des Mimi Streaming Audio Codec

Erwarten Sie, dass Codecs wie Mimi zur Standardschnittstelle zwischen Audio- und großen Sprachmodellen werden und Echtzeit-Sprachassistenten Reaktionszeiten von unter 100 ms ermöglichen. Die Forschung führt dazu, dass die Token-Raten noch weiter sinken und gleichzeitig die Identität, Emotionen und Musik des Sprechers erhalten bleiben. Da Kyutai Mimi und Moshi als Open-Source-Lösungen zur Verfügung stellte, wird es wahrscheinlich viele offene Speech-to-Speech-Systeme, On-Device-Assistenten und Sprachkommunikationstools mit extrem geringer Bandbreite hervorbringen.

Reale Umsetzung

Unterstützt Kyutais Moshi-Vollduplex-Sprachassistent, sodass er gleichzeitig zuhören und sprechen kann

Streaming von Sprach-Tokens in ein Sprachmodell für die Echtzeit-Sprach-zu-Sprache-Übersetzung

Sprachanrufe mit extrem niedriger Bitrate (~1,1 Kbit/s) für schlechte oder überlastete Netzwerkbedingungen

Tokenisierung von Audio für generative Sprache und Text-zu-Sprache-Pipelines, die über Klang wie Text nachdenken

Risiken und Leitplanken

Das Risiko von Stimmmissbrauch und Identitätsdiebstahl steigt, wenn die Einwilligung fehlt.

Die Genauigkeit kann je nach Akzent, Dialekt oder lauter Umgebung abnehmen.

Synthetisches Audio kann ohne klare Kennzeichnung mit authentischer Sprache verwechselt werden.

Implementierungs-Roadmap

1

Holen Sie die ausdrückliche Zustimmung zur Spracherfassung, zum Klonen und zur Wiederverwendung ein.

2

Testen Sie die Qualität über verschiedene Lautsprecher und Hintergrundbedingungen hinweg.

3

Definieren Sie, wann ein Mensch Ausgaben überprüfen oder genehmigen muss.

4

Kennzeichnen Sie synthetisches Audio und bewahren Sie Aufzeichnungen über die Herkunft auf, um die Verantwortlichkeit zu gewährleisten.

Entdecken Sie weiter

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mimi Streaming Audio Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz starten

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Häufig gestellte Fragen

What is Mimi Streaming Audio Codec?

Mimi ist ein neuronaler Audio-Codec, der Sprache in Echtzeit in einen winzigen Strom diskreter Token komprimiert, sodass KI-Modelle mit sehr geringer Latenz zuhören und sprechen können. Es ist das Audio-Rückgrat hinter Kyutais Moshi-Sprachmodell.

Welches Labor hat Mimi und das Moshi-Sprachmodell veröffentlicht?

Mimi und Moshi wurden 2024 vom französischen Forschungslabor Kyutai veröffentlicht, das beide als Open-Source-Lösungen bereitstellte.

Wie viele Token pro Sekunde gibt Mimi ungefähr zum Sprechen aus?

Mimi komprimiert 24-kHz-Audio auf nur etwa 12,5 Token pro Sekunde bei etwa 1,1 kbps.

Was erfasst das erste („semantische“) Codebuch in Mimi?

Die erste RVQ-Ebene wird durch Destillation von WavLM darauf trainiert, semantische/phonetische Inhalte zu übertragen, während spätere Ebenen akustische Details hinzufügen.

Warum wird Mimi als „strömend“ oder „kausal“ beschrieben?

Mimi verarbeitet Audio kausal und gibt Token inkrementell aus, was eine Latenz von etwa 80 ms ergibt, die für Live-Konversationen geeignet ist.

Welche Quantisierungstechnik verwendet Mimi zum Kodieren von Audio?

Mimi verwendet die Restvektorquantisierung und stapelt mehrere Codebücher, sodass jedes dem vorherigen feinere Details hinzufügt.