Codec audio en streaming Mimi
Mimi est un codec audio neuronal qui compresse la parole en un minuscule flux de jetons discrets en temps réel, afin que les modèles d'IA puissent écouter et parler avec une très faible latence.
Aperçu
C'est l'épine dorsale audio du modèle vocal Moshi de Kyutai.
Plongée profonde
Mimi, lancé par le laboratoire français Kyutai en 2024, est un codec neuronal qui transforme l'audio 24 kHz en un flux de jetons discrets à environ 1,1 kbps et seulement 12,5 jetons par seconde. Il utilise un codeur-décodeur avec quantification vectorielle résiduelle (RVQ), divisant les jetons en un premier niveau « sémantique » distillé à partir d'un modèle vocal auto-supervisé (WavLM) plus plusieurs niveaux « acoustiques » qui capturent la texture de la voix. Fondamentalement, il s'agit d'un streaming entièrement causal : il émet des jetons à mesure que l'audio arrive plutôt que d'attendre un clip complet, avec environ 80 ms de latence. Cela permet à un modèle de langage de traiter la parole comme des jetons de texte, permettant à Moshi de converser en duplex intégral tout en gardant l'audio reconstruit intelligible et naturel.
Aperçu technique
L'astuce de Mimi est un schéma RVQ divisé. Le premier livre de codes est formé avec une perte de distillation pour correspondre aux incorporations de WavLM, le forçant à porter une « signification » phonétique, tandis que des livres de codes acoustiques parallèles reconstruisent les détails de la forme d'onde. Un transformateur fonctionne à l'intérieur du goulot d'étranglement et une perte contradictoire (GAN) sur le décodeur améliore la qualité de sortie. Les convolutions causales maintiennent tout en streaming, donc la latence reste proche de 80 ms.
Impact stratégique
Accès et portée
Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.
Coût et budget
Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.
Vitesse et échelle
Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.
L’avenir du codec audio en streaming Mimi
Attendez-vous à ce que des codecs comme Mimi deviennent l’interface standard entre l’audio et les grands modèles de langage, poussant les assistants vocaux en temps réel vers des temps de réponse inférieurs à 100 ms. La recherche fait baisser encore davantage les taux de jetons tout en préservant l’identité, l’émotion et la musique du locuteur. Étant donné que Mimi et Moshi sont open source à Kyutai, il est probable qu'il soit à l'origine de nombreux systèmes de synthèse vocale ouverts, d'assistants intégrés à l'appareil et d'outils de communication vocale à très faible bande passante.
Mise en œuvre dans le monde réel
Alimenter l'assistant vocal Moshi full-duplex de Kyutai pour qu'il puisse écouter et parler simultanément
Streaming de jetons vocaux dans un modèle linguistique pour une traduction parole-parole en temps réel
Appels vocaux à très faible débit (~ 1,1 kbps) pour des conditions de réseau médiocres ou encombrées
Tokenisation de l'audio pour la parole générative et les pipelines de synthèse vocale qui raisonnent sur le son d'un texte
Risques et garde-fous
Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.
La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.
L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.
Feuille de route de mise en œuvre
Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.
Testez la qualité sur divers locuteurs et conditions d’arrière-plan.
Définissez quand un humain doit examiner ou approuver les résultats.
Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mimi Streaming Audio Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Codecs audio neuronaux
Questions fréquemment posées
Qu’est-ce que le codec audio Mimi Streaming ?
Mimi est un codec audio neuronal qui compresse la parole en un minuscule flux de jetons discrets en temps réel, afin que les modèles d'IA puissent écouter et parler avec une très faible latence. C'est l'épine dorsale audio du modèle vocal Moshi de Kyutai.
Quel laboratoire a publié Mimi et le modèle vocal Moshi ?
Mimi et Moshi ont été publiés en 2024 par le laboratoire de recherche français Kyutai, qui les a tous deux open source.
Environ combien de jetons par seconde Mimi émet-elle pour la parole ?
Mimi compresse l'audio 24 kHz à seulement 12,5 jetons par seconde à environ 1,1 kbps.
Que capture le premier livre de codes (« sémantique ») dans Mimi ?
Le premier niveau RVQ est formé via la distillation de WavLM pour transporter le contenu sémantique/phonétique, tandis que les niveaux ultérieurs ajoutent des détails acoustiques.
Pourquoi Mimi est-elle décrite comme étant « en streaming » ou « causale » ?
Mimi traite l'audio de manière causale et génère des jetons de manière incrémentielle, ce qui donne une latence d'environ 80 ms adaptée aux conversations en direct.
Quelle technique de quantification Mimi utilise-t-elle pour encoder l'audio ?
Mimi utilise la quantification vectorielle résiduelle, en empilant plusieurs livres de codes afin que chacun ajoute des détails plus fins au précédent.