GUIDE de l'IA audio

Codec audio en streaming Mimi

Mimi est un codec audio neuronal qui compresse la parole en un minuscule flux de jetons discrets en temps réel, afin que les modèles d'IA puissent écouter et parler avec une très faible latence.

2 minutes de lectureDernière mise à jour

Aperçu

C'est l'épine dorsale audio du modèle vocal Moshi de Kyutai.

Plongée profonde

Mimi, lancé par le laboratoire français Kyutai en 2024, est un codec neuronal qui transforme l'audio 24 kHz en un flux de jetons discrets à environ 1,1 kbps et seulement 12,5 jetons par seconde. Il utilise un codeur-décodeur avec quantification vectorielle résiduelle (RVQ), divisant les jetons en un premier niveau « sémantique » distillé à partir d'un modèle vocal auto-supervisé (WavLM) plus plusieurs niveaux « acoustiques » qui capturent la texture de la voix. Fondamentalement, il s'agit d'un streaming entièrement causal : il émet des jetons à mesure que l'audio arrive plutôt que d'attendre un clip complet, avec environ 80 ms de latence. Cela permet à un modèle de langage de traiter la parole comme des jetons de texte, permettant à Moshi de converser en duplex intégral tout en gardant l'audio reconstruit intelligible et naturel.

Aperçu technique

L'astuce de Mimi est un schéma RVQ divisé. Le premier livre de codes est formé avec une perte de distillation pour correspondre aux incorporations de WavLM, le forçant à porter une « signification » phonétique, tandis que des livres de codes acoustiques parallèles reconstruisent les détails de la forme d'onde. Un transformateur fonctionne à l'intérieur du goulot d'étranglement et une perte contradictoire (GAN) sur le décodeur améliore la qualité de sortie. Les convolutions causales maintiennent tout en streaming, donc la latence reste proche de 80 ms.

Impact stratégique

Accès et portée

Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.

Coût et budget

Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.

Vitesse et échelle

Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.

L’avenir du codec audio en streaming Mimi

Attendez-vous à ce que des codecs comme Mimi deviennent l’interface standard entre l’audio et les grands modèles de langage, poussant les assistants vocaux en temps réel vers des temps de réponse inférieurs à 100 ms. La recherche fait baisser encore davantage les taux de jetons tout en préservant l’identité, l’émotion et la musique du locuteur. Étant donné que Mimi et Moshi sont open source à Kyutai, il est probable qu'il soit à l'origine de nombreux systèmes de synthèse vocale ouverts, d'assistants intégrés à l'appareil et d'outils de communication vocale à très faible bande passante.

Mise en œuvre dans le monde réel

Alimenter l'assistant vocal Moshi full-duplex de Kyutai pour qu'il puisse écouter et parler simultanément

Streaming de jetons vocaux dans un modèle linguistique pour une traduction parole-parole en temps réel

Appels vocaux à très faible débit (~ 1,1 kbps) pour des conditions de réseau médiocres ou encombrées

Tokenisation de l'audio pour la parole générative et les pipelines de synthèse vocale qui raisonnent sur le son d'un texte

Risques et garde-fous

Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.

La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.

L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.

Feuille de route de mise en œuvre

1

Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.

2

Testez la qualité sur divers locuteurs et conditions d’arrière-plan.

3

Définissez quand un humain doit examiner ou approuver les résultats.

4

Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mimi Streaming Audio Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Codecs audio neuronaux

Questions fréquemment posées

Qu’est-ce que le codec audio Mimi Streaming ?

Mimi est un codec audio neuronal qui compresse la parole en un minuscule flux de jetons discrets en temps réel, afin que les modèles d'IA puissent écouter et parler avec une très faible latence. C'est l'épine dorsale audio du modèle vocal Moshi de Kyutai.

Quel laboratoire a publié Mimi et le modèle vocal Moshi ?

Mimi et Moshi ont été publiés en 2024 par le laboratoire de recherche français Kyutai, qui les a tous deux open source.

Environ combien de jetons par seconde Mimi émet-elle pour la parole ?

Mimi compresse l'audio 24 kHz à seulement 12,5 jetons par seconde à environ 1,1 kbps.

Que capture le premier livre de codes (« sémantique ») dans Mimi ?

Le premier niveau RVQ est formé via la distillation de WavLM pour transporter le contenu sémantique/phonétique, tandis que les niveaux ultérieurs ajoutent des détails acoustiques.

Pourquoi Mimi est-elle décrite comme étant « en streaming » ou « causale » ?

Mimi traite l'audio de manière causale et génère des jetons de manière incrémentielle, ce qui donne une latence d'environ 80 ms adaptée aux conversations en direct.

Quelle technique de quantification Mimi utilise-t-elle pour encoder l'audio ?

Mimi utilise la quantification vectorielle résiduelle, en empilant plusieurs livres de codes afin que chacun ajoute des détails plus fins au précédent.