GUIDE de l'IA audio

Discours Moshi en duplex intégral

Moshi est une IA vocale open source en temps réel de Kyutai qui parle et écoute en même temps – en duplex intégral – au lieu de se relayer strictement.

2 minutes de lectureDernière mise à jour

Aperçu

Cela supprime le décalage gênant et la prise de tour rigide des assistants vocaux traditionnels.

Plongée profonde

Moshi, lancé par le laboratoire français Kyutai en 2024, est un modèle de base de synthèse vocale conçu pour une conversation naturelle à faible latence. Contrairement aux assistants de pipeline qui enchaînent la parole en texte, puis un modèle de langage, puis la synthèse vocale, Moshi gère l'audio directement et en continu. Son idée clé est le duplex intégral : il modélise simultanément deux flux audio - celui de l'utilisateur et le sien - afin de pouvoir écouter tout en parlant, gérer les interruptions, canaliser en retour avec "mhm" et se chevaucher naturellement comme le font les humains. Il atteint une latence d’environ 160 à 200 millisecondes, bien en dessous du décalage typique d’un assistant. Sous le capot, il associe un modèle de langage texte et audio à paramètres 7B (Helium) avec Mimi, un codec audio neuronal qui compresse la parole en jetons discrets que le modèle peut générer. Kyutai a publié ouvertement les poids et le code.

Aperçu technique

L'astuce de Moshi réside dans son codec Mimi, qui transforme l'audio continu en un flux de jetons discrets à faible débit à 12,5 Hz, y compris un jeton sémantique distillé. Le modèle de langage prédit ses propres jetons vocaux et ceux de l'utilisateur dans des flux parallèles alignés dans le temps, de sorte que la génération n'ait jamais à s'arrêter pour « écouter ». Une méthode « Inner Monologue » prédit le texte avant l'audio, améliorant ainsi la qualité linguistique et la cohérence de ce que dit réellement Moshi.

Impact stratégique

Accès et portée

Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.

Coût et budget

Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.

Vitesse et échelle

Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.

L'avenir du discours Moshi Full-Duplex

La modélisation full-duplex est en train de devenir le modèle de l’IA vocale naturelle, influençant les systèmes de l’ensemble du secteur. Attendez-vous à des versions plus petites sur l'appareil, à une prise en charge multilingue, à une latence plus faible et à une intégration dans les agents, le service client et les outils d'accessibilité. Parce que Moshi est ouvert, les chercheurs peuvent l’explorer et l’améliorer librement. Des défis subsistent en matière de fiabilité factuelle, de sécurité dans les discours qui se chevauchent et de nuances émotionnelles, mais le passage d'un tour de rôle rigide à une conversation fluide et interrompue est probablement permanent.

Mise en œuvre dans le monde réel

Un compagnon vocal mains libres que vous pouvez interrompre au milieu d'une phrase, avec des réponses en moins de 200 millisecondes.

Base de référence de recherche ouverte pour étudier le dialogue parlé en temps réel et en duplex intégral sans boîtes noires propriétaires.

Des assistants d'accessibilité qui conversent de manière fluide avec les utilisateurs qui ont besoin d'échanges rapides et naturels.

Prototypage de robots vocaux de service client disruptibles qui back-channel et réagissent pendant que l'appelant parle encore.

Risques et garde-fous

Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.

La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.

L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.

Feuille de route de mise en œuvre

1

Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.

2

Testez la qualité sur divers locuteurs et conditions d’arrière-plan.

3

Définissez quand un humain doit examiner ou approuver les résultats.

4

Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Moshi Full-Duplex Speech quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Normalisation du texte pour la parole

Questions fréquemment posées

Qu’est-ce que la parole Moshi Full-Duplex ?

Moshi est une IA vocale open source en temps réel de Kyutai qui parle et écoute en même temps – en duplex intégral – au lieu de se relayer strictement. Cela supprime le décalage gênant et la prise de tour rigide des assistants vocaux traditionnels.

Que signifie « full-duplex » dans le contexte de Moshi ?

Le duplex intégral signifie que le modèle gère simultanément l’audio entrant et sortant, ce qui lui permet d’écouter tout en parlant et de gérer les interruptions naturellement.

Quelle organisation a libéré Moshi ?

Moshi a été développé et open source par Kyutai, un laboratoire français de recherche en IA, en 2024.

Qu'est-ce que Mimi dans le système Moshi ?

Mimi est le codec audio neuronal qui compresse la parole continue en un flux à faible débit de jetons discrets que le modèle peut générer.

En quoi Moshi diffère-t-il d’un pipeline d’assistant vocal traditionnel ?

Les assistants traditionnels enchaînent la parole en texte, un modèle de langage et la synthèse vocale ; Moshi est un modèle unique de synthèse vocale gérant l'audio en continu.

À peu près quelle latence conversationnelle Moshi cible-t-il ?

Moshi atteint une latence d'environ 160 à 200 ms, bien inférieure à celle des assistants vocaux classiques, permettant un chevauchement et une interruption naturels.