Discurso completo dúplex de Moshi
Moshi es una IA de voz en tiempo real y de código abierto de Kyutai que habla y escucha al mismo tiempo (full-duplex) en lugar de tomar turnos estrictos.
Descripción general
That removes the awkward lag and rigid turn-taking of traditional voice assistants.
Buceo profundo
Moshi, lanzado por el laboratorio francés Kyutai en 2024, es un modelo básico de habla a voz creado para una conversación natural y de baja latencia. A diferencia de los asistentes de canalización que encadenan voz a texto, luego un modelo de lenguaje y luego texto a voz, Moshi maneja el audio directa y continuamente. Su idea clave es full duplex: modela dos flujos de audio simultáneamente (el del usuario y el suyo propio) para que pueda escuchar mientras habla, manejar interrupciones, canalizar con 'mhm' y superponerse naturalmente como lo hacen los humanos. Alcanza una latencia de entre 160 y 200 milisegundos, muy por debajo del retraso típico del asistente. Debajo del capó, combina un modelo de lenguaje de texto y audio de parámetros 7B (Helium) con Mimi, un códec de audio neuronal que comprime la voz en tokens discretos que el modelo puede generar. Kyutai publicó abiertamente los pesos y el código.
Información técnica
El truco de Moshi es su códec Mimi, que convierte el audio continuo en un flujo de tokens discretos de baja tasa de bits a 12,5 Hz, incluido un token semántico destilado. El modelo de lenguaje predice sus propios tokens de voz y los del usuario en flujos paralelos alineados en el tiempo, por lo que la generación nunca tiene que detenerse a "escuchar". Un método de 'Monólogo interior' predice el texto antes que el audio, mejorando la calidad lingüística y la coherencia de lo que Moshi realmente dice.
Impacto Estratégico
Access and reach
Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.
Costo y presupuesto
Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.
Speed and scale
Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.
El futuro del discurso Moshi Full-Duplex
El modelado full-duplex se está convirtiendo en el modelo para la IA de voz natural, lo que influye en los sistemas de toda la industria. Espere versiones más pequeñas en el dispositivo, soporte multilingüe, menor latencia e integración con agentes, servicio al cliente y herramientas de accesibilidad. Debido a que Moshi es abierto, los investigadores pueden probarlo y mejorarlo libremente. Aún persisten desafíos en torno a la confiabilidad fáctica, la seguridad en el habla superpuesta y los matices emocionales, pero el cambio de una toma de turnos rígida a una conversación fluida e interrumpible probablemente sea permanente.
Implementación en el mundo real
Un compañero de voz manos libres que puedes interrumpir a mitad de una frase, con respuestas en menos de 200 milisegundos.
Línea de base de investigación abierta para estudiar diálogos hablados full-duplex en tiempo real sin cajas negras patentadas.
Asistentes de accesibilidad que conversan fluidamente con usuarios que necesitan un intercambio rápido y natural.
Creación de prototipos de robots de voz de servicio al cliente interrumpibles que retroceden y reaccionan mientras la persona que llama sigue hablando.
Riesgos y barandillas
Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.
La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.
El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.
Hoja de ruta de implementación
Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.
Pruebe la calidad en diversos oradores y condiciones de fondo.
Defina cuándo un humano debe revisar o aprobar los resultados.
Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Moshi Full-Duplex Speech quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Normalización de texto para voz
Preguntas frecuentes
What is Moshi Full-Duplex Speech?
Moshi es una IA de voz en tiempo real y de código abierto de Kyutai que habla y escucha al mismo tiempo (full-duplex) en lugar de tomar turnos estrictos. Esto elimina el incómodo retraso y la rigidez en la toma de turnos de los asistentes de voz tradicionales.
¿Qué significa "full-duplex" en el contexto de Moshi?
Full-duplex significa que el modelo maneja el audio entrante y saliente simultáneamente, por lo que puede escuchar mientras habla y manejar las interrupciones de forma natural.
¿Qué organización liberó a Moshi?
Moshi fue desarrollado y de código abierto por Kyutai, un laboratorio de investigación de inteligencia artificial francés, en 2024.
¿Qué es Mimi en el sistema Moshi?
Mimi es el códec de audio neuronal que comprime la voz continua en un flujo de tokens discretos de baja velocidad de bits que el modelo puede generar.
¿En qué se diferencia Moshi de un asistente de voz tradicional?
Los asistentes tradicionales encadenan voz a texto, un modelo de lenguaje y texto a voz; Moshi es un modelo único de voz a voz que maneja audio de forma continua.
¿Aproximadamente a qué latencia conversacional se dirige Moshi?
Moshi logra una latencia de alrededor de 160-200 ms, mucho más baja que la de los asistentes de voz típicos, lo que permite una superposición e interrupción naturales.