Códec de audio de transmisión Mimi
Mimi es un códec de audio neuronal que comprime la voz en un pequeño flujo de tokens discretos en tiempo real, para que los modelos de IA puedan escuchar y hablar con una latencia muy baja.
Descripción general
It is the audio backbone behind Kyutai's Moshi voice model.
Buceo profundo
Mimi, lanzado por el laboratorio francés Kyutai en 2024, es un códec neuronal que convierte audio de 24 kHz en un flujo de tokens discretos a aproximadamente 1,1 kbps y solo 12,5 tokens por segundo. Utiliza un codificador-decodificador con cuantificación vectorial residual (RVQ), que divide los tokens en un primer nivel "semántico" destilado de un modelo de voz autosupervisado (WavLM) más varios niveles "acústicos" que capturan la textura de la voz. Fundamentalmente, es totalmente streaming y causal: emite tokens a medida que llega el audio en lugar de esperar un clip completo, con aproximadamente 80 ms de latencia. Esto permite que un modelo de lenguaje trate el habla como tokens de texto, lo que permite a Moshi conversar en dúplex completo mientras mantiene el audio reconstruido inteligible y natural.
Información técnica
El truco de Mimi es un esquema de RVQ dividido. El primer libro de códigos se entrena con una pérdida de destilación para que coincida con las incrustaciones de WavLM, lo que lo obliga a transmitir un "significado" fonético, mientras que los libros de códigos acústicos paralelos reconstruyen los detalles de las formas de onda. Un transformador opera dentro del cuello de botella y una pérdida adversaria (GAN) en el decodificador mejora la calidad de la salida. Las convoluciones causales mantienen todo en streaming, por lo que la latencia se mantiene cerca de los 80 ms.
Impacto Estratégico
Access and reach
Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.
Costo y presupuesto
Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.
Speed and scale
Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.
El futuro del códec de audio en streaming Mimi
Espere que códecs como Mimi se conviertan en la interfaz estándar entre el audio y los modelos de lenguajes grandes, impulsando a los asistentes de voz en tiempo real a tiempos de respuesta inferiores a 100 ms. Las investigaciones están reduciendo aún más las tasas de tokens, preservando al mismo tiempo la identidad, las emociones y la música del hablante. Debido a que Kyutai tiene Mimi y Moshi de código abierto, es probable que genere muchos sistemas abiertos de voz a voz, asistentes en el dispositivo y herramientas de comunicación de voz de ancho de banda ultrabajo.
Implementación en el mundo real
Potenciando el asistente de voz full-duplex Moshi de Kyutai para que pueda escuchar y hablar simultáneamente
Transmisión de tokens de voz a un modelo de lenguaje para traducción de voz a voz en tiempo real
Llamadas de voz con una tasa de bits ultrabaja (~1,1 kbps) para condiciones de red deficientes o congestionadas
Tokenización de audio para voz generativa y canales de texto a voz que razonan sobre sonidos como texto
Riesgos y barandillas
Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.
La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.
El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.
Hoja de ruta de implementación
Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.
Pruebe la calidad en diversos oradores y condiciones de fondo.
Defina cuándo un humano debe revisar o aprobar los resultados.
Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mimi Streaming Audio Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Códecs de audio neuronales
Preguntas frecuentes
What is Mimi Streaming Audio Codec?
Mimi es un códec de audio neuronal que comprime la voz en un pequeño flujo de tokens discretos en tiempo real, para que los modelos de IA puedan escuchar y hablar con una latencia muy baja. Es la columna vertebral de audio detrás del modelo de voz Moshi de Kyutai.
¿Qué laboratorio lanzó Mimi y el modelo de voz de Moshi?
Mimi y Moshi fueron lanzados en 2024 por el laboratorio de investigación francés Kyutai, que hizo de código abierto ambos.
¿Aproximadamente cuántos tokens por segundo emite Mimi para hablar?
Mimi comprime audio de 24 kHz a solo 12,5 tokens por segundo a aproximadamente 1,1 kbps.
¿Qué captura el primer libro de códigos ('semántico') de Mimi?
El primer nivel RVQ se entrena mediante destilación de WavLM para transmitir contenido semántico/fonético, mientras que los niveles posteriores añaden detalles acústicos.
¿Por qué se describe a Mimi como 'streaming' o 'causal'?
Mimi procesa el audio de forma causal y genera tokens de forma incremental, lo que proporciona una latencia de aproximadamente 80 ms adecuada para conversaciones en vivo.
¿Qué técnica de cuantización utiliza Mimi para codificar audio?
Mimi utiliza la cuantificación de vectores residuales, apilando varios libros de códigos para que cada uno agregue detalles más finos al anterior.