GUIA de IA de áudio

Codec de áudio de streaming Mimi

Mimi é um codec de áudio neural que compacta a fala em um pequeno fluxo de tokens discretos em tempo real, para que os modelos de IA possam ouvir e falar com latência muito baixa.

2 minutos de leituraÚltima atualização

Visão geral

It is the audio backbone behind Kyutai's Moshi voice model.

Mergulho profundo

Mimi, lançado pelo laboratório francês Kyutai em 2024, é um codec neural que transforma áudio de 24 kHz em um fluxo de tokens discretos a aproximadamente 1,1 kbps e apenas 12,5 tokens por segundo. Ele usa um codificador-decodificador com quantização vetorial residual (RVQ), dividindo os tokens em um primeiro nível 'semântico' destilado de um modelo de fala auto-supervisionado (WavLM) além de vários níveis 'acústicos' que capturam a textura da voz. Crucialmente, é totalmente streaming e causal: emite tokens à medida que o áudio chega, em vez de esperar por um clipe completo, com cerca de 80 ms de latência. Isso permite que um modelo de linguagem trate a fala como tokens de texto, permitindo que Moshi converse em full duplex enquanto mantém o áudio reconstruído inteligível e natural.

Visão Técnica

O truque de Mimi é um esquema RVQ dividido. O primeiro livro de código é treinado com uma perda de destilação para corresponder aos embeddings do WavLM, forçando-o a carregar o 'significado' fonético, enquanto os livros de código acústicos paralelos reconstroem os detalhes da forma de onda. Um Transformer opera dentro do gargalo e uma perda adversária (GAN) no decodificador melhora a qualidade da saída. As convoluções causais mantêm tudo em fluxo, de modo que a latência permanece próxima a 80 ms.

Impacto Estratégico

Acesso e alcance

Melhora a acessibilidade por meio de transcrição, narração e interfaces de voz.

Custo e orçamento

As equipes de mídia podem enviar áudio sofisticado com mais rapidez e com orçamentos menores.

Velocidade e escala

Os sistemas voltados para o cliente podem processar interações faladas em maior escala.

O futuro do codec de streaming de áudio Mimi

Espere que codecs como o Mimi se tornem a interface padrão entre modelos de áudio e de linguagem grande, levando os assistentes de voz em tempo real a tempos de resposta inferiores a 100 ms. A pesquisa está reduzindo ainda mais as taxas de token, ao mesmo tempo que preserva a identidade, a emoção e a música do orador. Como o Kyutai é de código aberto para Mimi e Moshi, é provável que ele semeie muitos sistemas abertos de fala para fala, assistentes no dispositivo e ferramentas de comunicação de voz com largura de banda ultrabaixa.

Implementação no mundo real

Equipando o assistente de voz full-duplex Moshi da Kyutai para que ele possa ouvir e falar simultaneamente

Streaming de tokens de fala em um modelo de idioma para tradução de fala para fala em tempo real

Chamadas de voz com taxa de bits ultrabaixa (~1,1 kbps) para condições de rede ruins ou congestionadas

Tokenização de áudio para fala generativa e pipelines de conversão de texto em fala que raciocinam sobre o som como texto

Riscos e guarda-corpos

Os riscos de uso indevido de voz e falsificação de identidade aumentam quando falta consentimento.

A precisão pode diminuir em sotaques, dialetos ou ambientes barulhentos.

O áudio sintético pode ser confundido com fala autêntica sem uma rotulagem clara.

Roteiro de implementação

1

Obtenha consentimento explícito para captura, clonagem e reutilização de voz.

2

Teste a qualidade em diversos alto-falantes e condições de fundo.

3

Defina quando um ser humano deve revisar ou aprovar os resultados.

4

Rotule o áudio sintético e mantenha registros de procedência para fins de prestação de contas.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mimi Streaming Audio Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

What is Mimi Streaming Audio Codec?

Mimi é um codec de áudio neural que compacta a fala em um pequeno fluxo de tokens discretos em tempo real, para que os modelos de IA possam ouvir e falar com latência muito baixa. É a espinha dorsal do áudio por trás do modelo de voz Moshi de Kyutai.

Qual laboratório lançou Mimi e o modelo de voz Moshi?

Mimi e Moshi foram lançados em 2024 pelo laboratório de pesquisa francês Kyutai, que abriu o código-fonte de ambos.

Aproximadamente quantos tokens por segundo Mimi emite para fala?

Mimi comprime áudio de 24 kHz para apenas cerca de 12,5 tokens por segundo a aproximadamente 1,1 kbps.

O que o primeiro livro de códigos ('semântico') do Mimi captura?

O primeiro nível RVQ é treinado por meio de destilação do WavLM para transportar conteúdo semântico/fonético, enquanto os níveis posteriores adicionam detalhes acústicos.

Por que Mimi é descrita como ‘streaming’ ou ‘causal’?

Mimi processa áudio causalmente e gera tokens de forma incremental, fornecendo cerca de 80 ms de latência adequada para conversas ao vivo.

Qual técnica de quantização o Mimi usa para codificar áudio?

Mimi usa quantização vetorial residual, empilhando vários livros de códigos para que cada um adicione detalhes mais sutis ao anterior.