Discurso Moshi Full-Duplex
Moshi é uma IA de voz em tempo real e de código aberto da Kyutai que fala e ouve ao mesmo tempo – full-duplex – em vez de fazer turnos rígidos.
Visão geral
That removes the awkward lag and rigid turn-taking of traditional voice assistants.
Mergulho profundo
Moshi, lançado pelo laboratório francês Kyutai em 2024, é um modelo básico de fala para fala construído para conversas naturais e de baixa latência. Ao contrário dos assistentes de pipeline que encadeiam a fala ao texto, depois um modelo de linguagem e depois o texto para a fala, o Moshi lida com o áudio direta e continuamente. Sua ideia principal é full duplex: ele modela dois fluxos de áudio simultaneamente – o do usuário e o seu próprio – para que possa ouvir enquanto fala, lidar com interrupções, fazer backchannel com ‘mhm’ e se sobrepor naturalmente como os humanos fazem. Atinge latência em torno de 160-200 milissegundos, muito abaixo do atraso típico do assistente. Nos bastidores, ele emparelha um modelo de linguagem de texto e áudio com parâmetros de 7B (Helium) com Mimi, um codec de áudio neural que compacta a fala em tokens discretos que o modelo pode gerar. Kyutai divulgou os pesos e o código abertamente.
Visão Técnica
O truque do Moshi é seu codec Mimi, que transforma áudio contínuo em um fluxo de tokens discretos de baixa taxa de bits a 12,5 Hz, incluindo um token semântico destilado. O modelo de linguagem prevê seus próprios tokens de fala e os do usuário em fluxos paralelos alinhados no tempo, de modo que a geração nunca precise parar para “ouvir”. Um método de 'Monólogo Interior' prevê o texto antes do áudio, melhorando a qualidade linguística e a coerência do que Moshi realmente diz.
Impacto Estratégico
Acesso e alcance
Melhora a acessibilidade por meio de transcrição, narração e interfaces de voz.
Custo e orçamento
As equipes de mídia podem enviar áudio sofisticado com mais rapidez e com orçamentos menores.
Velocidade e escala
Os sistemas voltados para o cliente podem processar interações faladas em maior escala.
O futuro da fala full-duplex Moshi
A modelagem full-duplex está se tornando o modelo para IA de voz natural, influenciando sistemas em todo o setor. Espere versões menores no dispositivo, suporte multilíngue, menor latência e integração com agentes, atendimento ao cliente e ferramentas de acessibilidade. Como o Moshi é aberto, os pesquisadores podem testá-lo e melhorá-lo livremente. Persistem desafios em torno da fiabilidade factual, da segurança na sobreposição de discursos e das nuances emocionais, mas a mudança de uma troca de turnos rígida para uma conversa fluida e interrompível é provavelmente permanente.
Implementação no mundo real
Um companheiro de voz viva-voz que você pode interromper no meio de uma frase, com respostas em menos de 200 milissegundos.
Linha de base de pesquisa aberta para estudar diálogos falados full-duplex em tempo real, sem caixas pretas proprietárias.
Assistentes de acessibilidade que conversam fluidamente com usuários que precisam de trocas rápidas e naturais.
Prototipagem de bots de voz interrompíveis de atendimento ao cliente que canalizam e reagem enquanto o chamador ainda está falando.
Riscos e guarda-corpos
Os riscos de uso indevido de voz e falsificação de identidade aumentam quando falta consentimento.
A precisão pode diminuir em sotaques, dialetos ou ambientes barulhentos.
O áudio sintético pode ser confundido com fala autêntica sem uma rotulagem clara.
Roteiro de implementação
Obtenha consentimento explícito para captura, clonagem e reutilização de voz.
Teste a qualidade em diversos alto-falantes e condições de fundo.
Defina quando um ser humano deve revisar ou aprovar os resultados.
Rotule o áudio sintético e mantenha registros de procedência para fins de prestação de contas.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Moshi Full-Duplex Speech quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Normalização de texto para fala
Perguntas frequentes
What is Moshi Full-Duplex Speech?
Moshi é uma IA de voz em tempo real e de código aberto da Kyutai que fala e ouve ao mesmo tempo – full-duplex – em vez de fazer turnos rígidos. Isso elimina o atraso estranho e a rígida alternância de turnos dos assistentes de voz tradicionais.
O que significa 'full-duplex' no contexto de Moshi?
Full-duplex significa que o modelo lida com áudio de entrada e saída simultaneamente, para que possa ouvir enquanto fala e lidar com interrupções naturalmente.
Qual organização lançou Moshi?
Moshi foi desenvolvido e de código aberto por Kyutai, um laboratório francês de pesquisa de IA, em 2024.
O que é Mimi no sistema Moshi?
Mimi é o codec de áudio neural que compacta a fala contínua em um fluxo de tokens discretos de baixa taxa de bits que o modelo pode gerar.
Como o Moshi difere de um pipeline de assistente de voz tradicional?
Assistentes tradicionais encadeiam fala para texto, um modelo de linguagem e texto para fala; Moshi é um modelo único de fala para fala que lida com áudio continuamente.
Aproximadamente qual latência de conversação o Moshi visa?
Moshi atinge latência em torno de 160-200 ms, muito inferior à dos assistentes de voz típicos, permitindo sobreposição e interrupção naturais.