GUIA de IA de áudio

Reconhecimento de fala por sussurro

Whisper é o sistema de reconhecimento automático de fala de código aberto da OpenAI que transforma áudio em texto em mais de 90 idiomas.

2 minutos de leituraÚltima atualização

Visão geral

It matters because it brought near-human transcription quality to everyone for free, working robustly on accents, background noise, and technical jargon.

Mergulho profundo

Lançado por OpenAI em setembro de 2022, Whisper é um modelo de codificador-decodificador baseado em Transformer treinado em 680.000 horas de áudio multilíngue e multitarefa extraído da web. Ao contrário dos sistemas anteriores que precisavam de dados limpos e rotulados, o Whisper aprendeu com gravações confusas do mundo real, tornando-o notavelmente resistente a sotaques, ruídos e diafonia. Um único modelo cuida da transcrição, tradução para o inglês, identificação do idioma e carimbo de data/hora. Ele é fornecido em tamanhos que vão de 'minúsculo' (parâmetros de 39M) a 'grande' (1,55B), permitindo que os usuários troquem velocidade por precisão. Como os pesos são licenciados abertamente pelo MIT, o Whisper se tornou a espinha dorsal padrão para inúmeros transcritores de podcast, ferramentas de legendagem e aplicativos de voz quase da noite para o dia.

Visão Técnica

O Whisper divide o áudio em pedaços de 30 segundos, converte cada um em um espectrograma log-Mel (80 canais de frequência) e o alimenta em um codificador Transformer. O decodificador então prevê tokens de texto de forma autorregressiva, guiado por tokens especiais que especificam a tarefa (transcrever versus traduzir), o idioma e se devem emitir carimbos de data/hora. Esse condicionamento de token multitarefa é um truque inteligente: um conjunto de pesos executa muitas tarefas dependendo dos tokens de prompt fornecidos no início da decodificação.

Impacto Estratégico

Acesso e alcance

Melhora a acessibilidade por meio de transcrição, narração e interfaces de voz.

Custo e orçamento

As equipes de mídia podem enviar áudio sofisticado com mais rapidez e com orçamentos menores.

Velocidade e escala

Os sistemas voltados para o cliente podem processar interações faladas em maior escala.

O futuro do reconhecimento de fala por sussurro

O Whisper desencadeou uma onda de derivados mais rápidos, como o Whisper.cpp, o sussurro mais rápido e versões destiladas que rodam em tempo real em telefones e laptops. Espere variantes de streaming mais restritas (baixa latência), melhor diarização do alto-falante combinada com ela e desempenho mais forte em linguagens de poucos recursos. À medida que a IA de áudio no dispositivo cresce, os modelos leves do estilo Whisper provavelmente fornecerão legendas ao vivo, notas de reuniões e ferramentas de acessibilidade totalmente offline, preservando a privacidade e ao mesmo tempo combinando a precisão do nível da nuvem.

Implementação no mundo real

Geração automática de transcrições e legendas pesquisáveis para podcasts e vídeos do YouTube

Capacitando aplicativos de anotações de reuniões ao vivo que produzem resumos de Zoom ou áudio do Teams

Tradução de entrevistas em idiomas estrangeiros diretamente para textos em inglês para jornalistas

Criação de ferramentas de acessibilidade controladas por voz e ditado para usuários que não sabem digitar

Riscos e guarda-corpos

Os riscos de uso indevido de voz e falsificação de identidade aumentam quando falta consentimento.

A precisão pode diminuir em sotaques, dialetos ou ambientes barulhentos.

O áudio sintético pode ser confundido com fala autêntica sem uma rotulagem clara.

Roteiro de implementação

1

Obtenha consentimento explícito para captura, clonagem e reutilização de voz.

2

Teste a qualidade em diversos alto-falantes e condições de fundo.

3

Defina quando um ser humano deve revisar ou aprovar os resultados.

4

Rotule o áudio sintético e mantenha registros de procedência para fins de prestação de contas.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Whisper Speech Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Reconhecimento de emoções de fala

Perguntas frequentes

What is Whisper Speech Recognition?

Whisper é o sistema de reconhecimento automático de fala de código aberto da OpenAI que transforma áudio em texto em mais de 90 idiomas. É importante porque trouxe qualidade de transcrição quase humana para todos gratuitamente, trabalhando de forma robusta em sotaques, ruídos de fundo e jargão técnico.

Aproximadamente em quantas horas de áudio o Whisper foi treinado?

O Whisper foi treinado em cerca de 680.000 horas de áudio multilíngue e multitarefa coletadas da web, um conjunto de dados excepcionalmente grande e diversificado.

Que representação intermediária o Whisper calcula a partir do áudio bruto antes do codificador?

O Whisper converte cada pedaço de áudio de 30 segundos em um espectrograma log-Mel de 80 canais, que o codificador Transformer processa.

Como um único modelo Whisper executa múltiplas tarefas, como transcrição e tradução?

Condições sussurradas em tokens especiais no início da decodificação que informam o idioma, a tarefa e se devem ser emitidos carimbos de data/hora.

Qual arquitetura neural geral o Whisper usa?

Whisper é um transformador codificador-decodificador: o codificador lê o espectrograma e o decodificador gera tokens de texto de forma autorregressiva.

Por que o Whisper é considerado especialmente robusto em comparação com os sistemas ASR anteriores?

O treinamento em grandes quantidades de áudio variado do mundo real (acentos, ruído, crosstalk) deu ao Whisper uma forte robustez pronta para uso, sem ajuste por domínio.