GUÍA de IA en audio

Reconocimiento de voz susurrada

Whisper es el sistema de reconocimiento automático de voz de código abierto de OpenAI que convierte audio en texto en más de 90 idiomas.

2 minutos de lecturaÚltima actualización

Descripción general

It matters because it brought near-human transcription quality to everyone for free, working robustly on accents, background noise, and technical jargon.

Buceo profundo

Lanzado por OpenAI en septiembre de 2022, Whisper es un modelo de codificador-decodificador basado en Transformer entrenado con 680.000 horas de audio multilingüe y multitarea extraído de la web. A diferencia de los sistemas anteriores que necesitaban datos limpios y etiquetados, Whisper aprendía de grabaciones desordenadas del mundo real, lo que lo hacía notablemente resistente a los acentos, el ruido y las diafonías. Un único modelo se encarga de la transcripción, la traducción al inglés, la identificación del idioma y el sellado de tiempo. Se envía en tamaños que van desde "pequeño" (39 millones de parámetros) hasta "grande" (1,55 millones), lo que permite a los usuarios intercambiar velocidad por precisión. Debido a que los pesos tienen licencia abierta del MIT, Whisper se convirtió en la columna vertebral predeterminada para innumerables transcriptores de podcasts, herramientas de subtítulos y aplicaciones de voz casi de la noche a la mañana.

Información técnica

Whisper divide el audio en fragmentos de 30 segundos, convierte cada uno en un espectrograma log-Mel (80 canales de frecuencia) y lo envía a un codificador Transformer. Luego, el decodificador predice tokens de texto de forma autorregresiva, guiado por tokens especiales que especifican la tarea (transcribir o traducir), el idioma y si se deben emitir marcas de tiempo. Este acondicionamiento de tokens multitarea es un truco inteligente: un conjunto de pesos realiza muchos trabajos dependiendo de los tokens de aviso suministrados al inicio de la decodificación.

Impacto Estratégico

Access and reach

Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.

Costo y presupuesto

Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.

Speed and scale

Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.

El futuro del reconocimiento de voz susurrada

Whisper provocó una ola de derivados más rápidos como Whisper.cpp, más rápido y versiones destiladas que se ejecutan en tiempo real en teléfonos y computadoras portátiles. Espere variantes de transmisión más ajustadas (baja latencia), una mejor diarioización de los hablantes combinada con ella y un rendimiento más sólido en idiomas de bajos recursos. A medida que crece la IA de audio en el dispositivo, los modelos livianos estilo Whisper probablemente impulsarán subtítulos en vivo, notas de reuniones y herramientas de accesibilidad completamente fuera de línea, preservando la privacidad y al mismo tiempo igualando la precisión del nivel de la nube.

Implementación en el mundo real

Generación automática de transcripciones y subtítulos con capacidad de búsqueda para podcasts y videos de YouTube

Impulsando aplicaciones de notas de reuniones en vivo que producen resúmenes de audio de Zoom o Teams

Traducción de entrevistas en idiomas extranjeros directamente al inglés para periodistas.

Creación de herramientas de accesibilidad controladas por voz y dictado para usuarios que no pueden escribir

Riesgos y barandillas

Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.

La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.

El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.

Hoja de ruta de implementación

1

Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.

2

Pruebe la calidad en diversos oradores y condiciones de fondo.

3

Defina cuándo un humano debe revisar o aprobar los resultados.

4

Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Whisper Speech Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Reconocimiento de emociones del habla

Preguntas frecuentes

What is Whisper Speech Recognition?

Whisper es el sistema de reconocimiento automático de voz de código abierto de OpenAI que convierte audio en texto en más de 90 idiomas. Es importante porque brindó una calidad de transcripción casi humana a todos de forma gratuita, trabajando de manera sólida en acentos, ruido de fondo y jerga técnica.

¿Aproximadamente en cuántas horas de audio se entrenó Whisper?

Whisper se entrenó con aproximadamente 680.000 horas de audio multilingüe y multitarea recopilado de la web, un conjunto de datos inusualmente grande y diverso.

¿Qué representación intermedia calcula Whisper a partir del audio sin procesar antes del codificador?

Whisper convierte cada fragmento de audio de 30 segundos en un espectrograma log-Mel de 80 canales, que procesa el codificador Transformer.

¿Cómo realiza un único modelo de Whisper múltiples tareas como transcripción y traducción?

Susurra condiciones en tokens especiales al inicio de la decodificación que le indican el idioma, la tarea y si se deben emitir marcas de tiempo.

¿Qué arquitectura neuronal general utiliza Whisper?

Whisper es un transformador codificador-decodificador: el codificador lee el espectrograma y el decodificador genera tokens de texto de forma autorregresiva.

¿Por qué se considera que Whisper es especialmente robusto en comparación con los sistemas ASR anteriores?

El entrenamiento con grandes cantidades de audio variado del mundo real (acentos, ruido, diafonía) le dio a Whisper una gran solidez lista para usar sin ajustes por dominio.