Reconocimiento de voz susurrada
Whisper es el sistema de reconocimiento automático de voz de código abierto de OpenAI que convierte audio en texto en más de 90 idiomas.
Descripción general
It matters because it brought near-human transcription quality to everyone for free, working robustly on accents, background noise, and technical jargon.
Buceo profundo
Lanzado por OpenAI en septiembre de 2022, Whisper es un modelo de codificador-decodificador basado en Transformer entrenado con 680.000 horas de audio multilingüe y multitarea extraído de la web. A diferencia de los sistemas anteriores que necesitaban datos limpios y etiquetados, Whisper aprendía de grabaciones desordenadas del mundo real, lo que lo hacía notablemente resistente a los acentos, el ruido y las diafonías. Un único modelo se encarga de la transcripción, la traducción al inglés, la identificación del idioma y el sellado de tiempo. Se envía en tamaños que van desde "pequeño" (39 millones de parámetros) hasta "grande" (1,55 millones), lo que permite a los usuarios intercambiar velocidad por precisión. Debido a que los pesos tienen licencia abierta del MIT, Whisper se convirtió en la columna vertebral predeterminada para innumerables transcriptores de podcasts, herramientas de subtítulos y aplicaciones de voz casi de la noche a la mañana.
Información técnica
Whisper divide el audio en fragmentos de 30 segundos, convierte cada uno en un espectrograma log-Mel (80 canales de frecuencia) y lo envía a un codificador Transformer. Luego, el decodificador predice tokens de texto de forma autorregresiva, guiado por tokens especiales que especifican la tarea (transcribir o traducir), el idioma y si se deben emitir marcas de tiempo. Este acondicionamiento de tokens multitarea es un truco inteligente: un conjunto de pesos realiza muchos trabajos dependiendo de los tokens de aviso suministrados al inicio de la decodificación.
Impacto Estratégico
Access and reach
Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.
Costo y presupuesto
Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.
Speed and scale
Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.
El futuro del reconocimiento de voz susurrada
Whisper provocó una ola de derivados más rápidos como Whisper.cpp, más rápido y versiones destiladas que se ejecutan en tiempo real en teléfonos y computadoras portátiles. Espere variantes de transmisión más ajustadas (baja latencia), una mejor diarioización de los hablantes combinada con ella y un rendimiento más sólido en idiomas de bajos recursos. A medida que crece la IA de audio en el dispositivo, los modelos livianos estilo Whisper probablemente impulsarán subtítulos en vivo, notas de reuniones y herramientas de accesibilidad completamente fuera de línea, preservando la privacidad y al mismo tiempo igualando la precisión del nivel de la nube.
Implementación en el mundo real
Generación automática de transcripciones y subtítulos con capacidad de búsqueda para podcasts y videos de YouTube
Impulsando aplicaciones de notas de reuniones en vivo que producen resúmenes de audio de Zoom o Teams
Traducción de entrevistas en idiomas extranjeros directamente al inglés para periodistas.
Creación de herramientas de accesibilidad controladas por voz y dictado para usuarios que no pueden escribir
Riesgos y barandillas
Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.
La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.
El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.
Hoja de ruta de implementación
Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.
Pruebe la calidad en diversos oradores y condiciones de fondo.
Defina cuándo un humano debe revisar o aprobar los resultados.
Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Whisper Speech Recognition quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Reconocimiento de emociones del habla
Preguntas frecuentes
What is Whisper Speech Recognition?
Whisper es el sistema de reconocimiento automático de voz de código abierto de OpenAI que convierte audio en texto en más de 90 idiomas. Es importante porque brindó una calidad de transcripción casi humana a todos de forma gratuita, trabajando de manera sólida en acentos, ruido de fondo y jerga técnica.
¿Aproximadamente en cuántas horas de audio se entrenó Whisper?
Whisper se entrenó con aproximadamente 680.000 horas de audio multilingüe y multitarea recopilado de la web, un conjunto de datos inusualmente grande y diverso.
¿Qué representación intermedia calcula Whisper a partir del audio sin procesar antes del codificador?
Whisper convierte cada fragmento de audio de 30 segundos en un espectrograma log-Mel de 80 canales, que procesa el codificador Transformer.
¿Cómo realiza un único modelo de Whisper múltiples tareas como transcripción y traducción?
Susurra condiciones en tokens especiales al inicio de la decodificación que le indican el idioma, la tarea y si se deben emitir marcas de tiempo.
¿Qué arquitectura neuronal general utiliza Whisper?
Whisper es un transformador codificador-decodificador: el codificador lee el espectrograma y el decodificador genera tokens de texto de forma autorregresiva.
¿Por qué se considera que Whisper es especialmente robusto en comparación con los sistemas ASR anteriores?
El entrenamiento con grandes cantidades de audio variado del mundo real (acentos, ruido, diafonía) le dio a Whisper una gran solidez lista para usar sin ajustes por dominio.