GUÍA de IA en audio

OpenAI Susurro

Whisper es el sistema de reconocimiento automático de voz de código abierto de OpenAI que transcribe y traduce audio hablado en docenas de idiomas.

2 minutos de lecturaÚltima actualización

Descripción general

It matters because it brought robust, free, near-human transcription to anyone who can run the model.

Buceo profundo

Lanzado en septiembre de 2022, Whisper se entrenó con aproximadamente 680.000 horas de audio multilingüe y multitarea recopilado de la web. Ese enorme y variado conjunto de datos es el secreto de su solidez: maneja acentos, ruido de fondo y jerga técnica mucho mejor que los sistemas más antiguos, sin necesidad de realizar ajustes para cada nuevo dominio. Whisper puede transcribir discursos en el idioma original, traducir discursos de muchos idiomas al inglés, identificar el idioma hablado y agregar marcas de tiempo. OpenAI publicó abiertamente los pesos y el código del modelo, por lo que se ejecuta localmente en una computadora portátil o en un centro de datos, lo que impulsó una explosión de herramientas comunitarias, reimplementaciones más rápidas y aplicaciones creadas sobre ellas. La precisión varía según el idioma y la calidad del audio y, como todos los sistemas similares, ocasionalmente puede "alucinar" el texto.

Información técnica

Whisper es un codificador-decodificador Transformer entrenado como una tarea de secuencia a secuencia. El audio se convierte en un espectrograma log-Mel, una representación visual de frecuencias a lo largo del tiempo, que procesa el codificador. Luego, el decodificador predice tokens de texto, condicionados por tokens especiales que le indican al modelo qué tarea realizar: transcribir, traducir, detectar idioma o agregar marcas de tiempo. Debido a que aprendió del audio web débilmente etiquetado en muchas tareas a la vez, un solo modelo se generaliza ampliamente en lugar de ajustarse a un punto de referencia limitado.

Impacto Estratégico

Access and reach

Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.

Costo y presupuesto

Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.

Speed and scale

Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.

El futuro de OpenAI Whisper

Whisper se ha convertido en un elemento básico predeterminado para la transcripción y la tendencia es hacia variantes más rápidas, más pequeñas y en tiempo real que se ejecutan en teléfonos y dispositivos perimetrales. Espere un soporte de transmisión más estricto, una mejor separación de los hablantes y la integración con modelos de lenguaje grandes para limpieza, resúmenes y subtítulos en vivo. Los pesos abiertos significan que la comunidad sigue optimizándolos, mientras que OpenAI y otros impulsan modelos de habla más nuevos. Reducir los textos alucinados, especialmente en el uso médico y legal, sigue siendo una prioridad activa.

Implementación en el mundo real

Un periodista transcribe entrevistas grabadas automáticamente en lugar de escribirlas a mano

Una plataforma de podcast genera transcripciones y subtítulos con capacidad de búsqueda para cada episodio.

Una herramienta para reuniones produce subtítulos en vivo y un registro escrito de una videollamada

Un investigador traduce grabaciones de campo habladas a texto en inglés para su análisis

Riesgos y barandillas

Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.

La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.

El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.

Hoja de ruta de implementación

1

Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.

2

Pruebe la calidad en diversos oradores y condiciones de fondo.

3

Defina cuándo un humano debe revisar o aprobar los resultados.

4

Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the OpenAI Whisper quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Alineación de palabras con marca de tiempo de Whisper

Preguntas frecuentes

What is OpenAI Whisper?

Whisper es el sistema de reconocimiento automático de voz de código abierto de OpenAI que transcribe y traduce audio hablado en docenas de idiomas. Es importante porque brindó una transcripción sólida, gratuita y casi humana a cualquiera que pueda ejecutar el modelo.

¿Cuál es el propósito principal del Whisper de OpenAI?

Whisper es un sistema automático de reconocimiento de voz que transcribe y traduce audio hablado en muchos idiomas.

¿Aproximadamente en cuánto audio se entrenó Whisper?

Whisper se entrenó con aproximadamente 680.000 horas de audio multilingüe y multitarea recopilado de la web, lo que impulsa su solidez.

¿Qué representación de audio procesa el codificador de Whisper?

El audio se convierte en un espectrograma log-Mel, una representación del contenido de frecuencia a lo largo del tiempo, que lee el codificador Transformer.

¿Qué capacidad NO proporciona Whisper de forma nativa?

Whisper maneja la transcripción, la traducción al inglés, la detección de idioma y las marcas de tiempo, pero no es un generador de videos.

¿Por qué Whisper provocó una ola de herramientas y aplicaciones comunitarias?

Debido a que OpenAI fue de código abierto para los pesos y el código, los desarrolladores pudieron ejecutar Whisper localmente y crear muchas herramientas y reimplementaciones más rápidas.