GUÍA de IA en audio

Escuchar, asistir y deletrear

Listen, Attend and Spell (LAS) es una red neuronal histórica de 2015 que transcribe el habla directamente en caracteres, sin un diccionario de pronunciación hecho a mano ni un modelo de lenguaje separado.

2 minutos de lecturaÚltima actualización

Descripción general

It showed that a single end-to-end model could do speech recognition.

Buceo profundo

Listen, Attend and Spell, presentado por los investigadores de Google Chan, Jaitly, Le y Vinyals en 2015, fue uno de los primeros reconocedores de voz verdaderos de un extremo a otro. Tiene dos partes: un 'Listener', un LSTM piramidal bidireccional que codifica el audio mientras reduce la dimensión del tiempo, y un 'Speller', un decodificador LSTM basado en la atención que emite caracteres uno a la vez. El mecanismo de atención permite al Speller centrarse en el fragmento de audio relevante para cada letra de salida. A diferencia de las canalizaciones HMM-DNN más antiguas, LAS no necesita diccionario de fonemas, alineación forzada ni modelo de lenguaje entrenado por separado; aprende ortografía, límites de palabras y acústica de forma conjunta a partir de audio transcrito. Inspiró directamente los sistemas ASR modernos de secuencia a secuencia y basados ​​en la atención.

Información técnica

LAS combina codificador-decodificador con atención. El codificador piramidal LSTM reduce a la mitad la resolución temporal en cada una de las tres capas, cortando una secuencia acústica larga en una longitud manejable para que la atención sea manejable. En cada paso de decodificación, el Speller calcula los pesos de atención de todos los estados del codificador, los combina en un vector de contexto y predice el siguiente carácter. El entrenamiento maximiza la probabilidad de la secuencia correcta de caracteres; un truco de muestreo programado reduce la discrepancia entre el tren y la prueba.

Impacto Estratégico

Access and reach

Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.

Costo y presupuesto

Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.

Speed and scale

Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.

El futuro de escuchar, asistir y deletrear

LAS ahora es histórico, pero su ADN está presente en todos los sistemas ASR modernos. Su idea de codificador-decodificador basado en la atención evolucionó hacia los reconocedores Transformer y Conformer, mientras que enfoques relacionados como RNN-Transducer potencian el dictado en el dispositivo. Los sistemas futuros continúan esta trayectoria de extremo a extremo, fusionando el reconocimiento con la traducción y la comprensión en modelos multilingües únicos, y avanzando hacia la transcripción de baja latencia y transmisión que LAS, al no ser de transmisión, no podía proporcionar originalmente.

Implementación en el mundo real

Transcribir el inglés hablado directamente a letras sin un diccionario de pronunciación

Sirviendo como base conceptual para sistemas de subtítulos y dictado de voz basados en la atención.

Demostración de capacitación integral para cursos y puntos de referencia académicos de reconocimiento de voz

Modelos inspiradores de secuencia a secuencia utilizados posteriormente en procesos de traducción de voz

Riesgos y barandillas

Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.

La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.

El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.

Hoja de ruta de implementación

1

Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.

2

Pruebe la calidad en diversos oradores y condiciones de fondo.

3

Defina cuándo un humano debe revisar o aprobar los resultados.

4

Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Listen Attend and Spell quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Etiquetado automático de música

Preguntas frecuentes

What is Listen Attend and Spell?

Listen, Attend and Spell (LAS) es una red neuronal histórica de 2015 que transcribe el habla directamente en caracteres, sin un diccionario de pronunciación hecho a mano ni un modelo de lenguaje separado. Demostró que un único modelo de extremo a extremo podía realizar reconocimiento de voz.

¿Cuáles son los dos componentes principales del modelo LAS?

LAS consta de un codificador 'Listener' que procesa el audio y un decodificador basado en la atención 'Speller' que emite caracteres.

¿Qué produce el Speller en LAS?

El Speller es un decodificador que produce la transcripción carácter a carácter, aprendiendo la ortografía directamente.

¿Por qué el codificador LAS se llama "piramidal"?

Cada capa del BLSTM piramidal reduce a la mitad la longitud de la secuencia, acortando la secuencia de audio larga para que la atención sea computacionalmente factible.

¿Qué componente más antiguo NO requiere LAS?

A diferencia de los canales HMM-DNN clásicos, LAS aprende directamente de pares de audio a texto sin diccionario de fonemas ni alineación forzada.

¿Qué mecanismo permite al Speller centrarse en la parte relevante del audio de cada carácter?

Un mecanismo de atención calcula los pesos de los estados del codificador, formando un vector de contexto que el decodificador utiliza en cada paso.