GUÍA de IA en idiomas

Arquitecturas de codificador-decodificador

Las arquitecturas de codificador-decodificador dividen un modelo en dos mitades: una que lee y comprime una entrada en una rica representación interna y otra que genera una salida a partir de ella.

2 minutos de lecturaÚltima actualización

Descripción general

This design powers translation, summarization, and any task where the input and output are different sequences.

Buceo profundo

Un modelo codificador-decodificador procesa un problema en dos etapas. El codificador lee toda la secuencia de entrada (digamos, una oración en inglés) y la convierte en un conjunto de vectores contextuales que capturan el significado. Luego, el decodificador produce la secuencia de salida (digamos, en francés), un token a la vez, mirando hacia atrás a sus propias salidas anteriores y a las representaciones del codificador. El Transformer original de 2017 era un codificador-decodificador creado para la traducción. Modelos como T5 y BART utilizan esta forma y encuadran cada tarea como entrada y salida de texto. La división es poderosa porque el codificador puede ver toda la entrada a la vez (contexto bidireccional), mientras que el decodificador genera de izquierda a derecha. Esto hace que el diseño se ajuste naturalmente a los problemas de secuencia a secuencia donde la longitud y el contenido de la salida difieren de los de la entrada.

Información técnica

El codificador utiliza autoatención bidireccional, por lo que cada token de entrada atiende a todos los demás tokens a la vez. El decodificador es autorregresivo y utiliza autoatención enmascarada, lo que significa que cada posición solo puede ver posiciones anteriores para preservar la generación causal. Conectarlos supone una atención cruzada: las capas del decodificador consultan los estados ocultos finales del codificador. Esta separación permite al codificador generar una comprensión completa e independiente del orden, mientras que el decodificador se compromete con un token a la vez.

Impacto Estratégico

Speed and scale

Los flujos de trabajo lingüísticos pueden avanzar más rápido sin sacrificar la coherencia.

Access and reach

Amplía el acceso a través de idiomas y estilos de comunicación.

Decisiones más claras

Los equipos pueden dedicar más tiempo a juzgar mientras la automatización se encarga de la repetición.

El futuro de las arquitecturas codificador-decodificador

Los modelos exclusivos para decodificadores, como GPT, ahora dominan el chat de uso general porque una sola pila se escala de manera sencilla y maneja muchas tareas mediante indicaciones. Pero persisten los diseños de codificador-decodificador donde la comprensión de la entrada y la generación de la salida son genuinamente distintas: reconocimiento de voz (Whisper), resumen de documentos y sistemas multimodales que combinan un codificador de visión con un decodificador de texto. Espere arquitecturas híbridas que tomen prestada la comprensión bidireccional del codificador para la recuperación y conexión a tierra mientras mantienen la flexibilidad del decodificador, especialmente cuando los modelos fusionan texto, audio e imágenes.

Implementación en el mundo real

Google Translate y DeepL utilizan transformadores codificadores-decodificadores para asignar una oración de un idioma a otro.

Whisper de OpenAI codifica espectrogramas de audio y los decodifica en texto transcrito o traducido.

T5 y BART potencian el resumen abstractivo, condensando artículos extensos en resúmenes breves.

Los sistemas de subtítulos de imágenes combinan un codificador de visión con un decodificador de texto para describir fotografías con palabras.

Riesgos y barandillas

Los hechos alucinados pueden aparecer silenciosamente en informes, flujos de apoyo o resultados de investigaciones.

La sensibilidad rápida puede crear resultados inconsistentes en solicitudes similares.

Los datos de texto confidenciales pueden quedar expuestos si los controles de acceso son débiles.

Hoja de ruta de implementación

1

Defina el formato de salida, el tono y los estándares de calidad antes del lanzamiento.

2

Respuestas terrestres con fuentes confiables siempre que la precisión sea importante.

3

Mantenga un punto de control de revisión humana para los resultados de alto riesgo.

4

Realice un seguimiento de los patrones de error y vuelva a capacitar las indicaciones o los flujos de trabajo con regularidad.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Encoder-Decoder Architectures quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Codificadores cruzados frente a codificadores bi

Preguntas frecuentes

What is Encoder-Decoder Architectures?

Las arquitecturas de codificador-decodificador dividen un modelo en dos mitades: una que lee y comprime una entrada en una rica representación interna y otra que genera una salida a partir de ella. Este diseño potencia la traducción, el resumen y cualquier tarea en la que la entrada y la salida sean secuencias diferentes.

¿Cuál es la función principal del codificador en un modelo codificador-decodificador?

El codificador consume toda la secuencia de entrada y produce vectores contextuales que capturan su significado, que luego utiliza el decodificador.

¿Por qué el decodificador utiliza la autoatención enmascarada (causal)?

El enmascaramiento garantiza que cada posición de salida solo atienda las posiciones anteriores, preservando el orden de generación autorregresivo de izquierda a derecha.

¿Qué mecanismo conecta el decodificador con las representaciones del codificador?

La atención cruzada permite que cada capa de decodificador consulte los estados ocultos del codificador, vinculando la comprensión de la entrada con la generación de la salida.

¿Cuál de estos modelos es una arquitectura codificador-decodificador (secuencia a secuencia)?

T5 (y BART) son modelos clásicos de codificador-decodificador que encuadran las tareas como texto a texto. BERT es solo codificador y GPT-3 es solo decodificador.

¿Por qué el diseño codificador-decodificador es una opción natural para la traducción?

La traducción asigna una secuencia a otra diferente, por lo que leer toda la fuente (codificador) y generar un nuevo destino (decodificador) encaja perfectamente.