GUIDE IA du langage

Architectures codeurs-décodeurs

Les architectures codeur-décodeur divisent un modèle en deux moitiés : l'une qui lit et compresse une entrée dans une représentation interne riche, et l'autre qui génère une sortie à partir de celle-ci.

2 minutes de lectureDernière mise à jour

Aperçu

This design powers translation, summarization, and any task where the input and output are different sequences.

Plongée profonde

Un modèle codeur-décodeur traite un problème en deux étapes. L'encodeur lit l'intégralité de la séquence d'entrée (par exemple, une phrase anglaise) et la transforme en un ensemble de vecteurs contextuels qui capturent le sens. Le décodeur produit ensuite la séquence de sortie (disons, en français) un jeton à la fois, en regardant ses propres sorties précédentes et les représentations de l'encodeur. Le Transformer original 2017 était un encodeur-décodeur conçu pour la traduction. Des modèles comme T5 et BART utilisent cette forme et encadrent chaque tâche sous forme d'entrée et de sortie de texte. Le fractionnement est puissant car l'encodeur peut voir l'intégralité de l'entrée à la fois (contexte bidirectionnel), tandis que le décodeur génère de gauche à droite. Cela fait de la conception un choix naturel pour les problèmes de séquence à séquence où la longueur et le contenu de la sortie diffèrent de ceux de l'entrée.

Aperçu technique

L'encodeur utilise une auto-attention bidirectionnelle, de sorte que chaque jeton d'entrée s'occupe de tous les autres jetons à la fois. Le décodeur est autorégressif et utilise une auto-attention masquée, ce qui signifie que chaque position ne peut voir que les positions antérieures pour préserver la génération causale. Leur connexion nécessite une attention croisée : les couches de décodeur interrogent les états cachés finaux de l'encodeur. Cette séparation permet à l'encodeur de construire une compréhension complète et indépendante de l'ordre tandis que le décodeur s'engage sur un jeton à la fois.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L’avenir des architectures codeurs-décodeurs

Les modèles uniquement décodeurs comme GPT dominent désormais le chat à usage général, car une seule pile évolue simplement et gère de nombreuses tâches via des invites. Mais les conceptions codeur-décodeur persistent là où la compréhension des entrées et la génération des sorties sont véritablement distinctes : reconnaissance vocale (Whisper), résumé de documents et systèmes multimodaux associant un encodeur de vision à un décodeur de texte. Attendez-vous à des architectures hybrides qui empruntent la compréhension bidirectionnelle de l'encodeur pour la récupération et la mise à la terre tout en conservant la flexibilité du décodeur, d'autant plus que les modèles fusionnent le texte, l'audio et les images.

Mise en œuvre dans le monde réel

Google Translate et DeepL utilisent des transformateurs encodeurs-décodeurs pour mapper une phrase d'une langue à une autre.

Whisper de OpenAI encode les spectrogrammes audio et les décode en texte transcrit ou traduit.

T5 et BART proposent un résumé abstrait, condensant de longs articles en courts résumés.

Les systèmes de sous-titrage d'images associent un encodeur de vision à un décodeur de texte pour décrire les photos avec des mots.

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Encoder-Decoder Architectures quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Encodeurs croisés vs bi-encodeurs

Questions fréquemment posées

What is Encoder-Decoder Architectures?

Les architectures codeur-décodeur divisent un modèle en deux moitiés : l'une qui lit et compresse une entrée dans une représentation interne riche, et l'autre qui génère une sortie à partir de celle-ci. Cette conception permet la traduction, le résumé et toute tâche où l'entrée et la sortie sont des séquences différentes.

Quelle est la fonction principale du codeur dans un modèle codeur-décodeur ?

L'encodeur consomme la totalité de la séquence d'entrée et produit des vecteurs contextuels capturant sa signification, que le décodeur utilise ensuite.

Pourquoi le décodeur utilise-t-il une auto-attention masquée (causale) ?

Le masquage garantit que chaque position de sortie ne s'occupe que des positions antérieures, préservant l'ordre de génération autorégressif de gauche à droite.

Quel mécanisme relie le décodeur aux représentations du codeur ?

L'attention croisée permet à chaque couche de décodeur d'interroger les états cachés de l'encodeur, liant la compréhension de l'entrée à la génération de la sortie.

Lequel de ces modèles est une architecture codeur-décodeur (séquence à séquence) ?

T5 (et BART) sont des modèles d'encodeur-décodeur classiques qui encadrent les tâches sous forme de texte à texte. BERT est uniquement pour l'encodeur et GPT-3 est uniquement pour le décodeur.

Pourquoi la conception codeur-décodeur est-elle un choix naturel pour la traduction ?

La traduction mappe une séquence sur une autre, donc la lecture de la source entière (encodeur) et la génération d'une nouvelle cible (décodeur) s'adaptent parfaitement.