Encoder-decoder-architecturen
Encoder-decoder-architecturen splitsen een model in twee helften: een die een invoer leest en comprimeert tot een rijke interne representatie, en een die er een uitvoer uit genereert.
Overzicht
This design powers translation, summarization, and any task where the input and output are different sequences.
Diepe duik
Een encoder-decodermodel verwerkt een probleem in twee fasen. De encoder leest de volledige invoerreeks (bijvoorbeeld een Engelse zin) en verandert deze in een reeks contextuele vectoren die de betekenis vastleggen. De decoder produceert vervolgens de uitvoerreeks (bijvoorbeeld in het Frans) één token per keer, waarbij hij terugkijkt op zijn eigen eerdere uitvoer en op de representaties van de encoder. De originele Transformer uit 2017 was een encoder-decoder gebouwd voor vertaling. Modellen als T5 en BART gebruiken deze vorm en omlijsten elke taak als tekst-in, tekst-uit. De splitsing is krachtig omdat de encoder de hele invoer in één keer kan zien (bidirectionele context), terwijl de decoder van links naar rechts genereert. Dit maakt het ontwerp een natuurlijke oplossing voor sequentie-tot-sequentie-problemen waarbij de lengte en inhoud van de uitvoer verschillen van de invoer.
Technisch inzicht
De encoder maakt gebruik van bidirectionele zelfaandacht, zodat elk invoertoken in één keer aandacht besteedt aan elk ander token. De decoder is autoregressief en maakt gebruik van gemaskeerde zelfaandacht, wat betekent dat elke positie alleen eerdere posities kan zien om causale generatie te behouden. Het verbinden ervan is kruis-aandacht: decoderlagen ondervragen de uiteindelijke verborgen status van de encoder. Door deze scheiding kan de encoder een volledig, order-onafhankelijk begrip opbouwen, terwijl de decoder zich aan één token tegelijk vastlegt.
Strategische impact
Speed and scale
Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.
Access and reach
Het breidt de toegang uit naar meerdere talen en communicatiestijlen.
Clearer decisions
Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.
De toekomst van encoder-decoder-architecturen
Modellen die alleen voor decoders geschikt zijn, zoals GPT, domineren nu de chat voor algemeen gebruik, omdat een enkele stapel eenvoudig kan worden geschaald en veel taken via prompts kan afhandelen. Maar de ontwerpen van encoder-decoder blijven bestaan waar het begrip van input en het genereren van output echt van elkaar verschillen: spraakherkenning (Whisper), samenvatting van documenten en multimodale systemen die een vision-encoder koppelen aan een tekstdecoder. Verwacht hybride architecturen die het bidirectionele begrip van de encoder lenen voor ophalen en aarden, terwijl de flexibiliteit van de decoder behouden blijft, vooral omdat modellen tekst, audio en afbeeldingen samensmelten.
Implementatie in de echte wereld
Google Translate en DeepL gebruiken encoder-decoder Transformers om een zin in de ene taal in de andere om te zetten.
OpenAI's Whisper codeert audiospectrogrammen en decodeert ze in getranscribeerde of vertaalde tekst.
T5 en BART maken abstracte samenvattingen mogelijk, waarbij lange artikelen worden samengevoegd tot korte samenvattingen.
Systemen voor ondertiteling van afbeeldingen combineren een vision-encoder met een tekstdecoder om foto's in woorden te beschrijven.
Risico's en vangrails
Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.
Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.
Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.
Implementatie routekaart
Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.
Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.
Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.
Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Encoder-Decoder Architectures quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Cross-encoders versus bi-encoders
Frequently asked questions
What is Encoder-Decoder Architectures?
Encoder-decoder-architecturen splitsen een model in twee helften: een die een invoer leest en comprimeert tot een rijke interne representatie, en een die er een uitvoer uit genereert. Dit ontwerp maakt vertaling, samenvatting en elke taak waarbij de invoer en uitvoer verschillende reeksen zijn mogelijk.
Wat is de belangrijkste taak van de encoder in een encoder-decodermodel?
De encoder verbruikt de volledige invoerreeks en produceert contextuele vectoren die de betekenis ervan vastleggen, die de decoder vervolgens gebruikt.
Waarom gebruikt de decoder gemaskeerde (causale) zelfaandacht?
Maskering zorgt ervoor dat elke uitvoerpositie alleen betrekking heeft op eerdere posities, waarbij de autoregressieve generatievolgorde van links naar rechts behouden blijft.
Welk mechanisme verbindt de decoder met de representaties van de encoder?
Door kruisaandacht kan elke decoderlaag de verborgen toestanden van de encoder opvragen, waardoor het begrijpen van de invoer wordt gekoppeld aan het genereren van de uitvoer.
Welke van deze modellen is een encoder-decoder-architectuur (sequentie-tot-sequentie)?
T5 (en BART) zijn klassieke encoder-decodermodellen die taken als tekst-naar-tekst framen. BERT is alleen voor encoders en GPT-3 is alleen voor decoders.
Waarom is het ontwerp van de encoder-decoder geschikt voor vertaling?
De vertaling koppelt de ene reeks aan de andere, dus het lezen van de hele bron (encoder) en het genereren van een nieuw doel (decoder) past perfect.