Kódoló-dekódoló architektúrák
A kódoló-dekódoló architektúrák két részre osztják a modellt: az egyikre, amely beolvassa és tömöríti a bemenetet egy gazdag belső reprezentációba, a másikra pedig egy kimenetet generál belőle.
Áttekintés
This design powers translation, summarization, and any task where the input and output are different sequences.
Mély merülés
A kódoló-dekódoló modell két lépésben dolgoz fel egy problémát. A kódoló beolvassa a teljes bemeneti sorozatot (mondjuk egy angol mondatot), és kontextuális vektorok készletévé alakítja, amelyek rögzítik a jelentést. A dekóder ezután egyenként állítja elő a kimeneti sorozatot (mondjuk franciát), visszatekintve saját korábbi kimeneteire és a kódoló reprezentációira. Az eredeti 2017-es Transformer egy fordításra készült kódoló-dekódoló volt. Az olyan modellek, mint a T5 és a BART, ezt az alakzatot használják, és minden feladatot be- és szövegkiadásként kereteznek. A felosztás erőteljes, mert a kódoló egyszerre látja a teljes bemenetet (kétirányú kontextus), míg a dekóder balról jobbra irányú irányú generálást végez. Ezáltal a tervezés természetes módon illeszkedik a sorozatok közötti problémákhoz, ahol a kimenet hossza és tartalma eltér a bemenettől.
Technikai betekintés
A kódoló kétirányú önfigyelést használ, így minden bemeneti token egyszerre kezeli az összes többi tokent. A dekóder autoregresszív, és maszkolt önfigyelmet használ, ami azt jelenti, hogy minden pozíció csak a korábbi pozíciókat láthatja az ok-okozati generálás megőrzése érdekében. Ezek összekapcsolása keresztfigyelem: a dekódoló rétegek lekérdezik a kódoló végső rejtett állapotait. Ez az elválasztás lehetővé teszi a kódoló számára, hogy teljes, sorrendtől független megértést építsen fel, miközben a dekódoló egyenként egy tokenre kötelezi el magát.
Stratégiai hatás
Sebesség és méretarány
A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.
Hozzáférés és elérés
Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.
Tisztább döntések
A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.
A kódoló-dekódoló architektúrák jövője
A csak dekóderrel használható modellek, mint például a GPT, ma már uralják az általános célú csevegést, mivel egyetlen verem egyszerűen skálázódik, és számos feladatot felkérésekkel kezel. De a kódoló-dekódoló rendszerek továbbra is fennállnak, ahol a bemeneti értelmezés és a kimenet generálása valóban különbözik: a beszédfelismerés (Whisper), a dokumentum-összegzés és a multimodális rendszerek, amelyek a képkódolót egy szövegdekódolóval párosítják. Olyan hibrid architektúrákra számíthat, amelyek a kódoló kétirányú megértését kölcsönzik a visszakereséshez és a földeléshez, miközben megőrzik a dekódoló rugalmasságát, különösen, ha a modellek szöveget, hangot és képeket egyesítenek.
Valós megvalósítás
Google A Translate és a DeepL kódoló-dekódoló Transformers segítségével képezi le az egyik nyelvű mondatot egy másik nyelvre.
A OpenAI Whisper-je audiospektrogramokat kódol, és átírt vagy lefordított szöveggé dekódolja azokat.
A T5 és BART teljesítmény absztrakciós összefoglalása, amely a hosszú cikkeket rövid összefoglalókba sűríti.
A képaláírási rendszerek a látáskódolót egy szövegdekódolóval párosítják, hogy szavakkal írják le a fényképeket.
Kockázatok és védőkorlátok
A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.
Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.
Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.
Végrehajtási ütemterv
A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.
Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.
Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.
Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Encoder-Decoder Architectures quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Cross-Encoder vs Bi-Encoders
Gyakran ismételt kérdések
What is Encoder-Decoder Architectures?
A kódoló-dekódoló architektúrák két részre osztják a modellt: az egyikre, amely beolvassa és tömöríti a bemenetet egy gazdag belső reprezentációba, a másikra pedig egy kimenetet generál belőle. Ez a kialakítás lehetővé teszi a fordítást, az összegzést és minden olyan feladatot, ahol a bemenet és a kimenet különböző sorrendben történik.
Mi a kódoló fő feladata egy kódoló-dekódoló modellben?
A kódoló felhasználja a teljes bemeneti szekvenciát, és kontextuális vektorokat állít elő, amelyek rögzítik a jelentését, amelyeket a dekódoló ezután felhasznál.
Miért használ a dekóder maszkolt (okozati) önfigyelmet?
A maszkolás biztosítja, hogy minden kimeneti pozíció csak a korábbi pozíciókat veszi figyelembe, megőrizve a balról jobbra mutató autoregresszív generálási sorrendet.
Milyen mechanizmus köti össze a dekódert a kódoló reprezentációival?
A keresztfigyelés lehetővé teszi, hogy minden dekódoló réteg lekérdezze a kódoló rejtett állapotait, összekapcsolva a bemenet megértését a kimenet generálásával.
Az alábbi modellek közül melyik kódoló-dekódoló (szekvencia-sorrend) architektúra?
A T5 (és a BART) klasszikus kódoló-dekódoló modellek, amelyek a feladatokat szövegként szöveggé alakítják. A BERT csak kódoló, a GPT-3 pedig csak dekódoló.
Miért ideális a kódoló-dekódoló kialakítása a fordításhoz?
A fordítás leképezi az egyik sorozatot egy másikra, így a teljes forrás (kódoló) kiolvasása és egy új cél (dekódoló) létrehozása tökéletesen illeszkedik.