Fordító átok az LLM-ekben
A fordított átok egy meglepő kudarc mód, amikor egy nyelvi modell, amely megtanulja, hogy „A az B”, nem tud megbízhatóan válaszolni „B az A”. Ebből kiderül, hogy az LLM-ek a tényeket egyirányú asszociációként tárolják, nem pedig szimmetrikus tudásként.
Mély merülés
Berglund és munkatársai egy 2023-as tanulmányában dokumentálták, hogy a fordított átok azt mutatja, hogy ha egy modellt a „Tom Cruise anyja Mary Lee Pfeiffer” témában képeznek ki, az gyakran kudarcot vall, amikor megkérdezik: „Ki Mary Lee Pfeiffer fia?” bár a válasz logikailag azonos. A hatás a modellméretek között, sőt több száz ilyen tény finomhangolása után is fennáll. Ez nem memóriarés: a modell látta az információt, de csak egy sorrendben. Mivel a képzés optimalizálja a következő token előrejelzését az adatok pontos szórendje alapján, az A-tól B-ig tartó statisztikai kapcsolat nem hoz létre automatikusan B-ből A-ba linket. A megállapítás megkérdőjelezte azokat a feltételezéseket, amelyek a skála önmagában rugalmas, emberszerű érvelést eredményez a tények felett.
Technikai betekintés
A transzformátorok úgy tanulnak, hogy megjósolják a következő tokent egy adott korábbi kontextusban, ezért a gradiens frissítések erősítik az „A, majd B” irányleképezést, de érintetlenül hagyják a „B, majd A”-t, kivéve, ha ez a sorrend a képzésben is megjelenik. A két irány külön súlypályán él. A kutatók ezt a log-valószínűség mérésével erősítették meg: egy előremutató tény megismerése után a fordított állítás valószínűsége az alapvonal közelében maradt, ami azt mutatja, hogy a képzés során nem fordult elő implicit logikai inverzió.
Stratégiai hatás
Sebesség és méretarány
A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.
Hozzáférés és elérés
Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.
Tisztább döntések
A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.
A visszafordító átok jövője az LLM-ekben
A vizsgált mérséklések közé tartozik a kétirányú adatbővítés (fordított kifejezések hozzáadása), a képzési célok, amelyek mindkét irányban előrejelzik a tokeneket, és a visszakereső rendszerek, amelyek szimmetrikusan keresik a tényeket, nem pedig a memorizált súlyokra hagyatkoznak. Néhány újabb architektúra és fordított előképzési kísérlet csökkenti a különbséget. Számíts arra, hogy az átok összezsugorodik, de nem tűnik el, mivel mély eltérést tár fel a következő jelű tanulás és a valós viszonyok szimmetrikus struktúrája között.
Valós megvalósítás
A chatbot helyesen adja meg egy híresség szülőjét, de kudarcot vall, amikor arra kérik, hogy nevezze meg a szülő híres gyermekét.
Egy modell azt mondja, hogy „a kilencedik elnök William Henry Harrison volt”, de megbotlik, hogy „melyik elnök volt William Henry Harrison”.
A függvény-leírás leképezést megtanuló kódoló asszisztens nem tudja visszaállítani a függvény nevét önmagában a leírásból.
Az „X gyógyszer kezeli az Y állapotot” című orvosi minőségbiztosítási rendszer nem sorolja fel az X gyógyszert, amikor megkérdezik, hogy mi kezeli az Y állapotot.
Kockázatok és védőkorlátok
A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.
Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.
Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.
Végrehajtási ütemterv
A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.
Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.
Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.
Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Reversal Curse in LLMs quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
ChatGPT és LLM-ek
Gyakran ismételt kérdések
What is Reversal Curse in LLMs?
A fordított átok egy meglepő kudarc mód, amikor egy nyelvi modell, amely megtanulja, hogy „A az B”, nem tud megbízhatóan válaszolni „B az A”. Ebből kiderül, hogy az LLM-ek a tényeket egyirányú asszociációként tárolják, nem pedig szimmetrikus tudásként.
Mit ír le a fordított átok?
A fordított átok az, hogy az 'A az B' gyakorlatból nem lehet következtetni, hogy 'B A', annak ellenére, hogy a kettő logikailag egyenértékű.
Miért fordul elő mechanikusan a fordított átok?
Mivel a képzés optimalizálja a következő token előrejelzését a pontos megfigyelt sorrendben, a fordított leképezés soha nem erősödik meg, hacsak nem jelenik meg a képzésben is.
A modellméret növelése megbízhatóan orvosolja a visszafordítási átkot?
Az eredeti tanulmány azt találta, hogy az átok a modellméretek tartományában rejlik, ami azt jelzi, hogy a méret önmagában nem oldja meg.
Melyik mérséklés célozza közvetlenül a visszafordító átkot?
A kétirányú adatkiegészítés felfedi a modellt az 'A jelentése B' és 'B is A' jeleknek, létrehozva a hiányzó fordított asszociációt.
Hogyan erősítették meg a kutatók, hogy a modell implicit módon nem tudta meg a fordított tényt?
A fordított állítás valószínűsége az alapvonal közelében maradt az előrehaladás után, ami azt mutatja, hogy nem történt logikai inverzió.