Nyelvi AI ÚTMUTATÓ

Fordító átok az LLM-ekben

A fordított átok egy meglepő kudarc mód, amikor egy nyelvi modell, amely megtanulja, hogy „A az B”, nem tud megbízhatóan válaszolni „B az A”. Ebből kiderül, hogy az LLM-ek a tényeket egyirányú asszociációként tárolják, nem pedig szimmetrikus tudásként.

2 perc olvasásUtoljára frissítve

Mély merülés

Berglund és munkatársai egy 2023-as tanulmányában dokumentálták, hogy a fordított átok azt mutatja, hogy ha egy modellt a „Tom Cruise anyja Mary Lee Pfeiffer” témában képeznek ki, az gyakran kudarcot vall, amikor megkérdezik: „Ki Mary Lee Pfeiffer fia?” bár a válasz logikailag azonos. A hatás a modellméretek között, sőt több száz ilyen tény finomhangolása után is fennáll. Ez nem memóriarés: a modell látta az információt, de csak egy sorrendben. Mivel a képzés optimalizálja a következő token előrejelzését az adatok pontos szórendje alapján, az A-tól B-ig tartó statisztikai kapcsolat nem hoz létre automatikusan B-ből A-ba linket. A megállapítás megkérdőjelezte azokat a feltételezéseket, amelyek a skála önmagában rugalmas, emberszerű érvelést eredményez a tények felett.

Technikai betekintés

A transzformátorok úgy tanulnak, hogy megjósolják a következő tokent egy adott korábbi kontextusban, ezért a gradiens frissítések erősítik az „A, majd B” irányleképezést, de érintetlenül hagyják a „B, majd A”-t, kivéve, ha ez a sorrend a képzésben is megjelenik. A két irány külön súlypályán él. A kutatók ezt a log-valószínűség mérésével erősítették meg: egy előremutató tény megismerése után a fordított állítás valószínűsége az alapvonal közelében maradt, ami azt mutatja, hogy a képzés során nem fordult elő implicit logikai inverzió.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

A visszafordító átok jövője az LLM-ekben

A vizsgált mérséklések közé tartozik a kétirányú adatbővítés (fordított kifejezések hozzáadása), a képzési célok, amelyek mindkét irányban előrejelzik a tokeneket, és a visszakereső rendszerek, amelyek szimmetrikusan keresik a tényeket, nem pedig a memorizált súlyokra hagyatkoznak. Néhány újabb architektúra és fordított előképzési kísérlet csökkenti a különbséget. Számíts arra, hogy az átok összezsugorodik, de nem tűnik el, mivel mély eltérést tár fel a következő jelű tanulás és a valós viszonyok szimmetrikus struktúrája között.

Valós megvalósítás

A chatbot helyesen adja meg egy híresség szülőjét, de kudarcot vall, amikor arra kérik, hogy nevezze meg a szülő híres gyermekét.

Egy modell azt mondja, hogy „a kilencedik elnök William Henry Harrison volt”, de megbotlik, hogy „melyik elnök volt William Henry Harrison”.

A függvény-leírás leképezést megtanuló kódoló asszisztens nem tudja visszaállítani a függvény nevét önmagában a leírásból.

Az „X gyógyszer kezeli az Y állapotot” című orvosi minőségbiztosítási rendszer nem sorolja fel az X gyógyszert, amikor megkérdezik, hogy mi kezeli az Y állapotot.

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reversal Curse in LLMs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Reversal Curse in LLMs?

A fordított átok egy meglepő kudarc mód, amikor egy nyelvi modell, amely megtanulja, hogy „A az B”, nem tud megbízhatóan válaszolni „B az A”. Ebből kiderül, hogy az LLM-ek a tényeket egyirányú asszociációként tárolják, nem pedig szimmetrikus tudásként.

Mit ír le a fordított átok?

A fordított átok az, hogy az 'A az B' gyakorlatból nem lehet következtetni, hogy 'B A', annak ellenére, hogy a kettő logikailag egyenértékű.

Miért fordul elő mechanikusan a fordított átok?

Mivel a képzés optimalizálja a következő token előrejelzését a pontos megfigyelt sorrendben, a fordított leképezés soha nem erősödik meg, hacsak nem jelenik meg a képzésben is.

A modellméret növelése megbízhatóan orvosolja a visszafordítási átkot?

Az eredeti tanulmány azt találta, hogy az átok a modellméretek tartományában rejlik, ami azt jelzi, hogy a méret önmagában nem oldja meg.

Melyik mérséklés célozza közvetlenül a visszafordító átkot?

A kétirányú adatkiegészítés felfedi a modellt az 'A jelentése B' és 'B is A' jeleknek, létrehozva a hiányzó fordított asszociációt.

Hogyan erősítették meg a kutatók, hogy a modell implicit módon nem tudta meg a fordított tényt?

A fordított állítás valószínűsége az alapvonal közelében maradt az előrehaladás után, ami azt mutatja, hogy nem történt logikai inverzió.