Taal AI-GIDS

Omkeringsvloek in LLM's

De omkeringsvloek is een verrassende faalwijze waarbij een taalmodel dat leert 'A is B' niet op betrouwbare wijze kan antwoorden op 'B is A.' Het laat zien dat LLM's feiten opslaan als eenrichtingsassociaties, en niet als symmetrische kennis.

2 min readLaatst bijgewerkt

Diepe duik

De omkeervloek, gedocumenteerd in een artikel uit 2023 door Berglund en collega's, laat zien dat als een model wordt getraind op 'Tom Cruise's moeder is Mary Lee Pfeiffer', het vaak mislukt als wordt gevraagd 'Wie is de zoon van Mary Lee Pfeiffer?' ook al is het antwoord logisch identiek. Het effect blijft bestaan ​​bij alle modelgroottes en zelfs na verfijning van honderden van dergelijke feiten. Er is geen sprake van een geheugenkloof: het model heeft de informatie gezien, maar slechts in één volgorde. Omdat training de voorspelling van de volgende token optimaliseert op basis van de exacte woordvolgorde in de gegevens, creëert de statistische link van A naar B niet automatisch een link van B terug naar A. De bevinding daagde de aannames uit dat schaal alleen flexibele, mensachtige redeneringen over feiten oplevert.

Technisch inzicht

Transformers leren door het volgende token te voorspellen, gegeven de eerdere context, dus gradiëntupdates versterken de directionele mapping 'A, dan B', maar laten 'B dan A' onaangeroerd, tenzij die volgorde ook in de training verschijnt. De twee richtingen leven in afzonderlijke gewichtspaden. Onderzoekers bevestigden dit door de logwaarschijnlijkheden te meten: nadat ze een voorwaarts feit hadden geleerd, bleef de waarschijnlijkheid van de omgekeerde verklaring dichtbij de basislijn, wat aantoont dat er tijdens de training geen impliciete logische inversie heeft plaatsgevonden.

Strategische impact

Speed and scale

Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.

Access and reach

Het breidt de toegang uit naar meerdere talen en communicatiestijlen.

Clearer decisions

Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.

De toekomst van Reversal Curse in LLM's

Maatregelen die worden onderzocht zijn onder meer bidirectionele gegevensvergroting (het toevoegen van omgekeerde bewoordingen), trainingsdoelstellingen die tokens in beide richtingen voorspellen, en ophaalsystemen die feiten symmetrisch opzoeken in plaats van te vertrouwen op opgeslagen gewichten. Sommige nieuwere architecturen en experimenten met omgekeerde voortraining verkleinen de kloof. Verwacht dat de vloek zal afnemen maar niet zal verdwijnen, omdat het een diepe mismatch blootlegt tussen next-token learning en de symmetrische structuur van relaties in de echte wereld.

Implementatie in de echte wereld

Een chatbot vermeldt correct de ouder van een beroemdheid, maar faalt wanneer hem wordt gevraagd het beroemde kind van die ouder te noemen.

Een model zegt 'de negende president was William Henry Harrison', maar struikelt over 'welk nummer de president was William Henry Harrison.'

Een codeerassistent die een functie-naar-beschrijving-toewijzing heeft geleerd, kan de functienaam niet alleen uit de beschrijving halen.

Een medisch QA-systeem dat is getraind in 'Geneesmiddelen X behandelt aandoening Y' vermeldt geen geneesmiddel X wanneer wordt gevraagd wat aandoening Y behandelt.

Risico's en vangrails

Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.

Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.

Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.

Implementatie routekaart

1

Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.

2

Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.

3

Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.

4

Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reversal Curse in LLMs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

ChatGPT & LLM's

Frequently asked questions

What is Reversal Curse in LLMs?

De omkeringsvloek is een verrassende faalwijze waarbij een taalmodel dat leert 'A is B' niet op betrouwbare wijze kan antwoorden op 'B is A.' Het laat zien dat LLM's feiten opslaan als eenrichtingsassociaties, en niet als symmetrische kennis.

Wat beschrijft de omkeervloek?

De omkeervloek is het onvermogen om 'B is A' af te leiden uit de training over 'A is B', ondanks dat de twee logisch gelijkwaardig zijn.

Waarom vindt de omkeervloek mechanisch plaats?

Omdat training de voorspelling van het volgende token in de exact waargenomen volgorde optimaliseert, wordt de omgekeerde mapping nooit versterkt, tenzij deze ook tijdens de training voorkomt.

Kan het vergroten van de modelomvang op betrouwbare wijze de omkeringsvloek oplossen?

Uit het oorspronkelijke onderzoek bleek dat de vloek over een reeks modelgroottes heerste, wat aangeeft dat schaal alleen het probleem niet oplost.

Welke mitigatie is rechtstreeks gericht op de omkeringsvloek?

Bidirectionele gegevensvergroting stelt het model bloot aan zowel 'A is B' als 'B is A', waardoor de ontbrekende omgekeerde associatie ontstaat.

Hoe hebben onderzoekers bevestigd dat het model niet impliciet het omgekeerde feit had geleerd?

De waarschijnlijkheid van de omgekeerde verklaring bleef na voorwaartse training dichtbij de basislijn, wat aantoont dat er geen logische inversie had plaatsgevonden.