Taal AI-GIDS

Zelf-RAG en reflectief ophalen

Self-RAG is een raamwerk waarin een taalmodel beslist wanneer het moet worden opgehaald en vervolgens zowel de opgehaalde passages als de eigen uitvoer bekritiseert met behulp van speciale reflectietokens.

2 min readLaatst bijgewerkt

Overzicht

It matters because it makes retrieval-augmented generation adaptive and self-checking instead of blindly fetching documents for every query.

Diepe duik

Standaard RAG haalt voor elke invoer een vast aantal passages op, zelfs als die niet nodig zijn, en verifieert nooit of het antwoord daadwerkelijk wordt ondersteund. Self-RAG, geïntroduceerd door Asai en collega's in 2023, traint een enkel model om drie dingen op aanvraag te doen. Ten eerste zendt het een 'ophaal'-token uit dat bepaalt of externe kennis überhaupt nodig is. Ten tweede geeft het na het ophalen 'IsRelevant'-kritiekfiches uit, waarbij wordt beoordeeld of elke passage helpt. Ten derde genereert het 'IsSupported'- en 'IsUseful'-tokens waarmee wordt beoordeeld of de eigen verklaringen op het bewijsmateriaal zijn gebaseerd en hoe goed de reactie is. Met deze reflectietokens kan het systeem alleen ophalen als dit gerechtvaardigd is, irrelevante passages filteren en de voorkeur geven aan outputs die het model zelf als goed ondersteund beoordeelt, waardoor hallucinaties worden verminderd.

Technisch inzicht

Self-RAG wordt getraind via begeleid leren op gegevens die zijn gelabeld met reflectietokens, vaak gedestilleerd uit een sterker model zoals GPT-4. Bij gevolgtrekking verweeft het model gewone teksttokens met deze speciale controletokens. Een beam-zoekopdracht op segmentniveau kan vervolgens kandidaat-voortzettingen scoren met behulp van de kansen van de kritiektokens, waardoor ontwikkelaars het gedrag tijdens de runtime kunnen afstemmen - bijvoorbeeld door 'IsSupported' zwaarder te wegen om de feitelijke basis versus de vloeiendheid te maximaliseren.

Strategische impact

Speed and scale

Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.

Access and reach

Het breidt de toegang uit naar meerdere talen en communicatiestijlen.

Clearer decisions

Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.

De toekomst van zelf-RAG en reflectief ophalen

Reflective retrieval convergeert met agentic RAG, waarbij modellen zoekopdrachten in meerdere stappen plannen, tools aanroepen en zichzelf corrigeren in verschillende iteraties. Verwacht een nauwere integratie van zelfkritiek met verificatiemodellen, het ophalen van kennisgrafieken en versterkend leren dat getrouwe, goed geciteerde antwoorden beloont. Naarmate redeneermodellen volwassener worden, zal on-demand en zelf-geëvalueerd ophalen waarschijnlijk een standaardgedrag worden in plaats van een afzonderlijk raamwerk, waarbij het model dynamisch bepaalt hoeveel bewijs elke claim vereist.

Implementatie in de echte wereld

Een medisch vraag- en antwoordassistent haalt alleen richtlijnen op voor klinische vragen en slaat het ophalen voor begroetingen over, met behulp van zijn beslissingstoken 'ophalen'.

Een onderzoeksassistent filtert off-topic zoekhits door de 'IsRelevant'-kritiek van elke passage te controleren voordat hij schrijft.

Een zakelijke chatbot geeft de voorkeur aan antwoorden met de tag 'IsSupported', zodat zijn uitspraken geworteld blijven in bedrijfsdocumenten, waardoor hallucinaties worden verminderd.

Een tool voor feitencontrole gebruikt de 'IsUseful'-score om meerdere antwoorden van kandidaten te rangschikken en de best bewezen antwoorden naar boven te halen.

Risico's en vangrails

Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.

Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.

Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.

Implementatie routekaart

1

Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.

2

Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.

3

Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.

4

Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Self-RAG and Reflective Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Speculatieve RAG en Retrieval-Augmented Drafting

Frequently asked questions

What is Self-RAG and Reflective Retrieval?

Self-RAG is een raamwerk waarin een taalmodel beslist wanneer het moet worden opgehaald en vervolgens zowel de opgehaalde passages als de eigen uitvoer bekritiseert met behulp van speciale reflectietokens. Het is van belang omdat het door het ophalen aangevuld genereren adaptief en zelfcontrolerend maakt, in plaats van blindelings documenten op te halen voor elke zoekopdracht.

Welke belangrijke beslissing neemt Self-RAG die de standaard RAG niet doet?

Self-RAG zendt een 'ophaal'-token uit om op aanvraag te beslissen of externe documenten nodig zijn, in plaats van altijd op te halen.

Wat zijn 'reflectietokens' in Self-RAG?

Reflectietokens zoals IsRelevant, IsSupported en IsUseful laten het model passages en zijn eigen uitvoer bekritiseren.

Welk reflectietoken beoordeelt of een gegenereerde verklaring gegrond is op het opgehaalde bewijsmateriaal?

Het IsSupported-token beoordeelt of de claim van het model daadwerkelijk wordt ondersteund door de gevonden passages, waardoor hallucinaties worden verminderd.

Hoe wordt een Self-RAG-model doorgaans getraind om reflectietokens te produceren?

Self-RAG leert van trainingsgegevens die zijn geannoteerd met reflectietokens, die vaak worden gegenereerd door een capabeler lerarenmodel zoals GPT-4.

Welk voordeel biedt het uiten van een ‘IsRelevant’-kritiek voor elke passage?

Door de relevantie van elke passage te bekritiseren, kan Self-RAG off-topic verwijzingen negeren in plaats van ze in het antwoord te stoppen.