GUIDA ALL'AI linguistica

Self-RAG e recupero riflessivo

Self-RAG è un framework in cui un modello linguistico decide quando recuperare, quindi critica sia i passaggi recuperati che il proprio output utilizzando speciali token di riflessione.

2 minuti di letturaUltimo aggiornamento

Panoramica

It matters because it makes retrieval-augmented generation adaptive and self-checking instead of blindly fetching documents for every query.

Immersione profonda

Il RAG standard recupera un numero fisso di passaggi per ogni input, anche quando non ne è necessario nessuno, e non verifica mai se la risposta è effettivamente supportata. Self-RAG, introdotto da Asai e colleghi nel 2023, addestra un unico modello a fare tre cose su richiesta. Innanzitutto, emette un token di "recupero" che decide se è necessaria la conoscenza esterna. In secondo luogo, dopo il recupero, emette token di critica "IsRelevant" per giudicare se ogni passaggio è d'aiuto. In terzo luogo, genera token "IsSupported" e "IsUseful" valutando se le proprie dichiarazioni sono fondate su prove e quanto sia buona la risposta. Questi token di riflessione consentono al sistema di recuperare solo quando giustificato, filtrare passaggi irrilevanti e preferire risultati che il modello stesso considera ben supportati, riducendo le allucinazioni.

Approfondimento tecnico

Self-RAG viene addestrato tramite apprendimento supervisionato su dati etichettati con token di riflessione, spesso distillati da un modello più forte come GPT-4. All'inferenza, il modello intercala i normali token di testo con questi speciali token di controllo. Una ricerca del raggio a livello di segmento può quindi valutare le continuazioni dei candidati utilizzando le probabilità dei token di critica, consentendo agli sviluppatori di ottimizzare il comportamento in fase di esecuzione, ad esempio ponderando maggiormente "IsSupported" per massimizzare la base fattuale rispetto alla fluidità.

Impatto strategico

Velocità e scala

I flussi di lavoro linguistici possono muoversi più velocemente senza sacrificare la coerenza.

Accedere e raggiungere

Espande l'accesso attraverso lingue e stili di comunicazione.

Decisioni più chiare

I team possono dedicare più tempo al giudizio mentre l'automazione gestisce la ripetizione.

Il futuro del Self-RAG e del recupero riflessivo

Il recupero riflessivo sta convergendo con il RAG agentico, in cui i modelli pianificano ricerche in più fasi, chiamano strumenti e si autocorreggono attraverso le iterazioni. Aspettatevi una più stretta integrazione dell'autocritica con modelli di verifica, recupero su grafici della conoscenza e apprendimento per rinforzo che premia risposte fedeli e ben citate. Man mano che i modelli di ragionamento maturano, è probabile che il recupero su richiesta e autovalutato diventi un comportamento predefinito piuttosto che un quadro separato, con il modello che decide dinamicamente quante prove richiede ciascuna affermazione.

Implementazione nel mondo reale

Un assistente medico di domande e risposte recupera le linee guida solo per domande cliniche e salta il recupero per i saluti, utilizzando il token di decisione "recupera".

Un assistente di ricerca filtra i risultati della ricerca fuori argomento controllando la critica "IsRelevant" di ogni passaggio prima di scrivere.

Un chatbot aziendale preferisce le risposte contrassegnate con "IsSupported" in modo che le sue dichiarazioni rimangano ancorate ai documenti aziendali, eliminando le allucinazioni.

Uno strumento di verifica dei fatti utilizza il punteggio "IsUseful" per classificare più risposte dei candidati ed evidenziare quella con le migliori evidenze.

Rischi e guardrail

Fatti allucinati possono tranquillamente entrare nei rapporti, nei flussi di supporto o nei risultati della ricerca.

La sensibilità tempestiva può creare risultati incoerenti tra richieste simili.

I dati di testo sensibili potrebbero essere esposti se i controlli di accesso sono deboli.

Tabella di marcia per l'implementazione

1

Definisci il formato di output, il tono e gli standard di qualità prima dell'implementazione.

2

Risposte concrete con fonti attendibili ogni volta che la precisione è importante.

3

Mantenere un checkpoint di revisione umana per i risultati ad alto rischio.

4

Tieni traccia dei modelli di errore e riqualifica regolarmente le richieste o i flussi di lavoro.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Self-RAG and Reflective Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

RAG speculativo e drafting aumentato con il recupero

Domande frequenti

What is Self-RAG and Reflective Retrieval?

Self-RAG è un framework in cui un modello linguistico decide quando recuperare, quindi critica sia i passaggi recuperati che il proprio output utilizzando speciali token di riflessione. È importante perché rende la generazione aumentata di recupero adattiva e autocontrollata invece di recuperare ciecamente i documenti per ogni query.

Quale decisione chiave prende Self-RAG rispetto al RAG standard?

Self-RAG emette un token di "recupero" per decidere su richiesta se sono necessari documenti esterni, anziché recuperarli sempre.

Cosa sono i "gettoni riflessione" in Self-RAG?

I token di riflessione come IsRelevant, IsSupported e IsUseful consentono al modello di criticare i passaggi e il proprio output.

Quale token di riflessione valuta se un'affermazione generata è fondata sulle prove recuperate?

Il token IsSupported giudica se l'affermazione del modello è effettivamente supportata dai passaggi recuperati, aiutando a ridurre le allucinazioni.

Come viene generalmente addestrato un modello Self-RAG per produrre token di riflessione?

Self-RAG apprende dai dati di addestramento annotati con token di riflessione, spesso generati da un modello di insegnante più capace come GPT-4.

Che vantaggio offre l'emissione di una critica "IsRelevant" per ogni passaggio?

Criticando la pertinenza di ogni passaggio, Self-RAG può ignorare i recuperi fuori tema invece di inserirli nella risposta.