Modellazione delle ricompense
Un modello di ricompensa è una rete neurale addestrata a prevedere quanto sia buona una risposta dell’intelligenza artificiale, agendo come un sostituto automatizzato del giudizio umano.
Panoramica
It is the scoring engine that makes reinforcement learning from human feedback possible at scale.
Immersione profonda
La modellazione delle ricompense risolve un problema pratico: gli esseri umani non possono valutare ognuno dei milioni di risultati che un modello genera durante la formazione. Invece, gli etichettatori confrontano un piccolo insieme di risposte, solitamente scegliendo quale delle due risposte allo stesso prompt è migliore. Un modello di ricompensa viene quindi addestrato su questi confronti per produrre un singolo punteggio scalare per qualsiasi coppia di risposte rapide. L'obiettivo formativo standard è il modello Bradley-Terry, che trasforma le preferenze a coppie in una probabilità che una risposta superi un'altra. Una volta addestrato, questo modello di ricompensa può valutare a buon mercato un numero illimitato di nuovi risultati, fornendo il segnale che algoritmi come PPO utilizzano per migliorare il modello linguistico. I modelli di ricompensa vengono anche riutilizzati al momento dell'inferenza per il campionamento al meglio di N, in cui vengono generati molti candidati e viene restituito quello con il punteggio più alto.
Approfondimento tecnico
Un modello di ricompensa è solitamente il modello linguistico di base con la testa di previsione del token sostituita da un singolo strato lineare che emette uno scalare. L'addestramento massimizza la probabilità log che la risposta scelta ottenga un punteggio più alto di quella rifiutata: perdita = -log(sigmoid(r_scelto - r_rejected)). Conta solo la differenza relativa, quindi la scala assoluta è arbitraria. La qualità dipende dalla coerenza delle etichette e dall’ampia copertura degli stili di risposta.
Impatto strategico
Velocità e scala
I flussi di lavoro linguistici possono muoversi più velocemente senza sacrificare la coerenza.
Accedere e raggiungere
Espande l'accesso attraverso lingue e stili di comunicazione.
Decisioni più chiare
I team possono dedicare più tempo al giudizio mentre l'automazione gestisce la ripetizione.
Il futuro della modellazione delle ricompense
La ricerca sta affrontando i maggiori punti deboli dei modelli di ricompensa: possono essere “hackerati” (i modelli sfruttano peculiarità come favorire la lunghezza) e si allontanano dalla distribuzione man mano che la politica migliora. Le indicazioni promettenti includono modelli di ricompensa del processo che assegnano un punteggio a ogni fase del ragionamento, insiemi e stime di incertezza per resistere all’hacking, etichette di preferenza generate dall’intelligenza artificiale (RLAIF) e modelli di ricompensa generativa che producono critiche e motivazioni piuttosto che un semplice numero.
Implementazione nel mondo reale
Potenziare RLHF per assistenti come ChatGPT e Claude assegnando un punteggio alle risposte dei candidati durante la formazione PPO
Campionamento best-of-N, in cui un modello genera molte risposte e il modello di ricompensa seleziona il meglio per l'utente
"Verificatori" di matematica e codifica o modelli di ricompensa del processo che assegnano un punteggio ai passaggi intermedi del ragionamento per migliorare la risoluzione dei problemi
Classificare e filtrare i dati sintetici di addestramento, mantenendo solo le generazioni con punteggi elevati per un'ulteriore messa a punto
Rischi e guardrail
Fatti allucinati possono tranquillamente entrare nei rapporti, nei flussi di supporto o nei risultati della ricerca.
La sensibilità tempestiva può creare risultati incoerenti tra richieste simili.
I dati di testo sensibili potrebbero essere esposti se i controlli di accesso sono deboli.
Tabella di marcia per l'implementazione
Definisci il formato di output, il tono e gli standard di qualità prima dell'implementazione.
Risposte concrete con fonti attendibili ogni volta che la precisione è importante.
Mantenere un checkpoint di revisione umana per i risultati ad alto rischio.
Tieni traccia dei modelli di errore e riqualifica regolarmente le richieste o i flussi di lavoro.
Continua a esplorare
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Reward Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Prossima guida
Modello di ricompensa Bradley-Terry
Domande frequenti
What is Reward Modeling?
Un modello di ricompensa è una rete neurale addestrata a prevedere quanto sia buona una risposta dell’intelligenza artificiale, agendo come un sostituto automatizzato del giudizio umano. È il motore di punteggio che rende possibile l’apprendimento per rinforzo dal feedback umano su larga scala.
Qual è l'output principale di un modello di ricompensa per una determinata coppia di risposta rapida?
Un modello di ricompensa mappa una richiesta e una risposta a un numero scalare che rappresenta la qualità prevista o la preferenza umana.
Che tipo di dati umani vengono più comunemente utilizzati per addestrare modelli di ricompensa?
Gli etichettatori in genere confrontano due risposte allo stesso prompt e scelgono quella migliore; il modello Bradley-Terry li converte in una ricompensa scalare.
Cosa ottimizza la perdita del modello di ricompensa standard?
La perdita di Bradley-Terry, -log(sigmoid(r_chosen - r_rejected)), si preoccupa solo dell'ordinamento relativo, quindi la scala assoluta è arbitraria.
Cos'è il "reward hacking"?
L'hacking della ricompensa avviene quando il modello trova scorciatoie (come una lunghezza eccessiva o l'adulazione) che il modello di ricompensa imperfetto valuta molto bene ma gli umani non lo farebbero.
In che modo un modello di ricompensa deriva architettonicamente da un modello linguistico?
Un modello di ricompensa in genere riutilizza la dorsale LM ma scambia lo strato finale con uno che produce una singola ricompensa scalare.