GUIDA AI FONDAMENTALI

Normalizzazione delle ricompense raggruppate in RLHF

La normalizzazione delle ricompense raggruppate standardizza le ricompense di un modello all'interno di un batch di risposte allo stesso prompt, trasformando i punteggi rumorosi in un segnale di addestramento stabile.

2 minuti di letturaUltimo aggiornamento

Panoramica

It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.

Immersione profonda

Nell'apprendimento per rinforzo dal feedback umano (RLHF), un modello genera risposte e un modello di ricompensa le assegna un punteggio, ma le ricompense grezze sono rumorose e variano notevolmente a seconda dei prompt. La normalizzazione della ricompensa raggruppata risolve questo problema campionando un gruppo di diverse risposte allo stesso prompt, quindi normalizzando ciascuna ricompensa sottraendo la media del gruppo e dividendo per la deviazione standard del gruppo. Questo punteggio z diventa il vantaggio. L'approccio è fondamentale per la Group Relative Policy Optimization (GRPO), introdotta da DeepSeek, che notoriamente ha alimentato il ragionamento di DeepSeek-R1. Fondamentalmente, il GRPO elimina la rete di valore separata (critica) utilizzata dal PPO, poiché la media del gruppo funge da linea di base. Ciò rende l'addestramento più semplice, più economico e più efficiente in termini di memoria mantenendo il segnale del gradiente ben scalato.

Approfondimento tecnico

Per un gruppo di output con ricompense r_1...r_G, il vantaggio è A_i = (r_i − mean(r)) / std(r). Le risposte migliori rispetto alla media del gruppo ottengono un vantaggio positivo e vengono rinforzate; quelli peggiori della media vengono respinti. Poiché il confronto è relativo all'interno di un prompt, la scala di ricompensa assoluta e la difficoltà per ogni prompt si annullano, riducendo la varianza. Il GRPO mantiene l'obiettivo tagliato del PPO e la penalità KL rispetto a una politica di riferimento per evitare che il modello si allontani troppo.

Impatto strategico

Decisioni più chiare

Ti aiuta a separare le chiare affermazioni tecniche dal linguaggio di marketing.

Costo e budget

Puoi porre domande sull'implementazione migliore prima di spendere denaro o tempo.

Team e flusso di lavoro

I team con una comprensione condivisa prendono decisioni migliori su prodotti, politiche e apprendimento.

Il futuro della normalizzazione delle ricompense raggruppate in RLHF

La normalizzazione raggruppata sta alimentando il boom dei modelli di ragionamento, in cui i modelli imparano da ricompense verificabili come risposte matematiche corrette senza un critico esperto. La ricerca lo sta perfezionando: dibattiti sull’opportunità di dividere per deviazione standard, gestione di gruppi completamente corretti o completamente sbagliati che producono vantaggio zero e ridimensionamento delle dimensioni del gruppo. Aspettatevi che metodi raggruppati e privi di critiche si diffondano all’uso di strumenti agenti e alla generazione di codice, dove i verificatori automatici forniscono segnali di ricompensa economici e abbondanti.

Implementazione nel mondo reale

Addestrare un modello di ragionamento matematico campionando 16 soluzioni per problema e premiando quelle al di sopra della correttezza media del gruppo.

Ottimizzare l'utilità di un chatbot normalizzando i punteggi del modello di ricompensa tra le diverse risposte dei candidati a ciascun prompt dell'utente.

Miglioramento di un assistente di codifica in cui a ciascuna soluzione campionata viene assegnato un punteggio in base al superamento dei test unitari, quindi normalizzata all'interno del gruppo.

Riduzione della memoria GPU in una pipeline RLHF eliminando la rete critica PPO e utilizzando invece la media del gruppo come linea di base.

Rischi e guardrail

Team diversi possono utilizzare lo stesso termine in modo diverso, quindi definisci l'ambito in anticipo.

I benchmark possono sembrare solidi mentre le prestazioni nel mondo reale non sono uniformi.

Ignorare la qualità dei dati e i piani di valutazione spesso crea risultati fragili.

Tabella di marcia per l'implementazione

1

Inizia con una definizione in linguaggio semplice del risultato di cui hai bisogno.

2

Scegli una metrica di successo e una condizione di fallimento prima del test.

3

Esegui un piccolo progetto pilota con dati rappresentativi, non un set demo raffinato.

4

Documento in cui la normalizzazione delle ricompense raggruppate in RLHF aiuta e dove i metodi più semplici sono migliori.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped Reward Normalization in RLHF quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Normalizzazione della lunghezza nell'ottimizzazione delle preferenze

Domande frequenti

What is Grouped Reward Normalization in RLHF?

La normalizzazione delle ricompense raggruppate standardizza le ricompense di un modello all'interno di un batch di risposte allo stesso prompt, trasformando i punteggi rumorosi in un segnale di addestramento stabile. È il trucco fondamentale dietro GRPO, l’algoritmo che alimenta molti modelli di ragionamento moderni.

Nella normalizzazione della ricompensa raggruppata, con cosa viene confrontata la ricompensa di ciascuna risposta?

Ogni ricompensa viene convertita in un punteggio z utilizzando la media e la deviazione standard del gruppo di risposte allo stesso prompt.

Quale algoritmo è maggiormente associato alla normalizzazione delle ricompense raggruppate?

GRPO, introdotto da DeepSeek e utilizzato in DeepSeek-R1, si basa sulla normalizzazione dei premi all'interno di un gruppo.

Quale componente del PPO standard il GRPO elimina in particolare?

Utilizzando la media del gruppo come base di riferimento, il GRPO elimina il critico esperto, risparmiando memoria e calcolo.

Cosa succede a una risposta la cui ricompensa è inferiore alla media del suo gruppo?

Sottraendo la media del gruppo, le risposte inferiori alla media hanno un vantaggio negativo, allontanando la politica da esse.

Perché la normalizzazione all’interno di un gruppo riduce la varianza dell’allenamento?

Poiché i confronti sono relativi all'interno di ciascun prompt, le differenze nella scala assoluta e nella difficoltà del prompt vengono eliminate.