GUIDA TECNICA

Ottimizzazione della politica relativa del gruppo

Group Relative Policy Optimization (GRPO) è un metodo di apprendimento per rinforzo per mettere a punto i modelli linguistici che giudica ciascuna risposta rispetto a un gruppo di risposte di pari livello allo stesso prompt, eliminando la rete di valori separata utilizzata da PPO.

2 minuti di letturaUltimo aggiornamento

Panoramica

Divenne famoso come il trucco di allenamento fondamentale dietro i modelli di ragionamento di DeepSeek.

Immersione profonda

GRPO è una variante dell'apprendimento per rinforzo del gradiente politico progettato per rendere la messa a punto RL di modelli linguistici di grandi dimensioni più economica e più stabile. Il PPO standard ha bisogno di un "critico" esperto (modello di valore), grande all'incirca quanto la politica stessa, per stimare la validità di ciascun token. Il GRPO rimuove completamente questa critica. Per ogni richiesta campiona un gruppo di completamenti (ad esempio 8-64), assegna a tutti un punteggio con un segnale di ricompensa e quindi calcola il vantaggio di ciascun completamento standardizzando la sua ricompensa rispetto alla media del gruppo e alla deviazione standard. Le risposte superiori alla media vengono rafforzate e quelle inferiori alla media vengono soppresse. Un termine di divergenza KL mantiene il modello vicino a una politica di riferimento. Introdotto da DeepSeek, ha alimentato DeepSeekMath e i modelli di ragionamento DeepSeek-R1.

Approfondimento tecnico

L'idea chiave è sostituire la linea di base del valore appreso del PPO con una linea di base del gruppo Monte Carlo. Per un gruppo di output con ricompense r_i, ciascun vantaggio è A_i = (r_i - media(r)) / std(r). Quel punteggio normalizzato moltiplica il rapporto di probabilità tagliato, esattamente come nel PPO, e una penalità KL rispetto a un modello di riferimento congelato limita la deriva. Poiché nessun critico è addestrato, la memoria e il calcolo si dimezzano all'incirca e la normalizzazione per prompt offre vantaggi naturalmente scalati e con bassa varianza.

Impatto strategico

Costo e budget

Le decisioni relative all'architettura determinano prestazioni e costi operativi per anni.

Decisioni più chiare

La formazione tecnica aiuta i team a scegliere lo stack giusto, non solo quello più nuovo.

Controllo di qualità

Migliori scelte ingegneristiche riducono gli incidenti legati all’affidabilità nella produzione.

Il futuro dell’ottimizzazione della politica relativa di gruppo

Il GRPO è rapidamente diventato una ricetta predefinita per l’addestramento di modelli di ragionamento aperto e i laboratori stanno lavorando sui suoi punti deboli. I ricercatori stanno esplorando soluzioni per i bias di lunghezza e difficoltà (come Dr. GRPO), normalizzazione a livello di token piuttosto che a livello di sequenza e rimozione o rimodellamento del termine KL. Aspettatevi un'integrazione più stretta con ricompense verificabili (matematica, codice, utilizzo di strumenti), una migliore gestione di segnali sparsi e ibridi che combinino linee di base di gruppo con critici leggeri per attività agentiche in più fasi.

Implementazione nel mondo reale

Addestrare DeepSeek-R1 e DeepSeekMath per produrre ragionamenti basati su una lunga catena di pensiero utilizzando premi per la correttezza basati su regole su problemi di matematica

Ottimizzazione dei modelli di generazione del codice in cui a ciascuna soluzione campionata viene assegnato un punteggio in base al superamento dei test unitari e il gruppo viene normalizzato per scegliere i vincitori

Pipeline RLHF open source (ad esempio, nelle librerie TRL e verl) che utilizzano GRPO per allineare i modelli di chat senza pagare per una rete di valore separata

Migliorare il rispetto delle istruzioni o il comportamento di sicurezza campionando diverse risposte per prompt e premiando quelle che un modello di ricompensa valuta più alto rispetto ai loro pari

Rischi e guardrail

L'ottimizzazione di un benchmark può nascondere debolezze di sistema più ampie.

I costi delle infrastrutture e della manutenzione sono spesso sottostimati.

Le lacune in termini di sicurezza e osservabilità possono aumentare man mano che i sistemi diventano più complessi.

Tabella di marcia per l'implementazione

1

Definire obiettivi di latenza, qualità e costi prima dell'implementazione.

2

Benchmark in condizioni di carico e dati realistiche.

3

Monitoraggio dello strumento per errori, deriva e impatto sull'utente.

4

Preparare percorsi di rollback e risposta agli incidenti prima della scalabilità.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Ottimizzazione della politica prossimale

Domande frequenti

Che cos'è l'ottimizzazione delle politiche relative di gruppo?

Group Relative Policy Optimization (GRPO) è un metodo di apprendimento per rinforzo per mettere a punto i modelli linguistici che giudica ciascuna risposta rispetto a un gruppo di risposte di pari livello allo stesso prompt, eliminando la rete di valori separata utilizzata da PPO. È diventato famoso come il trucco di allenamento fondamentale dietro i modelli di ragionamento di DeepSeek.

Quale componente principale del PPO elimina il GRPO?

La modifica della firma del GRPO sta eliminando il modello valore appreso/critico del PPO, che normalmente ha all'incirca le stesse dimensioni della policy, con un notevole risparmio di memoria ed elaborazione.

In che modo GRPO calcola il vantaggio per un determinato completamento?

Il vantaggio di ogni completamento è (ricompensa - media del gruppo)/deviazione standard del gruppo, quindi il gruppo di risposte allo stesso prompt funge da linea di base.

Quali modelli hanno reso famosa la GRPO?

GRPO è stato introdotto e reso popolare da DeepSeek, in particolare in DeepSeekMath e come motore RL dietro i modelli di ragionamento DeepSeek-R1.

Che ruolo gioca il termine di divergenza KL nel GRPO?

Una penalità KL rispetto a un modello di riferimento (solitamente il pre-RL) regolarizza la formazione in modo che la politica migliori senza crollare o scivolare in risultati degenerati.

Perché GRPO è particolarmente interessante per addestrare modelli di ragionamento su matematica o codice?

Campionare molte soluzioni e assegnargli un punteggio con controlli automatici di correttezza si abbina perfettamente ai vantaggi normalizzati per gruppo del GRPO, senza bisogno di critiche.