Ottimizzazione della politica relativa del gruppo
Group Relative Policy Optimization (GRPO) è un metodo di apprendimento per rinforzo per mettere a punto i modelli linguistici che giudica ciascuna risposta rispetto a un gruppo di risposte di pari livello allo stesso prompt, eliminando la rete di valori separata utilizzata da PPO.
Panoramica
Divenne famoso come il trucco di allenamento fondamentale dietro i modelli di ragionamento di DeepSeek.
Immersione profonda
GRPO è una variante dell'apprendimento per rinforzo del gradiente politico progettato per rendere la messa a punto RL di modelli linguistici di grandi dimensioni più economica e più stabile. Il PPO standard ha bisogno di un "critico" esperto (modello di valore), grande all'incirca quanto la politica stessa, per stimare la validità di ciascun token. Il GRPO rimuove completamente questa critica. Per ogni richiesta campiona un gruppo di completamenti (ad esempio 8-64), assegna a tutti un punteggio con un segnale di ricompensa e quindi calcola il vantaggio di ciascun completamento standardizzando la sua ricompensa rispetto alla media del gruppo e alla deviazione standard. Le risposte superiori alla media vengono rafforzate e quelle inferiori alla media vengono soppresse. Un termine di divergenza KL mantiene il modello vicino a una politica di riferimento. Introdotto da DeepSeek, ha alimentato DeepSeekMath e i modelli di ragionamento DeepSeek-R1.
Approfondimento tecnico
L'idea chiave è sostituire la linea di base del valore appreso del PPO con una linea di base del gruppo Monte Carlo. Per un gruppo di output con ricompense r_i, ciascun vantaggio è A_i = (r_i - media(r)) / std(r). Quel punteggio normalizzato moltiplica il rapporto di probabilità tagliato, esattamente come nel PPO, e una penalità KL rispetto a un modello di riferimento congelato limita la deriva. Poiché nessun critico è addestrato, la memoria e il calcolo si dimezzano all'incirca e la normalizzazione per prompt offre vantaggi naturalmente scalati e con bassa varianza.
Impatto strategico
Costo e budget
Le decisioni relative all'architettura determinano prestazioni e costi operativi per anni.
Decisioni più chiare
La formazione tecnica aiuta i team a scegliere lo stack giusto, non solo quello più nuovo.
Controllo di qualità
Migliori scelte ingegneristiche riducono gli incidenti legati all’affidabilità nella produzione.
Il futuro dell’ottimizzazione della politica relativa di gruppo
Il GRPO è rapidamente diventato una ricetta predefinita per l’addestramento di modelli di ragionamento aperto e i laboratori stanno lavorando sui suoi punti deboli. I ricercatori stanno esplorando soluzioni per i bias di lunghezza e difficoltà (come Dr. GRPO), normalizzazione a livello di token piuttosto che a livello di sequenza e rimozione o rimodellamento del termine KL. Aspettatevi un'integrazione più stretta con ricompense verificabili (matematica, codice, utilizzo di strumenti), una migliore gestione di segnali sparsi e ibridi che combinino linee di base di gruppo con critici leggeri per attività agentiche in più fasi.
Implementazione nel mondo reale
Addestrare DeepSeek-R1 e DeepSeekMath per produrre ragionamenti basati su una lunga catena di pensiero utilizzando premi per la correttezza basati su regole su problemi di matematica
Ottimizzazione dei modelli di generazione del codice in cui a ciascuna soluzione campionata viene assegnato un punteggio in base al superamento dei test unitari e il gruppo viene normalizzato per scegliere i vincitori
Pipeline RLHF open source (ad esempio, nelle librerie TRL e verl) che utilizzano GRPO per allineare i modelli di chat senza pagare per una rete di valore separata
Migliorare il rispetto delle istruzioni o il comportamento di sicurezza campionando diverse risposte per prompt e premiando quelle che un modello di ricompensa valuta più alto rispetto ai loro pari
Rischi e guardrail
L'ottimizzazione di un benchmark può nascondere debolezze di sistema più ampie.
I costi delle infrastrutture e della manutenzione sono spesso sottostimati.
Le lacune in termini di sicurezza e osservabilità possono aumentare man mano che i sistemi diventano più complessi.
Tabella di marcia per l'implementazione
Definire obiettivi di latenza, qualità e costi prima dell'implementazione.
Benchmark in condizioni di carico e dati realistiche.
Monitoraggio dello strumento per errori, deriva e impatto sull'utente.
Preparare percorsi di rollback e risposta agli incidenti prima della scalabilità.
Continua a esplorare
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Group Relative Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Prossima guida
Ottimizzazione della politica prossimale
Domande frequenti
Che cos'è l'ottimizzazione delle politiche relative di gruppo?
Group Relative Policy Optimization (GRPO) è un metodo di apprendimento per rinforzo per mettere a punto i modelli linguistici che giudica ciascuna risposta rispetto a un gruppo di risposte di pari livello allo stesso prompt, eliminando la rete di valori separata utilizzata da PPO. È diventato famoso come il trucco di allenamento fondamentale dietro i modelli di ragionamento di DeepSeek.
Quale componente principale del PPO elimina il GRPO?
La modifica della firma del GRPO sta eliminando il modello valore appreso/critico del PPO, che normalmente ha all'incirca le stesse dimensioni della policy, con un notevole risparmio di memoria ed elaborazione.
In che modo GRPO calcola il vantaggio per un determinato completamento?
Il vantaggio di ogni completamento è (ricompensa - media del gruppo)/deviazione standard del gruppo, quindi il gruppo di risposte allo stesso prompt funge da linea di base.
Quali modelli hanno reso famosa la GRPO?
GRPO è stato introdotto e reso popolare da DeepSeek, in particolare in DeepSeekMath e come motore RL dietro i modelli di ragionamento DeepSeek-R1.
Che ruolo gioca il termine di divergenza KL nel GRPO?
Una penalità KL rispetto a un modello di riferimento (solitamente il pre-RL) regolarizza la formazione in modo che la politica migliori senza crollare o scivolare in risultati degenerati.
Perché GRPO è particolarmente interessante per addestrare modelli di ragionamento su matematica o codice?
Campionare molte soluzioni e assegnargli un punteggio con controlli automatici di correttezza si abbina perfettamente ai vantaggi normalizzati per gruppo del GRPO, senza bisogno di critiche.