Optimizare relativă a politicii de grup
Group Relative Policy Optimization (GRPO) este o metodă de învățare-întărire pentru reglarea fină a modelelor de limbaj care judecă fiecare răspuns în raport cu un grup de răspunsuri frați la același prompt, eliminând rețeaua de valori separată utilizată de PPO.
Prezentare generală
It became famous as the core training trick behind DeepSeek's reasoning models.
Scufundare în profunzime
GRPO este o variantă de învățare de consolidare a gradului de politici, concepută pentru a face reglarea fină RL a modelelor de limbă mari mai ieftină și mai stabilă. PPO standard are nevoie de un „critic” învățat (model de valoare), aproximativ la fel de mare ca politica în sine, pentru a estima cât de bun este fiecare token. GRPO înlătură complet acel critic. Pentru fiecare solicitare eșantionează un grup de completări (să zicem 8-64), le punctează pe toate cu un semnal de recompensă și apoi calculează avantajul fiecărei finalizări prin standardizarea recompensei față de media și deviația standard a grupului. Răspunsurile peste medie sunt întărite, iar cele sub medie sunt suprimate. Un termen de divergență KL menține modelul aproape de o politică de referință. Introdus de DeepSeek, a alimentat DeepSeekMath și modelele de raționament DeepSeek-R1.
Perspectivă tehnică
Ideea cheie este înlocuirea valorii de referință a PPO cu o linie de bază a grupului Monte Carlo. Pentru un grup de rezultate cu recompense r_i, fiecare avantaj este A_i = (r_i - mean(r)) / std(r). Acest scor normalizat înmulțește raportul de probabilitate tăiat, exact ca în PPO, iar o penalizare KL împotriva unui model de referință înghețat reduce deriva. Deoarece niciun critic nu este instruit, memoria și calculul se înjumătățesc aproximativ, iar normalizarea per-prompt oferă avantaje scalate în mod natural, cu variații reduse.
Impact strategic
Cost și buget
Deciziile de arhitectură generează performanța și costurile de operare de ani de zile.
Decizii mai clare
Educația tehnică ajută echipele să aleagă stiva potrivită, nu doar cea mai nouă.
Controlul calității
Opțiuni de inginerie mai bune reduc incidentele de fiabilitate în producție.
Viitorul optimizării politicilor relative de grup
GRPO a devenit rapid o rețetă implicită pentru formarea modelelor de raționament deschis, iar laboratoarele iterează pe punctele sale slabe. Cercetătorii explorează remedieri pentru prejudecățile legate de lungime și dificultate (cum ar fi Dr. GRPO), normalizarea la nivel de simbol, mai degrabă decât la nivel de secvență, și elimină sau remodelează termenul KL. Așteptați-vă la o integrare mai strânsă cu recompense verificabile (matematice, cod, utilizarea instrumentelor), o mai bună gestionare a semnalelor rare și hibrizi care combină liniile de bază ale grupului cu critici ușoare pentru sarcini agentice, cu mai mulți pași.
Implementare în lumea reală
Antrenamentul DeepSeek-R1 și DeepSeekMath pentru a produce raționament în lanț lung de gândire folosind recompense de corectitudine bazate pe reguli pentru probleme de matematică
Reglarea fină a modelelor de generare de cod în care fiecare soluție eșantionată este punctată dacă trece testele unitare, iar grupul este normalizat pentru a alege câștigătorii
Conducte RLHF cu sursă deschisă (de exemplu, în bibliotecile TRL și verl) care utilizează GRPO pentru a alinia modelele de chat fără a plăti pentru o rețea de valoare separată
Îmbunătățirea comportamentului de urmărire a instrucțiunilor sau de siguranță prin eșantionarea mai multor răspunsuri pentru fiecare prompt și recompensând pe cele pe care un model de recompensă le apreciază cel mai mult în comparație cu colegii lor
Riscuri și balustrade
Optimizarea unui punct de referință poate ascunde slăbiciunile mai largi ale sistemului.
Costurile de infrastructură și întreținere sunt adesea subestimate.
Lacunele de securitate și observabilitate pot crește pe măsură ce sistemele devin mai complexe.
Foaia de parcurs de implementare
Definiți obiectivele de latență, calitate și cost înainte de implementare.
Benchmark în condiții realiste de încărcare și date.
Monitorizarea instrumentelor pentru erori, deriva și impactul utilizatorului.
Pregătiți căile de retragere și răspuns la incident înainte de scalare.
Continuați să explorați
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Group Relative Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Următorul ghid
Optimizarea proximală a politicii
Întrebări frecvente
What is Group Relative Policy Optimization?
Group Relative Policy Optimization (GRPO) este o metodă de învățare-întărire pentru reglarea fină a modelelor de limbaj care judecă fiecare răspuns în raport cu un grup de răspunsuri frați la același prompt, eliminând rețeaua de valori separată utilizată de PPO. A devenit celebru ca trucul de bază de antrenament din spatele modelelor de raționament ale DeepSeek.
Ce componentă majoră a PPO elimină GRPO?
Modificarea semnăturii GRPO renunță la modelul de valoare învățat/critic al PPO, care este în mod normal aproximativ de aceeași dimensiune cu politica, economisind memorie substanțială și calcul.
Cum calculează GRPO avantajul pentru o anumită finalizare?
Avantajul fiecărei finalizări este (recompensă - media grupului) / abaterea standard a grupului, astfel încât grupul de răspunsuri la același prompt acționează ca linie de bază.
Ce modele l-au făcut cunoscut pe GRPO?
GRPO a fost introdus și popularizat de DeepSeek, în special în DeepSeekMath și ca motor RL din spatele modelelor de raționament DeepSeek-R1.
Ce rol joacă termenul KL-divergență în GRPO?
O penalizare KL împotriva unui model de referință (de obicei, pre-RL) regularizează antrenamentul, astfel încât politica să se îmbunătățească fără să se prăbușească sau să se deplaseze în rezultate degenerate.
De ce este GRPO deosebit de atractiv pentru formarea modelelor de raționament pe matematică sau cod?
Eșantionarea multor soluții și notarea acestora cu verificări automate de corectitudine se împerechează în mod clar cu avantajele GRPO normalizate în grup, fără a fi nevoie de critici.