Grupprelativ policyoptimering
Group Relative Policy Optimization (GRPO) är en förstärkningsinlärningsmetod för att finjustera språkmodeller som bedömer varje svar mot en grupp syskonsvar på samma prompt, vilket eliminerar det separata värdenätverket som används av PPO.
Översikt
It became famous as the core training trick behind DeepSeek's reasoning models.
Djupdykning
GRPO är en variant av policygradient förstärkningsinlärning utformad för att göra RL-finjustering av stora språkmodeller billigare och mer stabila. Standard PPO behöver en lärd "kritiker" (värdemodell), ungefär lika stor som själva policyn, för att uppskatta hur bra varje token är. GRPO tar bort den kritiken helt. För varje prompt samplar den en grupp av slutföranden (säg 8-64), poängsätter dem alla med en belöningssignal och beräknar sedan varje slutförandes fördel genom att standardisera dess belöning mot gruppens medelvärde och standardavvikelse. Svar över genomsnittet förstärks och svar under genomsnittet undertrycks. En KL-divergensterm håller modellen nära en referenspolicy. Introducerad av DeepSeek, den drev DeepSeekMath och DeepSeek-R1 resonemangsmodellerna.
Teknisk insikt
Nyckelidén är att ersätta PPO:s inlärda värdebaslinje med en Monte Carlo-gruppbaslinje. För en grupp av utgångar med belöningar r_i är varje fördel A_i = (r_i - medel(r)) / std(r). Den normaliserade poängen multiplicerar det klippta sannolikhetsförhållandet, precis som i PPO, och en KL-straff mot en frusen referensmodell begränsar driften. Eftersom ingen kritiker tränas halveras minne och beräkning ungefär, och normaliseringen per prompt ger naturligt skalade fördelar med låg varians.
Strategisk inverkan
Cost and budget
Arkitekturbeslut driver prestanda och driftskostnader i flera år.
Clearer decisions
Teknisk utbildning hjälper team att välja rätt stack, inte bara den nyaste.
Quality control
Bättre tekniska val minskar tillförlitlighetsincidenter i produktionen.
Framtiden för optimering av grupprelativ policy
GRPO har snabbt blivit ett standardrecept för att träna öppna resonemangsmodeller, och laboratorier itererar på dess svaga punkter. Forskare undersöker korrigeringar för längd- och svårighetsfördomar (som Dr. GRPO), normalisering på tokennivå snarare än sekvensnivå, och tar bort eller omformar KL-termen. Förvänta dig tätare integration med verifierbara belöningar (matte, kod, verktygsanvändning), bättre hantering av glesa signaler och hybrider som kombinerar gruppbaslinjer med lättviktiga kritiker för agentiska, flerstegsuppgifter.
Real-World Implementation
Utbilda DeepSeek-R1 och DeepSeekMath för att skapa långa tankekedjor med hjälp av regelbaserade korrekthetsbelöningar för matematiska problem
Finjustera kodgenereringsmodeller där varje samplade lösning poängsätts efter om den klarar enhetstester, och gruppen normaliseras för att välja vinnare
RLHF-pipelines med öppen källkod (t.ex. i TRL- och verl-bibliotek) som använder GRPO för att anpassa chattmodeller utan att betala för ett separat värdenätverk
Förbättra instruktionsföljande eller säkerhetsbeteende genom att ta ett urval av flera svar per uppmaning och belöna de som en belöningsmodell bedömer högst i förhållande till sina kamrater
Risker & skyddsräcken
Att optimera ett riktmärke kan dölja bredare systemsvagheter.
Infrastruktur- och underhållskostnader underskattas ofta.
Säkerhets- och observerbarhetsluckor kan växa i takt med att systemen blir mer komplexa.
Färdplan för genomförande
Definiera latens-, kvalitet- och kostnadsmål före implementering.
Benchmark under realistiska belastnings- och dataförhållanden.
Instrumentövervakning för fel, drift och användarpåverkan.
Förbered återställnings- och incidentsvarsvägar innan skalning.
Fortsätt utforska
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Group Relative Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Proximal policyoptimering
Frequently asked questions
What is Group Relative Policy Optimization?
Group Relative Policy Optimization (GRPO) är en förstärkningsinlärningsmetod för att finjustera språkmodeller som bedömer varje svar mot en grupp syskonsvar på samma prompt, vilket eliminerar det separata värdenätverket som används av PPO. Det blev känt som kärnträningstricket bakom DeepSeeks resonemangsmodeller.
Vilken huvudkomponent av PPO eliminerar GRPO?
GRPO:s signaturförändring tar bort PPO:s inlärda värde/kritiker-modell, som normalt är ungefär lika stor som policyn, vilket sparar mycket minne och beräkning.
Hur beräknar GRPO fördelen för ett givet slutförande?
Fördelen med varje slutförande är (belöning - gruppmedelvärde) / gruppstandardavvikelse, så gruppen med svar på samma prompt fungerar som baslinjen.
Vilka modeller gjorde GRPO välkänd?
GRPO introducerades och populariserades av DeepSeek, särskilt i DeepSeekMath och som RL-motorn bakom DeepSeek-R1-resonemangsmodellerna.
Vilken roll spelar KL-divergenstermen i GRPO?
En KL-straff mot en referensmodell (vanligtvis före RL) reglerar träningen så att policyn förbättras utan att kollapsa eller glida in i degenererade resultat.
Varför är GRPO särskilt attraktivt för att träna resonemangsmodeller i matematik eller kod?
Att ta prov på många lösningar och poängsätta dem med automatiska korrekthetskontroller parar sig rent med GRPO:s gruppnormaliserade fördelar, ingen kritik behövs.