Teknisk GUIDE

Grupprelativ policyoptimering

Group Relative Policy Optimization (GRPO) är en förstärkningsinlärningsmetod för att finjustera språkmodeller som bedömer varje svar mot en grupp syskonsvar på samma prompt, vilket eliminerar det separata värdenätverket som används av PPO.

2 min readSenast uppdaterad

Översikt

It became famous as the core training trick behind DeepSeek's reasoning models.

Djupdykning

GRPO är en variant av policygradient förstärkningsinlärning utformad för att göra RL-finjustering av stora språkmodeller billigare och mer stabila. Standard PPO behöver en lärd "kritiker" (värdemodell), ungefär lika stor som själva policyn, för att uppskatta hur bra varje token är. GRPO tar bort den kritiken helt. För varje prompt samplar den en grupp av slutföranden (säg 8-64), poängsätter dem alla med en belöningssignal och beräknar sedan varje slutförandes fördel genom att standardisera dess belöning mot gruppens medelvärde och standardavvikelse. Svar över genomsnittet förstärks och svar under genomsnittet undertrycks. En KL-divergensterm håller modellen nära en referenspolicy. Introducerad av DeepSeek, den drev DeepSeekMath och DeepSeek-R1 resonemangsmodellerna.

Teknisk insikt

Nyckelidén är att ersätta PPO:s inlärda värdebaslinje med en Monte Carlo-gruppbaslinje. För en grupp av utgångar med belöningar r_i är varje fördel A_i = (r_i - medel(r)) / std(r). Den normaliserade poängen multiplicerar det klippta sannolikhetsförhållandet, precis som i PPO, och en KL-straff mot en frusen referensmodell begränsar driften. Eftersom ingen kritiker tränas halveras minne och beräkning ungefär, och normaliseringen per prompt ger naturligt skalade fördelar med låg varians.

Strategisk inverkan

Cost and budget

Arkitekturbeslut driver prestanda och driftskostnader i flera år.

Clearer decisions

Teknisk utbildning hjälper team att välja rätt stack, inte bara den nyaste.

Quality control

Bättre tekniska val minskar tillförlitlighetsincidenter i produktionen.

Framtiden för optimering av grupprelativ policy

GRPO har snabbt blivit ett standardrecept för att träna öppna resonemangsmodeller, och laboratorier itererar på dess svaga punkter. Forskare undersöker korrigeringar för längd- och svårighetsfördomar (som Dr. GRPO), normalisering på tokennivå snarare än sekvensnivå, och tar bort eller omformar KL-termen. Förvänta dig tätare integration med verifierbara belöningar (matte, kod, verktygsanvändning), bättre hantering av glesa signaler och hybrider som kombinerar gruppbaslinjer med lättviktiga kritiker för agentiska, flerstegsuppgifter.

Real-World Implementation

Utbilda DeepSeek-R1 och DeepSeekMath för att skapa långa tankekedjor med hjälp av regelbaserade korrekthetsbelöningar för matematiska problem

Finjustera kodgenereringsmodeller där varje samplade lösning poängsätts efter om den klarar enhetstester, och gruppen normaliseras för att välja vinnare

RLHF-pipelines med öppen källkod (t.ex. i TRL- och verl-bibliotek) som använder GRPO för att anpassa chattmodeller utan att betala för ett separat värdenätverk

Förbättra instruktionsföljande eller säkerhetsbeteende genom att ta ett urval av flera svar per uppmaning och belöna de som en belöningsmodell bedömer högst i förhållande till sina kamrater

Risker & skyddsräcken

Att optimera ett riktmärke kan dölja bredare systemsvagheter.

Infrastruktur- och underhållskostnader underskattas ofta.

Säkerhets- och observerbarhetsluckor kan växa i takt med att systemen blir mer komplexa.

Färdplan för genomförande

1

Definiera latens-, kvalitet- och kostnadsmål före implementering.

2

Benchmark under realistiska belastnings- och dataförhållanden.

3

Instrumentövervakning för fel, drift och användarpåverkan.

4

Förbered återställnings- och incidentsvarsvägar innan skalning.

Fortsätt utforska

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Starta frågesport

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Proximal policyoptimering

Frequently asked questions

What is Group Relative Policy Optimization?

Group Relative Policy Optimization (GRPO) är en förstärkningsinlärningsmetod för att finjustera språkmodeller som bedömer varje svar mot en grupp syskonsvar på samma prompt, vilket eliminerar det separata värdenätverket som används av PPO. Det blev känt som kärnträningstricket bakom DeepSeeks resonemangsmodeller.

Vilken huvudkomponent av PPO eliminerar GRPO?

GRPO:s signaturförändring tar bort PPO:s inlärda värde/kritiker-modell, som normalt är ungefär lika stor som policyn, vilket sparar mycket minne och beräkning.

Hur beräknar GRPO fördelen för ett givet slutförande?

Fördelen med varje slutförande är (belöning - gruppmedelvärde) / gruppstandardavvikelse, så gruppen med svar på samma prompt fungerar som baslinjen.

Vilka modeller gjorde GRPO välkänd?

GRPO introducerades och populariserades av DeepSeek, särskilt i DeepSeekMath och som RL-motorn bakom DeepSeek-R1-resonemangsmodellerna.

Vilken roll spelar KL-divergenstermen i GRPO?

En KL-straff mot en referensmodell (vanligtvis före RL) reglerar träningen så att policyn förbättras utan att kollapsa eller glida in i degenererade resultat.

Varför är GRPO särskilt attraktivt för att träna resonemangsmodeller i matematik eller kod?

Att ta prov på många lösningar och poängsätta dem med automatiska korrekthetskontroller parar sig rent med GRPO:s gruppnormaliserade fördelar, ingen kritik behövs.