Optimalisering av grupperelativ policy
Group Relative Policy Optimization (GRPO) er en forsterkende læringsmetode for å finjustere språkmodeller som vurderer hvert svar opp mot en gruppe søskensvar på samme spørsmål, og eliminerer det separate verdinettverket som brukes av PPO.
Oversikt
It became famous as the core training trick behind DeepSeek's reasoning models.
Dypdykk
GRPO er en variant av policy-gradient forsterkende læring designet for å gjøre RL finjustering av store språkmodeller billigere og mer stabile. Standard PPO trenger en lært "kritiker" (verdimodell), omtrent like stor som selve policyen, for å estimere hvor god hvert token er. GRPO fjerner den kritikeren helt. For hver prompt sampler den en gruppe fullføringer (f.eks. 8-64), skårer dem alle med et belønningssignal, og beregner deretter hver fullførings fordel ved å standardisere belønningen mot gruppens gjennomsnitt og standardavvik. Svar over gjennomsnittet forsterkes og svar under gjennomsnittet undertrykkes. Et KL-divergensbegrep holder modellen nær en referansepolitikk. Introdusert av DeepSeek, drev den DeepSeekMath og DeepSeek-R1 resonneringsmodellene.
Teknisk innsikt
Nøkkelideen er å erstatte PPOs lærte verdigrunnlinje med en Monte Carlo-gruppegrunnlinje. For en gruppe utganger med belønninger r_i, er hver fordel A_i = (r_i - mean(r)) / std(r). Den normaliserte poengsummen multipliserer det klippede sannsynlighetsforholdet, nøyaktig som i PPO, og en KL-straff mot en frossen referansemodell begrenser driften. Fordi ingen kritiker er trent, halveres minne og databehandling omtrent, og normaliseringen per prompt gir naturlig skalerte fordeler med lav varians.
Strategisk innvirkning
Cost and budget
Arkitekturbeslutninger driver ytelse og driftskostnader i årevis.
Tydeligere avgjørelser
Teknisk utdanning hjelper team med å velge riktig stabel, ikke bare den nyeste.
Quality control
Bedre ingeniørvalg reduserer pålitelighetshendelser i produksjonen.
Fremtiden for optimalisering av konsernrelativ policy
GRPO har raskt blitt en standardoppskrift for opplæring av åpne resonneringsmodeller, og laboratorier gjentar sine svake punkter. Forskere utforsker rettelser for skjevheter i lengde og vanskelighetsgrad (som Dr. GRPO), token-nivå snarere enn sekvens-nivå normalisering, og fjerner eller omformer KL-begrepet. Forvent tettere integrasjon med verifiserbare belønninger (matte, kode, verktøybruk), bedre håndtering av sparsomme signaler og hybrider som kombinerer gruppebaselinjer med lette kritikere for agentiske, flertrinnsoppgaver.
Real-World Implementering
Trene DeepSeek-R1 og DeepSeekMath for å produsere lang tankekjede ved bruk av regelbasert korrekthetsbelønning på matematiske problemer
Finjustere kodegenereringsmodeller der hver samplet løsning blir skåre etter om den består enhetstester, og gruppen normaliseres for å plukke vinnere
Åpen kildekode RLHF-rørledninger (f.eks. i TRL- og verl-biblioteker) som bruker GRPO for å samkjøre chat-modeller uten å betale for et eget verdinettverk
Forbedring av instruksjonsfølging eller sikkerhetsatferd ved å prøve ut flere svar per forespørsel og belønne de en belønningsmodell vurderer høyest i forhold til sine jevnaldrende
Risikoer og rekkverk
Optimalisering av ett benchmark kan skjule bredere systemsvakheter.
Infrastruktur- og vedlikeholdskostnader er ofte undervurdert.
Sikkerhets- og observerbarhetsgap kan vokse etter hvert som systemene blir mer komplekse.
Veikart for implementering
Definer ventetid, kvalitet og kostnadsmål før implementering.
Benchmark under realistiske belastnings- og dataforhold.
Instrumentovervåking for feil, drift og brukerpåvirkning.
Forbered tilbakerulling og hendelsesresponsbaner før skalering.
Fortsett å utforske
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Group Relative Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Neste guide
Proksimal policyoptimalisering
Ofte stilte spørsmål
What is Group Relative Policy Optimization?
Group Relative Policy Optimization (GRPO) er en forsterkende læringsmetode for å finjustere språkmodeller som vurderer hvert svar opp mot en gruppe søskensvar på samme spørsmål, og eliminerer det separate verdinettverket som brukes av PPO. Det ble kjent som kjernetreningstrikset bak DeepSeeks resonneringsmodeller.
Hvilken hovedkomponent av PPO eliminerer GRPO?
GRPOs signaturendring dropper PPOs lærte verdi/kritiker-modell, som normalt er omtrent samme størrelse som policyen, og sparer betydelig minne og databehandling.
Hvordan beregner GRPO fordelen for en gitt fullføring?
Fordelen med hver fullføring er (belønning - gruppegjennomsnitt) / gruppestandardavvik, så gruppen med svar på samme spørsmål fungerer som grunnlinjen.
Hvilke modeller gjorde GRPO godt kjent?
GRPO ble introdusert og popularisert av DeepSeek, spesielt i DeepSeekMath og som RL-motoren bak DeepSeek-R1-resonneringsmodellene.
Hvilken rolle spiller KL-divergensbegrepet i GRPO?
En KL-straff mot en referanse (vanligvis pre-RL)-modellen regulerer treningen slik at politikken forbedres uten å kollapse eller drive inn i degenererte resultater.
Hvorfor er GRPO spesielt attraktiv for å trene resonneringsmodeller på matematikk eller kode?
Sampling av mange løsninger og poengsum for dem med automatiske korrekthetskontroller pares rent med GRPOs gruppenormaliserte fordeler, ingen kritiker nødvendig.