Teknisk GUIDE

Optimalisering av grupperelativ policy

Group Relative Policy Optimization (GRPO) er en forsterkende læringsmetode for å finjustere språkmodeller som vurderer hvert svar opp mot en gruppe søskensvar på samme spørsmål, og eliminerer det separate verdinettverket som brukes av PPO.

2 min lesingSist oppdatert

Oversikt

It became famous as the core training trick behind DeepSeek's reasoning models.

Dypdykk

GRPO er en variant av policy-gradient forsterkende læring designet for å gjøre RL finjustering av store språkmodeller billigere og mer stabile. Standard PPO trenger en lært "kritiker" (verdimodell), omtrent like stor som selve policyen, for å estimere hvor god hvert token er. GRPO fjerner den kritikeren helt. For hver prompt sampler den en gruppe fullføringer (f.eks. 8-64), skårer dem alle med et belønningssignal, og beregner deretter hver fullførings fordel ved å standardisere belønningen mot gruppens gjennomsnitt og standardavvik. Svar over gjennomsnittet forsterkes og svar under gjennomsnittet undertrykkes. Et KL-divergensbegrep holder modellen nær en referansepolitikk. Introdusert av DeepSeek, drev den DeepSeekMath og DeepSeek-R1 resonneringsmodellene.

Teknisk innsikt

Nøkkelideen er å erstatte PPOs lærte verdigrunnlinje med en Monte Carlo-gruppegrunnlinje. For en gruppe utganger med belønninger r_i, er hver fordel A_i = (r_i - mean(r)) / std(r). Den normaliserte poengsummen multipliserer det klippede sannsynlighetsforholdet, nøyaktig som i PPO, og en KL-straff mot en frossen referansemodell begrenser driften. Fordi ingen kritiker er trent, halveres minne og databehandling omtrent, og normaliseringen per prompt gir naturlig skalerte fordeler med lav varians.

Strategisk innvirkning

Cost and budget

Arkitekturbeslutninger driver ytelse og driftskostnader i årevis.

Tydeligere avgjørelser

Teknisk utdanning hjelper team med å velge riktig stabel, ikke bare den nyeste.

Quality control

Bedre ingeniørvalg reduserer pålitelighetshendelser i produksjonen.

Fremtiden for optimalisering av konsernrelativ policy

GRPO har raskt blitt en standardoppskrift for opplæring av åpne resonneringsmodeller, og laboratorier gjentar sine svake punkter. Forskere utforsker rettelser for skjevheter i lengde og vanskelighetsgrad (som Dr. GRPO), token-nivå snarere enn sekvens-nivå normalisering, og fjerner eller omformer KL-begrepet. Forvent tettere integrasjon med verifiserbare belønninger (matte, kode, verktøybruk), bedre håndtering av sparsomme signaler og hybrider som kombinerer gruppebaselinjer med lette kritikere for agentiske, flertrinnsoppgaver.

Real-World Implementering

Trene DeepSeek-R1 og DeepSeekMath for å produsere lang tankekjede ved bruk av regelbasert korrekthetsbelønning på matematiske problemer

Finjustere kodegenereringsmodeller der hver samplet løsning blir skåre etter om den består enhetstester, og gruppen normaliseres for å plukke vinnere

Åpen kildekode RLHF-rørledninger (f.eks. i TRL- og verl-biblioteker) som bruker GRPO for å samkjøre chat-modeller uten å betale for et eget verdinettverk

Forbedring av instruksjonsfølging eller sikkerhetsatferd ved å prøve ut flere svar per forespørsel og belønne de en belønningsmodell vurderer høyest i forhold til sine jevnaldrende

Risikoer og rekkverk

Optimalisering av ett benchmark kan skjule bredere systemsvakheter.

Infrastruktur- og vedlikeholdskostnader er ofte undervurdert.

Sikkerhets- og observerbarhetsgap kan vokse etter hvert som systemene blir mer komplekse.

Veikart for implementering

1

Definer ventetid, kvalitet og kostnadsmål før implementering.

2

Benchmark under realistiske belastnings- og dataforhold.

3

Instrumentovervåking for feil, drift og brukerpåvirkning.

4

Forbered tilbakerulling og hendelsesresponsbaner før skalering.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Neste guide

Proksimal policyoptimalisering

Ofte stilte spørsmål

What is Group Relative Policy Optimization?

Group Relative Policy Optimization (GRPO) er en forsterkende læringsmetode for å finjustere språkmodeller som vurderer hvert svar opp mot en gruppe søskensvar på samme spørsmål, og eliminerer det separate verdinettverket som brukes av PPO. Det ble kjent som kjernetreningstrikset bak DeepSeeks resonneringsmodeller.

Hvilken hovedkomponent av PPO eliminerer GRPO?

GRPOs signaturendring dropper PPOs lærte verdi/kritiker-modell, som normalt er omtrent samme størrelse som policyen, og sparer betydelig minne og databehandling.

Hvordan beregner GRPO fordelen for en gitt fullføring?

Fordelen med hver fullføring er (belønning - gruppegjennomsnitt) / gruppestandardavvik, så gruppen med svar på samme spørsmål fungerer som grunnlinjen.

Hvilke modeller gjorde GRPO godt kjent?

GRPO ble introdusert og popularisert av DeepSeek, spesielt i DeepSeekMath og som RL-motoren bak DeepSeek-R1-resonneringsmodellene.

Hvilken rolle spiller KL-divergensbegrepet i GRPO?

En KL-straff mot en referanse (vanligvis pre-RL)-modellen regulerer treningen slik at politikken forbedres uten å kollapse eller drive inn i degenererte resultater.

Hvorfor er GRPO spesielt attraktiv for å trene resonneringsmodeller på matematikk eller kode?

Sampling av mange løsninger og poengsum for dem med automatiske korrekthetskontroller pares rent med GRPOs gruppenormaliserte fordeler, ingen kritiker nødvendig.