Grundläggande GUIDE

Grupperad belöningsnormalisering i RLHF

Normalisering av grupperad belöning standardiserar en modells belöningar inom en grupp svar på samma prompt, vilket gör att bullriga poäng blir en stabil träningssignal.

2 min readSenast uppdaterad

Översikt

It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.

Djupdykning

I förstärkningsinlärning från mänsklig feedback (RLHF) genererar en modell svar och en belöningsmodell ger dem poäng, men råa belöningar är bullriga och varierar kraftigt mellan prompter. Grupperad belöningsnormalisering fixar detta genom att sampla en grupp med flera svar på samma prompt, och sedan normalisera varje belöning genom att subtrahera gruppmedelvärdet och dividera med gruppens standardavvikelse. Denna z-poäng blir fördelen. Tillvägagångssättet är centralt för Group Relative Policy Optimization (GRPO), som introducerats av DeepSeek, som välkände drev DeepSeek-R1:s resonemang. Avgörande är att GRPO eliminerar det separata värdenätverket (kritiker) som används av PPO, eftersom gruppgenomsnittet fungerar som baslinjen. Detta gör träningen enklare, billigare och mer minneseffektiv samtidigt som gradientsignalen hålls väl skalad.

Teknisk insikt

För en grupp av utgångar med belöningar r_1...r_G är fördelen A_i = (r_i − medel(r)) / std(r). Svar som är bättre än deras grupps genomsnitt får positiva fördelar och förstärks; sämre än genomsnittet trycks ner. Eftersom jämförelsen är relativ inom en prompt tar den absoluta belöningsskala och svårighetsgrad per prompt ut, vilket minskar variansen. GRPO håller PPO:s klippta mål och KL-straff mot en referenspolicy för att förhindra att modellen glider för långt.

Strategisk inverkan

Clearer decisions

Det hjälper dig att skilja tydliga tekniska påståenden från marknadsföringsspråk.

Cost and budget

Du kan ställa bättre implementeringsfrågor innan du spenderar pengar eller tid.

Team and workflow

Team med delad förståelse fattar bättre beslut om produkt, policy och lärande.

Framtiden för normalisering av grupperad belöning i RLHF

Grupperad normalisering underblåser resonemangsmodellboomen, där modeller lär sig av verifierbara belöningar som korrekta matematiska svar utan en lärd kritiker. Forskning förfinar det: debatter om huruvida man ska dividera med standardavvikelse, hantera helt korrekta eller helt fel grupper som ger noll fördelar och skala gruppstorlek. Räkna med att grupperade, kritikerfria metoder sprids till agentverktygsanvändning och kodgenerering, där automatiska verifierare levererar billiga, rikliga belöningssignaler.

Real-World Implementation

Träna en matematisk resonemangsmodell genom att ta ett urval av 16 lösningar per problem och belöna de över gruppens genomsnittliga korrekthet.

Finjustera en chatbots hjälpsamhet genom att normalisera belöningsmodellens poäng över flera kandidatsvar på varje användarprompt.

Förbättring av en kodningsassistent där varje provad lösning poängsätts efter om den klarar enhetstester och sedan normaliseras inom gruppen.

Minska GPU-minnet i en RLHF-pipeline genom att ta bort PPO-kritiska nätverket och använda gruppmedelvärdet som baslinje istället.

Risker & skyddsräcken

Olika team kan använda samma term på olika sätt, så definiera omfattning tidigt.

Benchmarks kan se starka ut medan den verkliga prestandan är ojämn.

Att ignorera datakvalitet och utvärderingsplaner skapar ofta bräckliga resultat.

Färdplan för genomförande

1

Börja med en klarspråklig definition av resultatet du behöver.

2

Välj ett framgångsmått och ett feltillstånd innan du testar.

3

Kör en liten pilot med representativ data, inte en polerad demouppsättning.

4

Dokumentera var Grouped Reward Normalization i RLHF hjälper och där enklare metoder är bättre.

Fortsätt utforska

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped Reward Normalization in RLHF quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Starta frågesport

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Längdnormalisering i preferensoptimering

Frequently asked questions

What is Grouped Reward Normalization in RLHF?

Normalisering av grupperad belöning standardiserar en modells belöningar inom en grupp svar på samma prompt, vilket gör att bullriga poäng blir en stabil träningssignal. Det är kärntricket bakom GRPO, algoritmen som driver många moderna resonemangsmodeller.

Vad är belöningen för varje svar jämfört med vid normalisering av grupperad belöning?

Varje belöning omvandlas till en z-poäng med hjälp av medelvärdet och standardavvikelsen för gruppen av svar på samma prompt.

Vilken algoritm är mest förknippad med normalisering av grupperad belöning?

GRPO, introducerad av DeepSeek och används i DeepSeek-R1, är uppbyggd kring normalisering av belöningar inom en grupp.

Vilken komponent av standard PPO eliminerar GRPO särskilt?

Genom att använda gruppgenomsnittet som baslinje, tappar GRPO den inlärda kritiken, vilket sparar minne och beräkning.

Vad händer med ett svar vars belöning är lägre än gruppens medelvärde?

Att subtrahera gruppmedelvärdet gör att svar under genomsnittet har negativa fördelar, vilket driver politiken bort från dem.

Varför minskar normalisering inom en grupp träningsvariansen?

Eftersom jämförelser är relativa inom varje prompt, tvättas skillnader i absolut skala och snabb svårighet ut.