Gegroepeerde beloningsnormalisatie in RLHF
Normalisatie van gegroepeerde beloningen standaardiseert de beloningen van een model binnen een reeks reacties op dezelfde prompt, waardoor luidruchtige scores worden omgezet in een stabiel trainingssignaal.
Overzicht
It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.
Diepe duik
Bij versterkend leren van menselijke feedback (RLHF) genereert een model reacties en een beloningsmodel scoort deze, maar ruwe beloningen zijn luidruchtig en variëren enorm per prompt. Normalisatie van gegroepeerde beloningen lost dit op door een groep van verschillende reacties op dezelfde prompt te bemonsteren en vervolgens elke beloning te normaliseren door het groepsgemiddelde af te trekken en te delen door de standaarddeviatie van de groep. Deze z-score wordt het voordeel. Deze aanpak staat centraal in Group Relative Policy Optimization (GRPO), geïntroduceerd door DeepSeek, die de beroemde redenering van DeepSeek-R1 aanwakkerde. Cruciaal is dat GRPO het afzonderlijke waardenetwerk (criticus) elimineert dat door PPO wordt gebruikt, aangezien het groepsgemiddelde als basis dient. Dit maakt training eenvoudiger, goedkoper en geheugenefficiënter, terwijl het gradiëntsignaal goed geschaald blijft.
Technisch inzicht
Voor een groep outputs met beloningen r_1...r_G is het voordeel A_i = (r_i − mean(r)) / std(r). Reacties die beter zijn dan het gemiddelde van hun groep krijgen een positief voordeel en worden versterkt; slechter dan gemiddeld worden naar beneden gedrukt. Omdat vergelijking binnen een prompt relatief is, vallen de absolute beloningsschaal en de moeilijkheidsgraad per prompt weg, waardoor de variantie afneemt. GRPO houdt de beperkte doelstelling en de KL-boete van PPO in lijn met een referentiebeleid om te voorkomen dat het model te ver afdrijft.
Strategische impact
Clearer decisions
Het helpt u duidelijke technische claims te scheiden van marketingtaal.
Cost and budget
U kunt betere implementatievragen stellen voordat u geld of tijd uitgeeft.
Team and workflow
Teams met gedeeld begrip nemen betere product-, beleids- en leerbeslissingen.
De toekomst van gegroepeerde beloningsnormalisatie in RLHF
Gegroepeerde normalisatie voedt de hausse aan redeneermodellen, waarbij modellen leren van verifieerbare beloningen zoals correcte wiskundige antwoorden zonder een geleerde criticus. Onderzoek verfijnt het: debatten over de vraag of we moeten delen op basis van standaarddeviatie, het hanteren van geheel correcte of geheel verkeerde groepen die geen enkel voordeel opleveren, en het opschalen van de groepsgrootte. Verwacht dat gegroepeerde, kritiekvrije methoden zich zullen verspreiden naar het gebruik van agentische tools en het genereren van code, waarbij automatische verificateurs goedkope, overvloedige beloningssignalen leveren.
Implementatie in de echte wereld
Een wiskundig redeneermodel trainen door 16 oplossingen per probleem te bemonsteren en de oplossingen boven de gemiddelde correctheid van de groep te belonen.
Het verfijnen van de behulpzaamheid van een chatbot door de scores van het beloningsmodel te normaliseren voor verschillende antwoorden van kandidaten op elke gebruikersprompt.
Het verbeteren van een codeerassistent waarbij elke bemonsterde oplossing wordt gescoord op basis van het feit of deze de unit-tests doorstaat, en vervolgens wordt genormaliseerd binnen de groep.
Het GPU-geheugen in een RLHF-pijplijn verminderen door het PPO-criticinetwerk te laten vallen en in plaats daarvan het groepsgemiddelde als basislijn te gebruiken.
Risico's en vangrails
Verschillende teams kunnen dezelfde term verschillend gebruiken, dus definieer de reikwijdte vroeg.
Benchmarks kunnen er sterk uitzien, terwijl de prestaties in de echte wereld ongelijkmatig zijn.
Het negeren van datakwaliteit en evaluatieplannen zorgt vaak voor fragiele resultaten.
Implementatie routekaart
Begin met een definitie in duidelijke taal van het gewenste resultaat.
Kies één successtatistiek en één faalconditie voordat u gaat testen.
Voer een kleine pilot uit met representatieve gegevens, niet met een gepolijste demoset.
Documenteer waar Grouped Reward Normalization in RLHF helpt en waar eenvoudigere methoden beter zijn.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grouped Reward Normalization in RLHF quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Lengtenormalisatie in voorkeursoptimalisatie
Frequently asked questions
What is Grouped Reward Normalization in RLHF?
Normalisatie van gegroepeerde beloningen standaardiseert de beloningen van een model binnen een reeks reacties op dezelfde prompt, waardoor luidruchtige scores worden omgezet in een stabiel trainingssignaal. Het is de kerntruc achter GRPO, het algoritme dat veel moderne redeneermodellen aandrijft.
Waarmee wordt bij gegroepeerde beloningsnormalisatie de beloning van elke reactie vergeleken?
Elke beloning wordt omgezet in een z-score op basis van het gemiddelde en de standaarddeviatie van de groep reacties op dezelfde prompt.
Welk algoritme wordt het meest geassocieerd met gegroepeerde beloningsnormalisatie?
GRPO, geïntroduceerd door DeepSeek en gebruikt in DeepSeek-R1, is gebouwd rond het normaliseren van beloningen binnen een groep.
Welk onderdeel van standaard PPO elimineert GRPO met name?
Door het groepsgemiddelde als basislijn te gebruiken, laat GRPO de geleerde criticus vallen, waardoor geheugen en rekenkracht worden bespaard.
Wat gebeurt er met een reactie waarvan de beloning lager is dan het gemiddelde van de groep?
Door het groepsgemiddelde ervan af te trekken, krijgen reacties die onder het gemiddelde liggen een negatief voordeel, waardoor het beleid van hen af wordt geduwd.
Waarom vermindert normalisatie binnen een groep de trainingsvariantie?
Omdat vergelijkingen binnen elke prompt relatief zijn, verdwijnen de verschillen in absolute schaal en moeilijkheidsgraad.