Csoportosított jutalom normalizálás az RLHF-ben
A csoportosított jutalomnormalizálás szabványosítja a modell jutalmait az ugyanazon felszólításra adott válaszcsoporton belül, és a zajos pontszámokat stabil képzési jellé alakítja.
Áttekintés
It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.
Mély merülés
Az emberi visszacsatolásból való megerősítő tanulás (RLHF) során a modell válaszokat generál, a jutalommodell pedig pontozza azokat, de a nyers jutalmak zajosak és vadul eltérnek az egyes felszólításoktól. A csoportos jutalomnormalizálás ezt úgy javítja ki, hogy több válaszból álló csoportot mintavételez ugyanarra a promptra, majd minden jutalmat normalizál a csoport átlagának kivonásával, és elosztja a csoport szórásával. Ez a z-pontszám előnyt jelent. Ez a megközelítés központi szerepet játszik a DeepSeek által bevezetett Group Relative Policy Optimization (GRPO)-ban, amely a DeepSeek-R1 érvelését híresen hajtotta végre. Lényeges, hogy a GRPO kiküszöböli a PPO által használt különálló értékhálózatot (kritikus), mivel a csoport átlaga szolgál kiindulási alapként. Ez egyszerűbbé, olcsóbbá és memóriahatékonyabbá teszi az edzést, miközben a gradiens jelet jól skálázva tartja.
Technikai betekintés
Az r_1...r_G jutalommal rendelkező kimenetek csoportja esetén az előny A_i = (r_i − átlag(r)) / std(r). A csoportjuk átlagánál jobb válaszok pozitív előnyhöz jutnak és megerősödnek; az átlagosnál rosszabbakat nyomják le. Mivel az összehasonlítás relatív az azonnali jutalomskálán belül, az abszolút jutalomskálán és a felszólításonkénti nehézségek megszűnnek, csökkentve a szórást. A GRPO megtartja a PPO kivágott célját és a KL-büntetést a referencia-politikával szemben, hogy megakadályozza a modell túl messzire sodródását.
Stratégiai hatás
Tisztább döntések
Segít elkülöníteni a világos technikai állításokat a marketing nyelvezettől.
Költség és költségvetés
Feltehet jobb végrehajtási kérdéseket, mielőtt pénzt vagy időt költene.
Csapat és munkafolyamat
A közös tudással rendelkező csapatok jobb döntéseket hoznak a termékekkel, irányelvekkel és tanulással kapcsolatban.
A csoportos jutalom normalizálásának jövője az RLHF-ben
A csoportos normalizálás táplálja az érvelési modellek fellendülését, ahol a modellek olyan ellenőrizhető jutalmakból tanulnak, mint a helyes matematikai válaszok tanult kritikus nélkül. A kutatás finomítja: viták a szórással való osztásról, a teljesen helyes vagy teljesen rossz csoportok kezelése, amelyek nulla előnyt eredményeznek, és a csoport méretének skálázása. Várható, hogy a csoportosított, kritikamentes módszerek elterjednek az ügynöki eszközhasználatra és a kódgenerálásra, ahol az automatikus hitelesítők olcsó, bőséges jutalomjeleket szolgáltatnak.
Valós megvalósítás
Matematikai érvelési modell betanítása feladatonként 16 megoldás mintavételével és a csoport átlagos helyessége felettiek jutalmazásával.
A chatbotok segítőkészségének finomhangolása a jutalommodell pontszámainak normalizálásával az egyes felhasználói kérdésekre adott több jelölt válaszában.
A kódolási asszisztens fejlesztése, ahol minden egyes mintavételezett megoldást pontoznak az alapján, hogy megfelelt-e az egységteszteken, majd a csoporton belül normalizálják.
A GPU-memória csökkentése egy RLHF-folyamatban a PPO kritikus hálózat elvetésével, és helyette a csoportátlagot használva alapként.
Kockázatok és védőkorlátok
A különböző csapatok eltérően használhatják ugyanazt a kifejezést, ezért korán határozza meg a hatókört.
A benchmarkok erősnek tűnhetnek, miközben a valós teljesítmény egyenetlen.
Az adatminőségi és értékelési tervek figyelmen kívül hagyása gyakran törékeny eredményekhez vezet.
Végrehajtási ütemterv
Kezdje a kívánt eredmény egyszerű nyelvű meghatározásával.
A tesztelés előtt válasszon egy sikermutatót és egy hibafeltételt.
Futtasson egy kis pilotot reprezentatív adatokkal, ne egy csiszolt demókészlettel.
Dokumentálja, ahol a csoportosított jutalom normalizálása segít az RLHF-ben, és hol jobbak az egyszerűbb módszerek.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grouped Reward Normalization in RLHF quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Hossz normalizálása a preferenciaoptimalizálásban
Gyakran ismételt kérdések
What is Grouped Reward Normalization in RLHF?
A csoportosított jutalomnormalizálás szabványosítja a modell jutalmait az ugyanazon felszólításra adott válaszcsoporton belül, és a zajos pontszámokat stabil képzési jellé alakítja. Ez az alapvető trükk a GRPO mögött, amely algoritmus sok modern gondolkodási modellt vezérel.
A csoportos jutalomnormalizálás során mihez viszonyítjuk az egyes válaszok jutalmát?
Az egyes jutalmakat z-pontszámmá alakítjuk az ugyanarra a promptra adott válaszcsoport átlagának és szórásának felhasználásával.
Melyik algoritmus kapcsolódik leginkább a csoportos jutalomnormalizáláshoz?
A DeepSeek által bevezetett és a DeepSeek-R1-ben használt GRPO a jutalmak csoporton belüli normalizálására épül.
A szabványos PPO melyik összetevőjét szünteti meg különösen a GRPO?
Ha a csoportátlagot használja kiindulási alapként, a GRPO elveti a tanult kritikust, így memóriát és számítást takarít meg.
Mi történik azzal a válasszal, amelynek jutalma a csoport átlaga alatt van?
Ha levonjuk a csoportátlagot, az átlag alatti válaszok negatív előnnyel járnak, elszorítva tőlük a politikát.
Miért csökkenti a csoporton belüli normalizálás az edzésvarianciát?
Mivel az összehasonlítások az egyes promptokon belül relatívak, az abszolút skála és a felszólítás nehézségei közötti különbségek kimosódnak.