Alapok ÚTMUTATÓ

Csoportosított jutalom normalizálás az RLHF-ben

A csoportosított jutalomnormalizálás szabványosítja a modell jutalmait az ugyanazon felszólításra adott válaszcsoporton belül, és a zajos pontszámokat stabil képzési jellé alakítja.

2 perc olvasásUtoljára frissítve

Áttekintés

It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.

Mély merülés

Az emberi visszacsatolásból való megerősítő tanulás (RLHF) során a modell válaszokat generál, a jutalommodell pedig pontozza azokat, de a nyers jutalmak zajosak és vadul eltérnek az egyes felszólításoktól. A csoportos jutalomnormalizálás ezt úgy javítja ki, hogy több válaszból álló csoportot mintavételez ugyanarra a promptra, majd minden jutalmat normalizál a csoport átlagának kivonásával, és elosztja a csoport szórásával. Ez a z-pontszám előnyt jelent. Ez a megközelítés központi szerepet játszik a DeepSeek által bevezetett Group Relative Policy Optimization (GRPO)-ban, amely a DeepSeek-R1 érvelését híresen hajtotta végre. Lényeges, hogy a GRPO kiküszöböli a PPO által használt különálló értékhálózatot (kritikus), mivel a csoport átlaga szolgál kiindulási alapként. Ez egyszerűbbé, olcsóbbá és memóriahatékonyabbá teszi az edzést, miközben a gradiens jelet jól skálázva tartja.

Technikai betekintés

Az r_1...r_G jutalommal rendelkező kimenetek csoportja esetén az előny A_i = (r_i − átlag(r)) / std(r). A csoportjuk átlagánál jobb válaszok pozitív előnyhöz jutnak és megerősödnek; az átlagosnál rosszabbakat nyomják le. Mivel az összehasonlítás relatív az azonnali jutalomskálán belül, az abszolút jutalomskálán és a felszólításonkénti nehézségek megszűnnek, csökkentve a szórást. A GRPO megtartja a PPO kivágott célját és a KL-büntetést a referencia-politikával szemben, hogy megakadályozza a modell túl messzire sodródását.

Stratégiai hatás

Tisztább döntések

Segít elkülöníteni a világos technikai állításokat a marketing nyelvezettől.

Költség és költségvetés

Feltehet jobb végrehajtási kérdéseket, mielőtt pénzt vagy időt költene.

Csapat és munkafolyamat

A közös tudással rendelkező csapatok jobb döntéseket hoznak a termékekkel, irányelvekkel és tanulással kapcsolatban.

A csoportos jutalom normalizálásának jövője az RLHF-ben

A csoportos normalizálás táplálja az érvelési modellek fellendülését, ahol a modellek olyan ellenőrizhető jutalmakból tanulnak, mint a helyes matematikai válaszok tanult kritikus nélkül. A kutatás finomítja: viták a szórással való osztásról, a teljesen helyes vagy teljesen rossz csoportok kezelése, amelyek nulla előnyt eredményeznek, és a csoport méretének skálázása. Várható, hogy a csoportosított, kritikamentes módszerek elterjednek az ügynöki eszközhasználatra és a kódgenerálásra, ahol az automatikus hitelesítők olcsó, bőséges jutalomjeleket szolgáltatnak.

Valós megvalósítás

Matematikai érvelési modell betanítása feladatonként 16 megoldás mintavételével és a csoport átlagos helyessége felettiek jutalmazásával.

A chatbotok segítőkészségének finomhangolása a jutalommodell pontszámainak normalizálásával az egyes felhasználói kérdésekre adott több jelölt válaszában.

A kódolási asszisztens fejlesztése, ahol minden egyes mintavételezett megoldást pontoznak az alapján, hogy megfelelt-e az egységteszteken, majd a csoporton belül normalizálják.

A GPU-memória csökkentése egy RLHF-folyamatban a PPO kritikus hálózat elvetésével, és helyette a csoportátlagot használva alapként.

Kockázatok és védőkorlátok

A különböző csapatok eltérően használhatják ugyanazt a kifejezést, ezért korán határozza meg a hatókört.

A benchmarkok erősnek tűnhetnek, miközben a valós teljesítmény egyenetlen.

Az adatminőségi és értékelési tervek figyelmen kívül hagyása gyakran törékeny eredményekhez vezet.

Végrehajtási ütemterv

1

Kezdje a kívánt eredmény egyszerű nyelvű meghatározásával.

2

A tesztelés előtt válasszon egy sikermutatót és egy hibafeltételt.

3

Futtasson egy kis pilotot reprezentatív adatokkal, ne egy csiszolt demókészlettel.

4

Dokumentálja, ahol a csoportosított jutalom normalizálása segít az RLHF-ben, és hol jobbak az egyszerűbb módszerek.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped Reward Normalization in RLHF quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Hossz normalizálása a preferenciaoptimalizálásban

Gyakran ismételt kérdések

What is Grouped Reward Normalization in RLHF?

A csoportosított jutalomnormalizálás szabványosítja a modell jutalmait az ugyanazon felszólításra adott válaszcsoporton belül, és a zajos pontszámokat stabil képzési jellé alakítja. Ez az alapvető trükk a GRPO mögött, amely algoritmus sok modern gondolkodási modellt vezérel.

A csoportos jutalomnormalizálás során mihez viszonyítjuk az egyes válaszok jutalmát?

Az egyes jutalmakat z-pontszámmá alakítjuk az ugyanarra a promptra adott válaszcsoport átlagának és szórásának felhasználásával.

Melyik algoritmus kapcsolódik leginkább a csoportos jutalomnormalizáláshoz?

A DeepSeek által bevezetett és a DeepSeek-R1-ben használt GRPO a jutalmak csoporton belüli normalizálására épül.

A szabványos PPO melyik összetevőjét szünteti meg különösen a GRPO?

Ha a csoportátlagot használja kiindulási alapként, a GRPO elveti a tanult kritikust, így memóriát és számítást takarít meg.

Mi történik azzal a válasszal, amelynek jutalma a csoport átlaga alatt van?

Ha levonjuk a csoportátlagot, az átlag alatti válaszok negatív előnnyel járnak, elszorítva tőlük a politikát.

Miért csökkenti a csoporton belüli normalizálás az edzésvarianciát?

Mivel az összehasonlítások az egyes promptokon belül relatívak, az abszolút skála és a felszólítás nehézségei közötti különbségek kimosódnak.