Csoportos relatív házirend optimalizálása
A Group Relative Policy Optimization (GRPO) egy megerősítő-tanulási módszer a nyelvi modellek finomhangolásához, amely minden választ az ugyanazon prompthoz adott testvérválaszok csoportjához viszonyít, kiküszöbölve a PPO által használt különálló értékhálózatot.
Áttekintés
It became famous as the core training trick behind DeepSeek's reasoning models.
Mély merülés
A GRPO a politika-gradiens megerősítő tanulás egy változata, amelyet arra terveztek, hogy a nagy nyelvi modellek RL finomhangolását olcsóbbá és stabilabbá tegye. A szabványos PPO-nak szüksége van egy tanult „kritikusra” (értékmodellre), amely nagyjából akkora, mint maga a szabályzat, hogy megbecsülje, milyen jók az egyes tokenek. A GRPO teljesen eltávolítja ezt a kritikust. Minden felszólításnál mintát vesz a teljesítések egy csoportjából (mondjuk 8-64), mindegyiket jutalomjellel pontozza, majd kiszámítja az egyes teljesítések előnyét úgy, hogy a jutalmat standardizálja a csoport átlagával és szórásával. Az átlag feletti válaszokat megerősítjük, az átlag alattiakat pedig elnyomjuk. A KL-divergencia kifejezés a modellt egy referenciapolitika közelében tartja. A DeepSeek által bevezetett, a DeepSeekMath és a DeepSeek-R1 gondolkodási modelleket hajtotta végre.
Technikai betekintés
A kulcsötlet az, hogy a PPO tanult érték alapvonalát egy Monte Carlo-csoport alapvonalára cseréljük. Az r_i jutalommal rendelkező kimenetek csoportja esetén mindegyik előny A_i = (r_i - átlag(r)) / std(r). Ez a normalizált pontszám megszorozza a kivágott valószínűségi arányt, pontosan úgy, mint a PPO-ban, és egy KL-büntetés egy befagyott referenciamodell ellen megfékezi a sodródást. Mivel egyetlen kritikus sem képzett, a memória és a számítások nagyjából felére csökkennek, és a promptonkénti normalizálás természetesen skálázott, alacsony szórású előnyöket biztosít.
Stratégiai hatás
Költség és költségvetés
Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.
Tisztább döntések
A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.
Minőségellenőrzés
A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.
A csoportos relatív irányelvek optimalizálásának jövője
A GRPO gyorsan a nyílt gondolkodási modellek képzésének alapértelmezett receptjévé vált, és a laboratóriumok ismétlődnek a gyenge pontjain. A kutatók a hossz- és nehézségi torzítások (mint például a Dr. GRPO), a token-szintű normalizálás, nem pedig a szekvenciaszintű normalizálás, valamint a KL-kifejezés eltávolítását vagy átalakítását vizsgálják. Szorosabb integrációra számíthat, ellenőrizhető jutalmakkal (matematika, kód, eszközhasználat), a ritka jelek jobb kezelésével, valamint olyan hibridekkel, amelyek egyesítik a csoport alapvonalait könnyű kritikusokkal az ügynöki, többlépcsős feladatokhoz.
Valós megvalósítás
A DeepSeek-R1 és a DeepSeekMath betanítása hosszú gondolati láncú érvelés előállításához, matematikai feladatok szabályalapú helyességjutalmazásával
A kódgenerálási modellek finomhangolása, ahol minden mintavételezett megoldást aszerint pontoznak, hogy megfelelt-e az egységteszteken, és a csoportot normalizálják a győztesek kiválasztásához
Nyílt forráskódú RLHF-folyamatok (pl. TRL és verl könyvtárakban), amelyek GRPO-t használnak a csevegési modellek összehangolására anélkül, hogy külön értékhálózatért kellene fizetni
Az utasítások követésének vagy biztonsági viselkedésének javítása felszólításonként több válasz mintavételével, és jutalmazzuk azokat, amelyeknek jutalmazási modellje a társaikhoz képest a legmagasabb.
Kockázatok és védőkorlátok
Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.
Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.
A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.
Végrehajtási ütemterv
Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.
Benchmark reális terhelési és adatviszonyok mellett.
Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.
A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Group Relative Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Proximális házirend optimalizálása
Gyakran ismételt kérdések
What is Group Relative Policy Optimization?
A Group Relative Policy Optimization (GRPO) egy megerősítő-tanulási módszer a nyelvi modellek finomhangolásához, amely minden választ az ugyanazon prompthoz adott testvérválaszok csoportjához viszonyít, kiküszöbölve a PPO által használt különálló értékhálózatot. A DeepSeek érvelési modelljei mögött meghúzódó alapvető tréningtrükkként vált híressé.
A PPO melyik fő összetevőjét szünteti meg a GRPO?
A GRPO aláírás-módosítása elveti a PPO tanult érték/kritikus modelljét, amely általában körülbelül akkora, mint a házirend, így jelentős memóriát és számítást takarít meg.
Hogyan számítja ki a GRPO egy adott teljesítési előnyt?
Minden teljesítés előnye (jutalom - csoport átlaga) / csoport szórása, így az azonos kérdésre adott válaszok csoportja az alapvonalat jelenti.
Mely modellek tették ismertté a GRPO-t?
A GRPO-t a DeepSeek vezette be és népszerűsítette, különösen a DeepSeekMath-ban és a DeepSeek-R1 gondolkodási modellek mögötti RL motorként.
Milyen szerepet játszik a KL-divergencia kifejezés a GRPO-ban?
A referencia (általában az RL előtti) modell ellen adott KL büntetés rendszeresíti a képzést, így a politika javul anélkül, hogy összeomlana vagy degenerált kimenetekké sodródna.
Miért különösen vonzó a GRPO a matematikai vagy kódolási gondolkodási modellek képzéséhez?
Számos megoldás mintavétele és automatikus helyesség-ellenőrzéssel történő pontozása tisztán párosul a GRPO csoportnormalizált előnyeivel, nincs szükség kritikára.