Nyelvi AI ÚTMUTATÓ

Proximális házirend optimalizálása

A Proximális Policy Optimization (PPO) az a megerősítő tanulási algoritmus, amely leginkább az emberi visszajelzésekből származó nyelvi modellek finomhangolásához kapcsolódik.

2 perc olvasásUtoljára frissítve

Áttekintés

It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.

Mély merülés

A PPO-t OpenAI vezette be 2017-ben, és az RLHF igáslója lett olyan rendszerekben, mint az InstructGPT és a ChatGPT. A házirend-gradiens RL fő kihívása az, hogy egyetlen túl nagy frissítés összeomolhatja a teljesítményt. A PPO ezt egy „levágott helyettesítő céllal” kezeli: azt méri, hogy mennyivel nagyobb (vagy kevésbé) valószínű egy akció a régi politikához képest, megszorozza ezt az arányt az előnnyel (mennyivel volt jobb a művelet a vártnál), és az arányt egy kis tartományra, például 0,8-1,2-re vágja. Ez korlátozza, hogy a házirend mennyit tud elmozdulni frissítésenként, stabilan tartva a tanulást, miközben lehetővé teszi a folyamatos fejlődést. Az RLHF nyelvi modellben a „cselekvés” jelzőt vagy választ generál, a jutalom egy jutalommodelltől származik, és a KL-divergencia büntetés megakadályozza, hogy a modell túl messzire sodródjon eredeti viselkedésétől.

Technikai betekintés

A PPO maximalizálja a vágott célt: min(arány * előny, klip(arány, 1-ep, 1+eps) *előny), ahol az arány az új-régi akció valószínűsége. Az előnyöket általában általánosított előnybecsléssel és tanult érték (kritikus) hálózattal becsülik meg. Az RLHF-ben a teljes jutalom a jutalommodell pontszámát egy tokenenkénti KL-büntetéssel kombinálja a referenciapolitikával szemben, egyensúlyt teremtve a jutalomnyereség és az eredeti modell közelében maradással.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

A proximális politikaoptimalizálás jövője

A PPO továbbra is erős, de köztudottan macerás: külön értékhálózatra, gondos hiperparaméter-hangolásra és sok számításra van szüksége. Az egyszerűbb alternatívák egyre nagyobb teret hódítanak, beleértve a DPO-t (egyáltalán nincs RL) és a GRPO-t, amely ledobja az értékhálózatot azáltal, hogy megbecsüli a mintavételezett válaszok csoportjaiból származó előnyöket, és a legújabb érvelési modelleket hajtotta végre. A PPO kitart ott, ahol az on-policy feltárás valóban segít, de a terület összetettsége egy részét aktívan olcsóbb módszerekre cseréli.

Valós megvalósítás

Az InstructGPT és ChatGPT finomhangolása az utasítások és az emberi preferenciák követéséhez RLHF-n keresztül

Játékos és robotikai irányító ügynökök képzése, a PPO eredeti tartománya a nyelvi modellek előtt

A toxicitás csökkentése vagy a segítőkészség javítása a jutalommodell pontszámának maximalizálásával KL-korlátozás mellett

Az eszközhasználat vagy a többlépéses ügynök viselkedésének optimalizálása, ahol a modellt jutalmazzák a feladatok helyes végrehajtásáért

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Proximal Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Csoportos relatív házirend optimalizálása

Gyakran ismételt kérdések

What is Proximal Policy Optimization?

A Proximális Policy Optimization (PPO) az a megerősítő tanulási algoritmus, amely leginkább az emberi visszajelzésekből származó nyelvi modellek finomhangolásához kapcsolódik. Óvatos, kis lépésekben javítja a szabályzatot, hogy elkerülje a naiv politikai gradiens módszereket sújtó instabilitást.

Milyen problémát old meg elsősorban a PPO „kivágása”?

A valószínűségi arány levágása megakadályozza, hogy egyetlen frissítés túl messzire mozdítsa a házirendet, ami az irányelv-gradiens módszerek instabilitásának fő forrása.

A PPO-val rendelkező RLHF nyelvi modellben általában honnan jön a jutalomjel?

A jutalmazási modell a generált válaszok skaláris jutalmát adja meg, mivel lehetetlen lenne, ha az emberek minden kimenetet pontoznának az RL során.

Mit tesz a KL-divergencia büntetés a PPO-alapú RLHF-ben?

A tokenenkénti KL-büntetés az eredeti (referencia) politikával szemben eltántorítja a modellt attól, hogy túlságosan drasztikusan megváltoztassa viselkedését, miközben jutalomra törekszik.

Mi a szerepe az érték- (kritikus) hálózatnak a PPO-ban?

A PPO egy színészkritikus módszer; az értékhálózat megbecsüli a várható jutalmat, lehetővé téve az előnybecsléseket (gyakran a GAE-n keresztül), amelyek csökkentik a szórást.

Mit jelent az „előny” a PPO-ban?

Az előny azt méri, hogy egy kiválasztott akció mennyivel volt jobb (vagy rosszabb) az értékbecsléshez képest, és megmondja a politika számára, hogy mely intézkedéseket kell megerősítenie.