Proximális házirend optimalizálása
A Proximális Policy Optimization (PPO) az a megerősítő tanulási algoritmus, amely leginkább az emberi visszajelzésekből származó nyelvi modellek finomhangolásához kapcsolódik.
Áttekintés
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
Mély merülés
A PPO-t OpenAI vezette be 2017-ben, és az RLHF igáslója lett olyan rendszerekben, mint az InstructGPT és a ChatGPT. A házirend-gradiens RL fő kihívása az, hogy egyetlen túl nagy frissítés összeomolhatja a teljesítményt. A PPO ezt egy „levágott helyettesítő céllal” kezeli: azt méri, hogy mennyivel nagyobb (vagy kevésbé) valószínű egy akció a régi politikához képest, megszorozza ezt az arányt az előnnyel (mennyivel volt jobb a művelet a vártnál), és az arányt egy kis tartományra, például 0,8-1,2-re vágja. Ez korlátozza, hogy a házirend mennyit tud elmozdulni frissítésenként, stabilan tartva a tanulást, miközben lehetővé teszi a folyamatos fejlődést. Az RLHF nyelvi modellben a „cselekvés” jelzőt vagy választ generál, a jutalom egy jutalommodelltől származik, és a KL-divergencia büntetés megakadályozza, hogy a modell túl messzire sodródjon eredeti viselkedésétől.
Technikai betekintés
A PPO maximalizálja a vágott célt: min(arány * előny, klip(arány, 1-ep, 1+eps) *előny), ahol az arány az új-régi akció valószínűsége. Az előnyöket általában általánosított előnybecsléssel és tanult érték (kritikus) hálózattal becsülik meg. Az RLHF-ben a teljes jutalom a jutalommodell pontszámát egy tokenenkénti KL-büntetéssel kombinálja a referenciapolitikával szemben, egyensúlyt teremtve a jutalomnyereség és az eredeti modell közelében maradással.
Stratégiai hatás
Sebesség és méretarány
A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.
Hozzáférés és elérés
Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.
Tisztább döntések
A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.
A proximális politikaoptimalizálás jövője
A PPO továbbra is erős, de köztudottan macerás: külön értékhálózatra, gondos hiperparaméter-hangolásra és sok számításra van szüksége. Az egyszerűbb alternatívák egyre nagyobb teret hódítanak, beleértve a DPO-t (egyáltalán nincs RL) és a GRPO-t, amely ledobja az értékhálózatot azáltal, hogy megbecsüli a mintavételezett válaszok csoportjaiból származó előnyöket, és a legújabb érvelési modelleket hajtotta végre. A PPO kitart ott, ahol az on-policy feltárás valóban segít, de a terület összetettsége egy részét aktívan olcsóbb módszerekre cseréli.
Valós megvalósítás
Az InstructGPT és ChatGPT finomhangolása az utasítások és az emberi preferenciák követéséhez RLHF-n keresztül
Játékos és robotikai irányító ügynökök képzése, a PPO eredeti tartománya a nyelvi modellek előtt
A toxicitás csökkentése vagy a segítőkészség javítása a jutalommodell pontszámának maximalizálásával KL-korlátozás mellett
Az eszközhasználat vagy a többlépéses ügynök viselkedésének optimalizálása, ahol a modellt jutalmazzák a feladatok helyes végrehajtásáért
Kockázatok és védőkorlátok
A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.
Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.
Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.
Végrehajtási ütemterv
A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.
Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.
Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.
Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Csoportos relatív házirend optimalizálása
Gyakran ismételt kérdések
What is Proximal Policy Optimization?
A Proximális Policy Optimization (PPO) az a megerősítő tanulási algoritmus, amely leginkább az emberi visszajelzésekből származó nyelvi modellek finomhangolásához kapcsolódik. Óvatos, kis lépésekben javítja a szabályzatot, hogy elkerülje a naiv politikai gradiens módszereket sújtó instabilitást.
Milyen problémát old meg elsősorban a PPO „kivágása”?
A valószínűségi arány levágása megakadályozza, hogy egyetlen frissítés túl messzire mozdítsa a házirendet, ami az irányelv-gradiens módszerek instabilitásának fő forrása.
A PPO-val rendelkező RLHF nyelvi modellben általában honnan jön a jutalomjel?
A jutalmazási modell a generált válaszok skaláris jutalmát adja meg, mivel lehetetlen lenne, ha az emberek minden kimenetet pontoznának az RL során.
Mit tesz a KL-divergencia büntetés a PPO-alapú RLHF-ben?
A tokenenkénti KL-büntetés az eredeti (referencia) politikával szemben eltántorítja a modellt attól, hogy túlságosan drasztikusan megváltoztassa viselkedését, miközben jutalomra törekszik.
Mi a szerepe az érték- (kritikus) hálózatnak a PPO-ban?
A PPO egy színészkritikus módszer; az értékhálózat megbecsüli a várható jutalmat, lehetővé téve az előnybecsléseket (gyakran a GAE-n keresztül), amelyek csökkentik a szórást.
Mit jelent az „előny” a PPO-ban?
Az előny azt méri, hogy egy kiválasztott akció mennyivel volt jobb (vagy rosszabb) az értékbecsléshez képest, és megmondja a politika számára, hogy mely intézkedéseket kell megerősítenie.