Proksimal policyoptimalisering
Proximal Policy Optimization (PPO) er den forsterkende læringsalgoritmen som er mest knyttet til finjustering av språkmodeller fra menneskelig tilbakemelding.
Oversikt
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
Dypdykk
PPO ble introdusert av OpenAI i 2017 og ble arbeidshesten bak RLHF for systemer som InstructGPT og ChatGPT. Kjerneutfordringen i policy-gradient RL er at en enkelt for stor oppdatering kan kollapse ytelsen. PPO adresserer dette med et "klippet surrogatmål": den måler hvor mye mer (eller mindre) sannsynlig en handling har blitt i forhold til den gamle policyen, multipliserer dette forholdet med fordelen (hvor mye bedre handlingen var enn forventet), og klipper forholdet til et lite område som 0,8 til 1,2. Dette begrenser hvor langt policyen kan bevege seg per oppdatering, og holder læringen stabil samtidig som den tillater jevn forbedring. I språkmodellen RLHF genererer 'handlingen' en token eller respons, belønningen kommer fra en belønningsmodell, og en KL-divergensstraff hindrer modellen fra å drive for langt fra sin opprinnelige oppførsel.
Teknisk innsikt
PPO maksimerer et klippet mål: min(ratio * fordel, klipp(ratio, 1-eps, 1+eps) * fordel), der ratio er ny-over-gammel handlingssannsynlighet. Fordeler estimeres vanligvis med Generalized Advantage Estimation og et lært verdi (kritisk) nettverk. I RLHF kombinerer den totale belønningen belønningsmodellens poengsum med en KL-straff per token mot referansepolitikken, og balanserer belønningsgevinst mot å holde seg nær den opprinnelige modellen.
Strategisk innvirkning
Speed and scale
Språkarbeidsflyter kan bevege seg raskere uten å ofre konsistens.
Access and reach
Det utvider tilgangen på tvers av språk og kommunikasjonsstiler.
Tydeligere avgjørelser
Lag kan bruke mer tid på dømmekraft mens automatisering håndterer repetisjon.
Fremtiden for proksimal policyoptimalisering
PPO er fortsatt sterk, men er notorisk vanskelig: den trenger et eget verdinettverk, nøye justering av hyperparametere og mye databehandling. Enklere alternativer vinner terreng, inkludert DPO (ingen RL i det hele tatt) og GRPO, som dropper verdinettverket ved å estimere fordeler fra grupper av utvalgte svar og har drevet nyere resonneringsmodeller. PPO vil vedvare der on-policy utforskning virkelig hjelper, men feltet handler aktivt noe av kompleksiteten for billigere metoder.
Real-World Implementering
Finjustere InstructGPT og ChatGPT for å følge instruksjoner og menneskelige preferanser via RLHF
Trening av spill- og robotkontrollagenter, PPOs originale domene før språkmodeller
Redusere toksisitet eller forbedre hjelpsomheten ved å maksimere en belønningsmodellscore under en KL-begrensning
Optimalisering av verktøybruk eller agentatferd i flere trinn der en modell belønnes for å fullføre oppgaver riktig
Risikoer og rekkverk
Hallusinerte fakta kan stille inn rapporter, støttestrømmer eller forskningsresultater.
Umiddelbar følsomhet kan skape inkonsistente resultater på tvers av lignende forespørsler.
Sensitive tekstdata kan bli eksponert hvis tilgangskontrollene er svake.
Veikart for implementering
Definer utdataformat, tone og kvalitetsstandarder før utrulling.
Bakgrunnssvar med pålitelige kilder når nøyaktighet er viktig.
Hold et sjekkpunkt for menneskelig vurdering for utganger med høy innsats.
Spor feilmønstre og tren opp meldinger eller arbeidsflyter regelmessig.
Fortsett å utforske
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Neste guide
Optimalisering av grupperelativ policy
Ofte stilte spørsmål
What is Proximal Policy Optimization?
Proximal Policy Optimization (PPO) er den forsterkende læringsalgoritmen som er mest knyttet til finjustering av språkmodeller fra menneskelig tilbakemelding. Det forbedrer en politikk med forsiktige, små skritt for å unngå ustabiliteten som plager naive politikkgradientmetoder.
Hvilket problem adresserer PPOs 'klipping' primært?
Å klippe sannsynlighetsforholdet forhindrer at en enkelt oppdatering flytter policyen for langt, som er hovedkilden til ustabilitet i policy-gradientmetoder.
I språkmodell RLHF med PPO, hvor kommer belønningssignalet vanligvis fra?
En belønningsmodell gir den skalære belønningen for genererte svar, siden det ville være umulig å få mennesker til å score hver utgang under RL.
Hva gjør KL-divergensstraffen i PPO-basert RLHF?
Per-token KL-straffen mot den opprinnelige (referanse) policyen fraråder modellen fra å endre oppførselen for drastisk mens den jager belønning.
Hva er rollen til verdinettverket (kritisk) i PPO?
PPO er en skuespillerkritisk metode; verdinettverket anslår forventet belønning, og muliggjør fordelestimater (ofte via GAE) som reduserer variansen.
Hva representerer "fordelen" i PPO?
Fordelen måler hvor mye bedre (eller dårligere) en valgt handling var i forhold til verdiestimatet, og forteller policyen hvilke handlinger som skal forsterkes.