Proximal policyoptimering
Proximal Policy Optimization (PPO) är den förstärkningsinlärningsalgoritm som mest förknippas med finjustering av språkmodeller från mänsklig feedback.
Översikt
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
Djupdykning
PPO introducerades av OpenAI 2017 och blev arbetshästen bakom RLHF för system som InstructGPT och ChatGPT. Kärnutmaningen i policygradient RL är att en enda alltför stor uppdatering kan kollapsa prestandan. PPO adresserar detta med ett "avklippt surrogatmål": det mäter hur mycket mer (eller mindre) sannolikt en åtgärd har blivit jämfört med den gamla policyn, multiplicerar det förhållandet med fördelen (hur mycket bättre åtgärden var än förväntat) och klipper förhållandet till ett litet intervall som 0,8 till 1,2. Detta begränsar hur långt policyn kan flyttas per uppdatering, vilket håller inlärningen stabil samtidigt som den tillåter stadiga förbättringar. I språkmodellen RLHF genererar "handlingen" en token eller ett svar, belöningen kommer från en belöningsmodell och en KL-divergensstraff hindrar modellen från att glida för långt från sitt ursprungliga beteende.
Teknisk insikt
PPO maximerar ett klippt mål: min(förhållande * fördel, klipp(förhållande, 1-eps, 1+eps) * fördel), där förhållandet är sannolikheten för ny-över-gammal handling. Fördelar uppskattas vanligtvis med Generalized Advantage Estimation och ett lärt värde (kritiskt) nätverk. I RLHF kombinerar den totala belöningen belöningsmodellens poäng med en KL-straff per token mot referenspolicyn, vilket balanserar belöningsvinst mot att hålla sig nära den ursprungliga modellen.
Strategisk inverkan
Speed and scale
Språkarbetsflöden kan gå snabbare utan att offra konsekvens.
Access and reach
Det utökar åtkomsten över språk och kommunikationsstilar.
Clearer decisions
Team kan lägga mer tid på bedömning medan automatisering hanterar upprepning.
Framtiden för proximal policyoptimering
PPO är fortfarande stark men är notoriskt krånglig: det behöver ett separat värdenätverk, noggrann hyperparameterinställning och mycket beräkning. Enklare alternativ vinner terräng, inklusive DPO (ingen RL alls) och GRPO, som tappar värdenätverket genom att uppskatta fördelar från grupper av urvalssvar och har drivit nya resonemangsmodeller. PPO kommer att bestå där on-policy utforskning verkligen hjälper, men fältet byter aktivt ut en del av sin komplexitet mot billigare metoder.
Real-World Implementation
Finjustera InstructGPT och ChatGPT för att följa instruktioner och mänskliga preferenser via RLHF
Utbildning av spel- och robotkontrollagenter, PPO:s ursprungliga domän före språkmodeller
Minska toxicitet eller förbättra hjälpsamheten genom att maximera en belöningsmodellpoäng under en KL-begränsning
Optimera verktygsanvändning eller agentbeteende i flera steg där en modell belönas för att utföra uppgifter korrekt
Risker & skyddsräcken
Hallucinerade fakta kan tyst lägga in rapporter, stödflöden eller forskningsresultat.
Snabb känslighet kan skapa inkonsekventa resultat över liknande förfrågningar.
Känsliga textdata kan exponeras om åtkomstkontrollerna är svaga.
Färdplan för genomförande
Definiera utdataformat, ton och kvalitetsstandarder innan lansering.
Marksvar med pålitliga källor närhelst noggrannhet är viktig.
Håll en kontrollpunkt för mänsklig granskning för höga insatser.
Spåra felmönster och träna om uppmaningar eller arbetsflöden regelbundet.
Fortsätt utforska
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Grupprelativ policyoptimering
Frequently asked questions
What is Proximal Policy Optimization?
Proximal Policy Optimization (PPO) är den förstärkningsinlärningsalgoritm som mest förknippas med finjustering av språkmodeller från mänsklig feedback. Det förbättrar en politik i försiktiga, små steg för att undvika den instabilitet som plågar naiva policygradientmetoder.
Vilket problem tar PPO:s "klippning" främst upp?
Att klippa sannolikhetskvoten förhindrar att en enskild uppdatering flyttar policyn för långt, vilket är den främsta källan till instabilitet i policygradientmetoder.
I språkmodell RLHF med PPO, var kommer belöningssignalen vanligtvis ifrån?
En belöningsmodell ger den skalära belöningen för genererade svar, eftersom det skulle vara omöjligt att få människor att poängsätta varje utdata under RL.
Vad gör KL-divergensstraffet i PPO-baserad RLHF?
Per-token KL-straffet mot den ursprungliga (referens) policyn avskräcker modellen från att ändra sitt beteende för drastiskt samtidigt som den jagar belöning.
Vilken roll har värdenätverket (kritiker) i PPO?
PPO är en skådespelare-kritisk metod; värdenätverket uppskattar förväntad belöning, vilket möjliggör uppskattningar av fördelar (ofta via GAE) som minskar variansen.
Vad representerar "fördelen" i PPO?
Fördelen mäter hur mycket bättre (eller sämre) en vald åtgärd var i förhållande till värdeskattningen, och talar om för policyn vilka åtgärder som ska förstärkas.