Proximale beleidsoptimalisatie
Proximal Policy Optimization (PPO) is het versterkende leeralgoritme dat het meest wordt geassocieerd met het verfijnen van taalmodellen op basis van menselijke feedback.
Overzicht
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
Diepe duik
PPO werd in 2017 geïntroduceerd door OpenAI en werd het werkpaard achter RLHF voor systemen als InstructGPT en ChatGPT. De kernuitdaging bij beleidsgradiënt-RL is dat een enkele te grote update de prestaties kan instorten. PPO pakt dit aan met een 'geknipte surrogaatdoelstelling': het meet hoeveel waarschijnlijker (of minder) een actie is geworden ten opzichte van het oude beleid, vermenigvuldigt die verhouding met het voordeel (hoeveel beter de actie was dan verwacht) en knipt de verhouding af tot een klein bereik, zoals 0,8 tot 1,2. Dit beperkt de mate waarin het beleid per update kan worden verplaatst, waardoor het leren stabiel blijft en toch een gestage verbetering mogelijk is. In het taalmodel RLHF genereert de 'actie' een token of reactie, de beloning komt van een beloningsmodel, en een KL-divergentiestraf zorgt ervoor dat het model niet te ver afdwaalt van zijn oorspronkelijke gedrag.
Technisch inzicht
PPO maximaliseert een afgekapt doel: min(ratio * voordeel, clip(ratio, 1-eps, 1+eps) * voordeel), waarbij ratio de nieuwe-over-oude actiewaarschijnlijkheid is. Voordelen worden meestal geschat met behulp van Generalized Advantage Estimation en een netwerk van geleerde waarden (critici). In RLHF combineert de totale beloning de score van het beloningsmodel met een KL-straf per token ten opzichte van het referentiebeleid, waarbij de beloningswinst wordt afgewogen tegen het dicht bij het oorspronkelijke model blijven.
Strategische impact
Speed and scale
Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.
Access and reach
Het breidt de toegang uit naar meerdere talen en communicatiestijlen.
Clearer decisions
Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.
De toekomst van proximale beleidsoptimalisatie
PPO blijft sterk, maar is notoir onhandig: het heeft een afzonderlijk waardenetwerk, zorgvuldige afstemming van hyperparameters en veel rekenkracht nodig. Eenvoudigere alternatieven winnen terrein, waaronder DPO (helemaal geen RL) en GRPO, die het waardenetwerk laten vallen door de voordelen van groepen steekproefreacties in te schatten en recente redeneermodellen hebben aangedreven. PPO zal blijven bestaan waar onderzoek op het beleidsterrein echt helpt, maar het veld ruilt actief een deel van zijn complexiteit in voor goedkopere methoden.
Implementatie in de echte wereld
Verfijning van InstructGPT en ChatGPT om instructies en menselijke voorkeuren te volgen via RLHF
Het trainen van gameplay- en robotica-controleagenten, het oorspronkelijke domein van PPO vóór taalmodellen
Het verminderen van de toxiciteit of het verbeteren van de behulpzaamheid door het maximaliseren van de score van een beloningsmodel onder een KL-beperking
Het optimaliseren van het gebruik van tools of het gedrag van agenten in meerdere stappen, waarbij een model wordt beloond voor het correct voltooien van taken
Risico's en vangrails
Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.
Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.
Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.
Implementatie routekaart
Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.
Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.
Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.
Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Groepsrelatieve beleidsoptimalisatie
Frequently asked questions
What is Proximal Policy Optimization?
Proximal Policy Optimization (PPO) is het versterkende leeralgoritme dat het meest wordt geassocieerd met het verfijnen van taalmodellen op basis van menselijke feedback. Het verbetert een beleid in zorgvuldige, kleine stappen om de instabiliteit te vermijden die naïeve beleidsgradiëntmethoden teistert.
Welk probleem wordt met de 'clipping' van PPO in de eerste plaats aangepakt?
Door de waarschijnlijkheidsratio te beperken, wordt voorkomen dat een enkele update het beleid te ver doorvoert, wat de belangrijkste bron van instabiliteit is in beleidsgradiëntmethoden.
Waar komt het beloningssignaal gewoonlijk vandaan in het taalmodel RLHF met PPO?
Een beloningsmodel biedt de scalaire beloning voor gegenereerde reacties, aangezien het onhaalbaar zou zijn om mensen elke output tijdens RL te laten scoren.
Wat doet de KL-divergentiestraf in op PPO gebaseerde RLHF?
De KL-straf per token ten opzichte van het oorspronkelijke (referentie)beleid ontmoedigt het model om zijn gedrag te drastisch te veranderen terwijl hij op beloning jaagt.
Wat is de rol van het waarde(kritiek)netwerk in PPO?
PPO is een actor-criticusmethode; het waardenetwerk schat de verwachte beloning, waardoor voordeelschattingen mogelijk worden (vaak via GAE) die de variantie verminderen.
Wat betekent het 'voordeel' bij PPO?
Het voordeel meet hoeveel beter (of slechter) een gekozen actie was in verhouding tot de waardeschatting, en vertelt het beleid welke acties moeten worden versterkt.