Taal AI-GIDS

Proximale beleidsoptimalisatie

Proximal Policy Optimization (PPO) is het versterkende leeralgoritme dat het meest wordt geassocieerd met het verfijnen van taalmodellen op basis van menselijke feedback.

2 min readLaatst bijgewerkt

Overzicht

It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.

Diepe duik

PPO werd in 2017 geïntroduceerd door OpenAI en werd het werkpaard achter RLHF voor systemen als InstructGPT en ChatGPT. De kernuitdaging bij beleidsgradiënt-RL is dat een enkele te grote update de prestaties kan instorten. PPO pakt dit aan met een 'geknipte surrogaatdoelstelling': het meet hoeveel waarschijnlijker (of minder) een actie is geworden ten opzichte van het oude beleid, vermenigvuldigt die verhouding met het voordeel (hoeveel beter de actie was dan verwacht) en knipt de verhouding af tot een klein bereik, zoals 0,8 tot 1,2. Dit beperkt de mate waarin het beleid per update kan worden verplaatst, waardoor het leren stabiel blijft en toch een gestage verbetering mogelijk is. In het taalmodel RLHF genereert de 'actie' een token of reactie, de beloning komt van een beloningsmodel, en een KL-divergentiestraf zorgt ervoor dat het model niet te ver afdwaalt van zijn oorspronkelijke gedrag.

Technisch inzicht

PPO maximaliseert een afgekapt doel: min(ratio * voordeel, clip(ratio, 1-eps, 1+eps) * voordeel), waarbij ratio de nieuwe-over-oude actiewaarschijnlijkheid is. Voordelen worden meestal geschat met behulp van Generalized Advantage Estimation en een netwerk van geleerde waarden (critici). In RLHF combineert de totale beloning de score van het beloningsmodel met een KL-straf per token ten opzichte van het referentiebeleid, waarbij de beloningswinst wordt afgewogen tegen het dicht bij het oorspronkelijke model blijven.

Strategische impact

Speed and scale

Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.

Access and reach

Het breidt de toegang uit naar meerdere talen en communicatiestijlen.

Clearer decisions

Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.

De toekomst van proximale beleidsoptimalisatie

PPO blijft sterk, maar is notoir onhandig: het heeft een afzonderlijk waardenetwerk, zorgvuldige afstemming van hyperparameters en veel rekenkracht nodig. Eenvoudigere alternatieven winnen terrein, waaronder DPO (helemaal geen RL) en GRPO, die het waardenetwerk laten vallen door de voordelen van groepen steekproefreacties in te schatten en recente redeneermodellen hebben aangedreven. PPO zal blijven bestaan ​​waar onderzoek op het beleidsterrein echt helpt, maar het veld ruilt actief een deel van zijn complexiteit in voor goedkopere methoden.

Implementatie in de echte wereld

Verfijning van InstructGPT en ChatGPT om instructies en menselijke voorkeuren te volgen via RLHF

Het trainen van gameplay- en robotica-controleagenten, het oorspronkelijke domein van PPO vóór taalmodellen

Het verminderen van de toxiciteit of het verbeteren van de behulpzaamheid door het maximaliseren van de score van een beloningsmodel onder een KL-beperking

Het optimaliseren van het gebruik van tools of het gedrag van agenten in meerdere stappen, waarbij een model wordt beloond voor het correct voltooien van taken

Risico's en vangrails

Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.

Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.

Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.

Implementatie routekaart

1

Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.

2

Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.

3

Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.

4

Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Proximal Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Groepsrelatieve beleidsoptimalisatie

Frequently asked questions

What is Proximal Policy Optimization?

Proximal Policy Optimization (PPO) is het versterkende leeralgoritme dat het meest wordt geassocieerd met het verfijnen van taalmodellen op basis van menselijke feedback. Het verbetert een beleid in zorgvuldige, kleine stappen om de instabiliteit te vermijden die naïeve beleidsgradiëntmethoden teistert.

Welk probleem wordt met de 'clipping' van PPO in de eerste plaats aangepakt?

Door de waarschijnlijkheidsratio te beperken, wordt voorkomen dat een enkele update het beleid te ver doorvoert, wat de belangrijkste bron van instabiliteit is in beleidsgradiëntmethoden.

Waar komt het beloningssignaal gewoonlijk vandaan in het taalmodel RLHF met PPO?

Een beloningsmodel biedt de scalaire beloning voor gegenereerde reacties, aangezien het onhaalbaar zou zijn om mensen elke output tijdens RL te laten scoren.

Wat doet de KL-divergentiestraf in op PPO gebaseerde RLHF?

De KL-straf per token ten opzichte van het oorspronkelijke (referentie)beleid ontmoedigt het model om zijn gedrag te drastisch te veranderen terwijl hij op beloning jaagt.

Wat is de rol van het waarde(kritiek)netwerk in PPO?

PPO is een actor-criticusmethode; het waardenetwerk schat de verwachte beloning, waardoor voordeelschattingen mogelijk worden (vaak via GAE) die de variantie verminderen.

Wat betekent het 'voordeel' bij PPO?

Het voordeel meet hoeveel beter (of slechter) een gekozen actie was in verhouding tot de waardeschatting, en vertelt het beleid welke acties moeten worden versterkt.