Språk AI GUIDE

Proksimal policyoptimalisering

Proximal Policy Optimization (PPO) er den forsterkende læringsalgoritmen som er mest knyttet til finjustering av språkmodeller fra menneskelig tilbakemelding.

2 min lesingSist oppdatert

Oversikt

It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.

Dypdykk

PPO ble introdusert av OpenAI i 2017 og ble arbeidshesten bak RLHF for systemer som InstructGPT og ChatGPT. Kjerneutfordringen i policy-gradient RL er at en enkelt for stor oppdatering kan kollapse ytelsen. PPO adresserer dette med et "klippet surrogatmål": den måler hvor mye mer (eller mindre) sannsynlig en handling har blitt i forhold til den gamle policyen, multipliserer dette forholdet med fordelen (hvor mye bedre handlingen var enn forventet), og klipper forholdet til et lite område som 0,8 til 1,2. Dette begrenser hvor langt policyen kan bevege seg per oppdatering, og holder læringen stabil samtidig som den tillater jevn forbedring. I språkmodellen RLHF genererer 'handlingen' en token eller respons, belønningen kommer fra en belønningsmodell, og en KL-divergensstraff hindrer modellen fra å drive for langt fra sin opprinnelige oppførsel.

Teknisk innsikt

PPO maksimerer et klippet mål: min(ratio * fordel, klipp(ratio, 1-eps, 1+eps) * fordel), der ratio er ny-over-gammel handlingssannsynlighet. Fordeler estimeres vanligvis med Generalized Advantage Estimation og et lært verdi (kritisk) nettverk. I RLHF kombinerer den totale belønningen belønningsmodellens poengsum med en KL-straff per token mot referansepolitikken, og balanserer belønningsgevinst mot å holde seg nær den opprinnelige modellen.

Strategisk innvirkning

Speed and scale

Språkarbeidsflyter kan bevege seg raskere uten å ofre konsistens.

Access and reach

Det utvider tilgangen på tvers av språk og kommunikasjonsstiler.

Tydeligere avgjørelser

Lag kan bruke mer tid på dømmekraft mens automatisering håndterer repetisjon.

Fremtiden for proksimal policyoptimalisering

PPO er fortsatt sterk, men er notorisk vanskelig: den trenger et eget verdinettverk, nøye justering av hyperparametere og mye databehandling. Enklere alternativer vinner terreng, inkludert DPO (ingen RL i det hele tatt) og GRPO, som dropper verdinettverket ved å estimere fordeler fra grupper av utvalgte svar og har drevet nyere resonneringsmodeller. PPO vil vedvare der on-policy utforskning virkelig hjelper, men feltet handler aktivt noe av kompleksiteten for billigere metoder.

Real-World Implementering

Finjustere InstructGPT og ChatGPT for å følge instruksjoner og menneskelige preferanser via RLHF

Trening av spill- og robotkontrollagenter, PPOs originale domene før språkmodeller

Redusere toksisitet eller forbedre hjelpsomheten ved å maksimere en belønningsmodellscore under en KL-begrensning

Optimalisering av verktøybruk eller agentatferd i flere trinn der en modell belønnes for å fullføre oppgaver riktig

Risikoer og rekkverk

Hallusinerte fakta kan stille inn rapporter, støttestrømmer eller forskningsresultater.

Umiddelbar følsomhet kan skape inkonsistente resultater på tvers av lignende forespørsler.

Sensitive tekstdata kan bli eksponert hvis tilgangskontrollene er svake.

Veikart for implementering

1

Definer utdataformat, tone og kvalitetsstandarder før utrulling.

2

Bakgrunnssvar med pålitelige kilder når nøyaktighet er viktig.

3

Hold et sjekkpunkt for menneskelig vurdering for utganger med høy innsats.

4

Spor feilmønstre og tren opp meldinger eller arbeidsflyter regelmessig.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Proximal Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Neste guide

Optimalisering av grupperelativ policy

Ofte stilte spørsmål

What is Proximal Policy Optimization?

Proximal Policy Optimization (PPO) er den forsterkende læringsalgoritmen som er mest knyttet til finjustering av språkmodeller fra menneskelig tilbakemelding. Det forbedrer en politikk med forsiktige, små skritt for å unngå ustabiliteten som plager naive politikkgradientmetoder.

Hvilket problem adresserer PPOs 'klipping' primært?

Å klippe sannsynlighetsforholdet forhindrer at en enkelt oppdatering flytter policyen for langt, som er hovedkilden til ustabilitet i policy-gradientmetoder.

I språkmodell RLHF med PPO, hvor kommer belønningssignalet vanligvis fra?

En belønningsmodell gir den skalære belønningen for genererte svar, siden det ville være umulig å få mennesker til å score hver utgang under RL.

Hva gjør KL-divergensstraffen i PPO-basert RLHF?

Per-token KL-straffen mot den opprinnelige (referanse) policyen fraråder modellen fra å endre oppførselen for drastisk mens den jager belønning.

Hva er rollen til verdinettverket (kritisk) i PPO?

PPO er en skuespillerkritisk metode; verdinettverket anslår forventet belønning, og muliggjør fordelestimater (ofte via GAE) som reduserer variansen.

Hva representerer "fordelen" i PPO?

Fordelen måler hvor mye bedre (eller dårligere) en valgt handling var i forhold til verdiestimatet, og forteller policyen hvilke handlinger som skal forsterkes.