Optimizarea proximală a politicii
Proximal Policy Optimization (PPO) este algoritmul de învățare prin consolidare cel mai asociat cu reglarea fină a modelelor de limbaj din feedbackul uman.
Prezentare generală
Îmbunătățește o politică prin pași mici și atenți pentru a evita instabilitatea care afectează metodele naive de gradient de politici.
Scufundare în profunzime
PPO a fost introdus de OpenAI în 2017 și a devenit calul de lucru din spatele RLHF pentru sisteme precum InstructGPT și ChatGPT. Provocarea de bază în RL cu gradient de politici este că o singură actualizare prea mare poate reduce performanța. PPO abordează acest lucru cu un „obiectiv surogat tăiat”: măsoară cât de mult mai mare (sau mai puțin) probabilitate a devenit o acțiune față de vechea politică, înmulțește acel raport cu avantaj (cât de mult mai bună a fost acțiunea decât se aștepta) și decupează raportul la un interval mic, cum ar fi 0,8 la 1,2. Acest lucru limitează cât de departe se poate deplasa politica per actualizare, menținând învățarea stabilă, permițând totodată îmbunătățirea constantă. În modelul de limbaj RLHF, „acțiunea” generează un simbol sau un răspuns, recompensa vine de la un model de recompensă, iar o penalizare de divergență KL împiedică modelul să se îndepărteze prea mult de comportamentul său original.
Perspectivă tehnică
PPO maximizează un obiectiv tăiat: min(raport * avantaj, clip (raport, 1-eps, 1+eps) * avantaj), unde raportul este probabilitatea de acțiune nou peste vechi. Avantajele sunt de obicei estimate cu estimarea avantajelor generalizate și o rețea de valoare învățată (critică). În RLHF, recompensa totală combină scorul modelului de recompensă cu o penalizare KL per jeton împotriva politicii de referință, echilibrând câștigul de recompensă cu rămânerea aproape de modelul original.
Impact strategic
Viteză și scară
Fluxurile de lucru lingvistice se pot deplasa mai rapid fără a sacrifica consistența.
Acces și acoperire
Extinde accesul în diferite limbi și stiluri de comunicare.
Decizii mai clare
Echipele pot petrece mai mult timp jucând în timp ce automatizarea se ocupă de repetiție.
Viitorul optimizării politicii proximale
PPO rămâne puternic, dar este notoriu de complicat: are nevoie de o rețea de valoare separată, reglare atentă a hiperparametrilor și multă calcul. Alternativele mai simple câștigă teren, inclusiv DPO (fără RL deloc) și GRPO, care scade rețeaua de valori prin estimarea avantajelor din grupuri de răspunsuri eșantionate și a alimentat modelele de raționament recente. PPO va persista acolo unde explorarea în cadrul politicii ajută cu adevărat, dar domeniul schimbă în mod activ o parte din complexitatea sa pentru metode mai ieftine.
Implementare în lumea reală
Reglați fin InstructGPT și ChatGPT pentru a urma instrucțiunile și preferințele umane prin RLHF
Antrenarea agenților de joc și control al roboticii, domeniul original al PPO înaintea modelelor de limbaj
Reducerea toxicității sau îmbunătățirea utilității prin maximizarea unui scor de model de recompensă sub o constrângere KL
Optimizarea utilizării instrumentelor sau a comportamentului agentului în mai mulți pași, în care un model este recompensat pentru îndeplinirea corectă a sarcinilor
Riscuri și balustrade
Faptele halucinate pot intra în liniște în rapoarte, fluxuri de sprijin sau rezultate ale cercetării.
Sensibilitatea promptă poate crea rezultate inconsecvente pentru solicitări similare.
Datele text sensibile pot fi expuse dacă controalele de acces sunt slabe.
Foaia de parcurs de implementare
Definiți formatul de ieșire, tonul și standardele de calitate înainte de lansare.
Răspunsurile la sol cu surse de încredere ori de câte ori acuratețea contează.
Păstrați un punct de control uman pentru rezultate cu mize mari.
Urmăriți tiparele de eșec și reantrenați în mod regulat solicitările sau fluxurile de lucru.
Continuați să explorați
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Următorul ghid
Optimizare relativă a politicii de grup
Întrebări frecvente
Ce este Optimizarea Politicilor Proximale?
Proximal Policy Optimization (PPO) este algoritmul de învățare prin consolidare cel mai asociat cu reglarea fină a modelelor de limbaj din feedbackul uman. Îmbunătățește o politică în pași atenți, mici, pentru a evita instabilitatea care afectează metodele naive de gradient de politică.
Ce problemă se adresează în primul rând „decuparea” PPO?
Tăierea raportului de probabilitate împiedică orice actualizare unică să mute politica prea departe, care este principala sursă de instabilitate în metodele cu gradient de politică.
În modelul de limbă RLHF cu PPO, de unde vine de obicei semnalul de recompensă?
Un model de recompensă oferă recompensa scalară pentru răspunsurile generate, deoarece oamenii au punctat fiecare rezultat în timpul RL ar fi imposibil.
Ce face penalizarea de divergență KL în RLHF bazat pe PPO?
Penalizarea KL per jeton împotriva politicii originale (de referință) descurajează modelul să-și schimbe comportamentul prea drastic în timp ce urmărește recompensă.
Care este rolul rețelei valorice (critice) în PPO?
PPO este o metodă actor-critică; rețeaua de valori estimează recompensa așteptată, permițând estimări de avantaj (adesea prin GAE) care reduc varianța.
Ce reprezintă „avantajul” în PPO?
Avantajul măsoară cât de mai bună (sau mai proastă) a fost o acțiune aleasă în raport cu valoarea estimată, indicând politicii ce acțiuni trebuie consolidate.