Proximální optimalizace politiky
Proximal Policy Optimization (PPO) je posilující učební algoritmus, který je nejvíce spojován s dolaďováním jazykových modelů na základě lidské zpětné vazby.
Přehled
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
Hluboký ponor
PPO byl představen OpenAI v roce 2017 a stal se tahounem za RLHF pro systémy jako InstructGPT a ChatGPT. Hlavním problémem v RL s gradientem zásad je to, že jedna příliš velká aktualizace může snížit výkon. PPO to řeší pomocí „oříznutého náhradního cíle“: měří, o kolik více (nebo méně) se stala akce pravděpodobnou oproti staré politice, násobí tento poměr výhodou (o kolik lepší akce byla, než se očekávalo), a ořezává poměr na malý rozsah, například 0,8 až 1,2. To omezuje, jak daleko se může politika posunout v rámci aktualizace, což udržuje učení stabilní a zároveň umožňuje trvalé zlepšování. V jazykovém modelu RLHF je „akcí“ generování tokenu nebo odpovědi, odměna pochází z modelu odměny a penalizace za KL-divergenci zabraňuje tomu, aby se model příliš vzdaloval od svého původního chování.
Technický přehled
PPO maximalizuje oříznutý cíl: min (poměr * výhoda, klip (poměr, 1 eps, 1 + eps) * výhoda), kde poměr je pravděpodobnost nové akce vůči staré. Výhody se obvykle odhadují pomocí odhadu Generalized Advantage Estimation a sítě naučené hodnoty (kritické). V RLHF celková odměna kombinuje skóre modelu odměny s penalizací za token KL oproti referenční politice, čímž se zisk odměny vyrovnává se zachováním blízkosti původního modelu.
Strategický dopad
Rychlost a měřítko
Jazykové pracovní postupy se mohou pohybovat rychleji, aniž by byla obětována konzistentnost.
Přístup a dosah
Rozšiřuje přístup napříč jazyky a komunikačními styly.
Jasnější rozhodnutí
Týmy mohou strávit více času úsudkem, zatímco automatizace zvládne opakování.
Budoucnost proximální optimalizace politiky
PPO zůstává silné, ale je notoricky nešikovné: potřebuje samostatnou síť hodnot, pečlivé ladění hyperparametrů a spoustu výpočtů. Prosazují se jednodušší alternativy, včetně DPO (vůbec žádné RL) a GRPO, které snižují hodnotovou síť odhadováním výhod ze skupin vzorkovaných odpovědí a pohánějí nedávné modely uvažování. PPO bude přetrvávat tam, kde prozkoumávání zásad skutečně pomáhá, ale oblast aktivně vyměňuje část své složitosti za levnější metody.
Real-World Implementace
Jemné doladění Instruujte GPT a ChatGPT, aby se řídily pokyny a lidskými preferencemi prostřednictvím RLHF
Školení agentů pro hraní her a ovládání robotiky, původní doména PPO před jazykovými modely
Snížení toxicity nebo zlepšení užitečnosti maximalizací skóre modelu odměny při omezení KL
Optimalizace používání nástrojů nebo chování agenta ve více krocích, kdy je model odměňován za správné dokončení úkolů
Rizika a zábradlí
Halucinovaná fakta mohou tiše vstupovat do zpráv, podpůrných toků nebo výstupů výzkumu.
Citlivost na výzvy může způsobit nekonzistentní výsledky napříč podobnými požadavky.
Citlivá textová data mohou být vystavena, pokud je řízení přístupu slabé.
Plán implementace
Před zavedením definujte výstupní formát, tón a standardy kvality.
Pozemní reakce s důvěryhodnými zdroji, kdykoli záleží na přesnosti.
Udržujte kontrolní bod lidské kontroly pro vysoce důležité výstupy.
Sledujte vzorce selhání a pravidelně opakujte výzvy nebo pracovní postupy.
Pokračujte v objevování
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Další průvodce
Optimalizace relativních zásad skupiny
Často kladené otázky
What is Proximal Policy Optimization?
Proximal Policy Optimization (PPO) je posilující učební algoritmus, který je nejvíce spojován s dolaďováním jazykových modelů na základě lidské zpětné vazby. Zlepšuje politiku opatrnými, malými kroky, aby se zabránilo nestabilitě, která sužuje naivní metody gradientu politiky.
Jaký problém „ořezávání“ PPO primárně řeší?
Oříznutí poměru pravděpodobnosti zabrání jakékoli jednotlivé aktualizaci přesunout politiku příliš daleko, což je hlavním zdrojem nestability metod s gradientem politiky.
V jazykovém modelu RLHF s PPO, odkud obvykle pochází signál odměny?
Model odměny poskytuje skalární odměnu za generované odpovědi, protože nechat lidi skórovat každý výstup během RL by bylo neproveditelné.
Co dělá penalizace za divergenci KL v RLHF na bázi PPO?
Pokuta za KL za token proti původní (referenční) politice odrazuje model od příliš drastické změny chování při honbě za odměnou.
Jaká je role hodnotové (kritické) sítě v PPO?
PPO je metoda kritiky herců; hodnotová síť odhaduje očekávanou odměnu, což umožňuje odhady výhod (často prostřednictvím GAE), které snižují rozptyl.
Co představuje „výhoda“ v PPO?
Výhoda měří, o kolik lepší (nebo horší) byla vybraná akce vzhledem k odhadované hodnotě, a říká politice, která opatření je třeba posílit.