Jazyk AI GUIDE

Proximální optimalizace politiky

Proximal Policy Optimization (PPO) je posilující učební algoritmus, který je nejvíce spojován s dolaďováním jazykových modelů na základě lidské zpětné vazby.

2 minuty čteníNaposledy aktualizováno

Přehled

It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.

Hluboký ponor

PPO byl představen OpenAI v roce 2017 a stal se tahounem za RLHF pro systémy jako InstructGPT a ChatGPT. Hlavním problémem v RL s gradientem zásad je to, že jedna příliš velká aktualizace může snížit výkon. PPO to řeší pomocí „oříznutého náhradního cíle“: měří, o kolik více (nebo méně) se stala akce pravděpodobnou oproti staré politice, násobí tento poměr výhodou (o kolik lepší akce byla, než se očekávalo), a ořezává poměr na malý rozsah, například 0,8 až 1,2. To omezuje, jak daleko se může politika posunout v rámci aktualizace, což udržuje učení stabilní a zároveň umožňuje trvalé zlepšování. V jazykovém modelu RLHF je „akcí“ generování tokenu nebo odpovědi, odměna pochází z modelu odměny a penalizace za KL-divergenci zabraňuje tomu, aby se model příliš vzdaloval od svého původního chování.

Technický přehled

PPO maximalizuje oříznutý cíl: min (poměr * výhoda, klip (poměr, 1 eps, 1 + eps) * výhoda), kde poměr je pravděpodobnost nové akce vůči staré. Výhody se obvykle odhadují pomocí odhadu Generalized Advantage Estimation a sítě naučené hodnoty (kritické). V RLHF celková odměna kombinuje skóre modelu odměny s penalizací za token KL oproti referenční politice, čímž se zisk odměny vyrovnává se zachováním blízkosti původního modelu.

Strategický dopad

Rychlost a měřítko

Jazykové pracovní postupy se mohou pohybovat rychleji, aniž by byla obětována konzistentnost.

Přístup a dosah

Rozšiřuje přístup napříč jazyky a komunikačními styly.

Jasnější rozhodnutí

Týmy mohou strávit více času úsudkem, zatímco automatizace zvládne opakování.

Budoucnost proximální optimalizace politiky

PPO zůstává silné, ale je notoricky nešikovné: potřebuje samostatnou síť hodnot, pečlivé ladění hyperparametrů a spoustu výpočtů. Prosazují se jednodušší alternativy, včetně DPO (vůbec žádné RL) a GRPO, které snižují hodnotovou síť odhadováním výhod ze skupin vzorkovaných odpovědí a pohánějí nedávné modely uvažování. PPO bude přetrvávat tam, kde prozkoumávání zásad skutečně pomáhá, ale oblast aktivně vyměňuje část své složitosti za levnější metody.

Real-World Implementace

Jemné doladění Instruujte GPT a ChatGPT, aby se řídily pokyny a lidskými preferencemi prostřednictvím RLHF

Školení agentů pro hraní her a ovládání robotiky, původní doména PPO před jazykovými modely

Snížení toxicity nebo zlepšení užitečnosti maximalizací skóre modelu odměny při omezení KL

Optimalizace používání nástrojů nebo chování agenta ve více krocích, kdy je model odměňován za správné dokončení úkolů

Rizika a zábradlí

Halucinovaná fakta mohou tiše vstupovat do zpráv, podpůrných toků nebo výstupů výzkumu.

Citlivost na výzvy může způsobit nekonzistentní výsledky napříč podobnými požadavky.

Citlivá textová data mohou být vystavena, pokud je řízení přístupu slabé.

Plán implementace

1

Před zavedením definujte výstupní formát, tón a standardy kvality.

2

Pozemní reakce s důvěryhodnými zdroji, kdykoli záleží na přesnosti.

3

Udržujte kontrolní bod lidské kontroly pro vysoce důležité výstupy.

4

Sledujte vzorce selhání a pravidelně opakujte výzvy nebo pracovní postupy.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Proximal Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Optimalizace relativních zásad skupiny

Často kladené otázky

What is Proximal Policy Optimization?

Proximal Policy Optimization (PPO) je posilující učební algoritmus, který je nejvíce spojován s dolaďováním jazykových modelů na základě lidské zpětné vazby. Zlepšuje politiku opatrnými, malými kroky, aby se zabránilo nestabilitě, která sužuje naivní metody gradientu politiky.

Jaký problém „ořezávání“ PPO primárně řeší?

Oříznutí poměru pravděpodobnosti zabrání jakékoli jednotlivé aktualizaci přesunout politiku příliš daleko, což je hlavním zdrojem nestability metod s gradientem politiky.

V jazykovém modelu RLHF s PPO, odkud obvykle pochází signál odměny?

Model odměny poskytuje skalární odměnu za generované odpovědi, protože nechat lidi skórovat každý výstup během RL by bylo neproveditelné.

Co dělá penalizace za divergenci KL v RLHF na bázi PPO?

Pokuta za KL za token proti původní (referenční) politice odrazuje model od příliš drastické změny chování při honbě za odměnou.

Jaká je role hodnotové (kritické) sítě v PPO?

PPO je metoda kritiky herců; hodnotová síť odhaduje očekávanou odměnu, což umožňuje odhady výhod (často prostřednictvím GAE), které snižují rozptyl.

Co představuje „výhoda“ v PPO?

Výhoda měří, o kolik lepší (nebo horší) byla vybraná akce vzhledem k odhadované hodnotě, a říká politice, která opatření je třeba posílit.