Mutauro AI GUIDE

Proximal Policy Optimization

Proximal Policy Optimization (PPO) ndiyo yekusimbisa kudzidza algorithm inonyanya kuenderana nemhando yemitauro yekumisikidza kubva mumhinduro dzevanhu.

2 min verengaLast update

Pfupiso

It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.

Kudzika Kwakadzika

PPO yakaunzwa ne OpenAI muna 2017 uye yakave nhanho yekuseri kweRLHF kumasisitimu akaita seInstructGPT uye ChatGPT. Dambudziko guru mupolicy-gradient RL nderekuti imwe chete yakawandisa yekuvandudza inogona kudonha kuita. PPO inogadzirisa izvi ne 'yakachekwa surrogate chinangwa': inoyera kuti yakawanda sei (kana kushoma) chiitiko chave kupesana negwara rekare, inowanza iyo reshiyo nemukana (zvanga zviri nani sei pane zvaitarisirwa), uye inocheka reshiyo kune diki renji senge 0.8 kusvika 1.2. Izvi zvinovhara kuti gwara rinogona kufamba kusvika papi pakuvandudza, kuchengetedza kudzidza kwakagadzikana uchiri kubvumira kuvandudzwa kwakadzikama. Mumutauro-muenzanisiro RLHF, 'chiito' chiri kugadzira chiratidzo kana mhinduro, mubairo unobva pamuenzaniso wemubairo, uye KL-divergence chirango chinochengeta modhi yacho kuti isaswedere kure nemaitiro ayo epakutanga.

Technical Insight

PPO inokwidziridza chinangwa chakachekwa: min(ratio * mukana, clip(ratio, 1-eps, 1+eps) * mukana), uko reshiyo ndiyo nyowani-pamusoro-yekare chiitiko. Zvakanakira zvinowanzofungidzirwa neGeneralized Advantage Estimation uye kukosha kwakadzidzwa (critic) network. MuRLHF, mubairo wakakwana unosanganisa mubairo-modhiyo chibodzwa nechero-tokeni yeKL chirango chinopesana nereferensi mutemo, kuenzanisa mubairo wekuwana uchipokana nekugara padyo neiyo yekutanga modhi.

Strategic Impact

Kumhanya uye chiyero

Mutauro workflows inogona kufamba nekukurumidza pasina kupira kuenderana.

Svika uye svika

Inopamhidzira kupinda mumitauro yese nemataera ekutaurirana.

Sarudzo dzakajeka

Zvikwata zvinogona kupedza nguva yakawanda pakutonga uku otomatiki ichibata kudzokorora.

Ramangwana reProximal Policy Optimization

PPO inoramba yakasimba asi ine mukurumbira wakashata: inoda yakaparadzana kukosha network, kungwarira hyperparameter tuning, uye yakawanda compute. Dzimwe nzira dzakareruka dziri kuwana nzvimbo, kusanganisira DPO (hapana RL zvachose) uye GRPO, iyo inodonhedza kukosha kwetiweki nekufungidzira mabhenefiti kubva kumapoka emhinduro dzesampled uye yakapa simba mamodheru ekufunga achangoburwa. PPO icharamba iripo apo kuongorora kwe-policy kunobatsira zvechokwadi, asi munda uri kutengesa zvimwe zvekuoma kwayo nenzira dzakachipa.

Real-World Implementation

Kunyatsogadzirisa InstructionGPT uye ChatGPT kutevera mirairo uye zvido zvevanhu kuburikidza neRLHF

Kudzidzira kutamba-kutamba uye marobhoti anodzora maajenti, PPO's yepakutanga domain pamberi pemhando dzemitauro

Kuderedza huturu kana kuvandudza kubatsira nekuwedzera mubairo-modhi reki pasi pekumanikidza kweKL.

Kunatsiridza maturusi-kushandisa kana akawanda-nhanho mumiriri maitiro apo modhi inopihwa mubairo wekupedza mabasa nemazvo

Njodzi & Guardrails

Chokwadi chehuroyi chinogona kupinda chinyararire mishumo, kuyerera kwetsigiro, kana tsvakiridzo.

Kunzwa nekukasira kunogona kugadzira mhedzisiro isingaenderane pane zvikumbiro zvakafanana.

Sensitive text data inogona kuburitswa kana zvidhiraivho zvisina kusimba.

Implementation Roadmap

1

Tsanangura chimiro chekubuda, toni, uye mhando zviyero usati waburitsa.

2

Mhinduro dzepasi neakavimbika masosi pese pazvine basa.

3

Chengetedza ongororo yekuongorora yemunhu kune yakakwira-stake zvinobuda.

4

Tevera maitiro ekutadza uye dzidzisazve kukurudzira kana mafambiro ebasa nguva nenguva.

Ramba Uchiongorora

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Proximal Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Tanga mibvunzo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gaidhi rinotevera

Boka Relative Policy Optimization

Mibvunzo inowanzo bvunzwa

What is Proximal Policy Optimization?

Proximal Policy Optimization (PPO) ndiyo yekusimbisa kudzidza algorithm inonyanya kuenderana nemhando yemitauro yekumisikidza kubva mumhinduro dzevanhu. Inovandudza mutemo mukungwarira, nhanho diki kudzivirira kusagadzikana kunotambudza naive policy gradient nzira.

Idambudziko ripi rinonyanya kugadziriswa nePPO?

Kuchekerera chiyero chemukana kunodzivirira chero imwe chete update kubva pakufambisa mutemo wakanyanya kureba, inova ndiyo honzeri yekusagadzikana mupolicy-gradient nzira.

Mumutauro-modhi RLHF nePPO, chiratidzo chemubairo chinowanzobva kupi?

Muenzaniso wemubairo unopa mubairo we scalar wemhinduro dzakagadzirwa, sezvo kuita kuti vanhu vape zvese zvinobuda panguva yeRL hazvigoneke.

Chii chinoitwa neKL-divergence chirango muPPO-based RLHF?

Iyo per-toke yeKL chirango ichipokana neyekutanga (referenzi) inoodza moyo modhi kubva pakuchinja maitiro ayo zvakanyanya uchidzingirira mubairo.

Ndeipi basa rekukosha (kutsoropodza) network muPPO?

PPO inzira yeactor-critic; kukosha kwetiweki inofungidzira mubairo unotarisirwa, ichigonesa fungidziro yemukana (kazhinji kuburikidza neGAE) inoderedza musiyano.

Chii chinonzi 'chakanaka' muPPO?

Mubairo unoyera kuti zvirinani (kana zvakanyanya kuipa) chiito chakasarudzwa chaive chakaenzana nefungidziro yekukosha, kuudza mutemo kuti ndezvipi zviito zvekusimbisa.