Ulimi lwe-AI GUIDE

I-Proximal Policy Optimization

I-Proximal Policy Optimization (PPO) iyi-algorithm yokufunda eqinisayo ehlotshaniswa kakhulu namamodeli wolimi wokushuna kahle okuvela empendulweni yomuntu.

2 amaminithi ukufundaIgcine ukubuyekezwa

Uhlolojikelele

It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.

I-Deep Dive

I-PPO yethulwa ngu-OpenAI ngo-2017 futhi yaba inselele ngemuva kwe-RLHF kumasistimu afana ne-InstructGPT kanye ne-ChatGPT. Inselele eyinhloko ku-RL yegradient yenqubomgomo ukuthi isibuyekezo esisodwa esikhulu kakhulu singagoqa ukusebenza. I-PPO ibhekana nalokhu 'ngenhloso yokuthatha enye enqanyuliwe': ikala ukuthi isenzo sesiphenduke maningi kangakanani (noma ngaphansi) uma kuqhathaniswa nenqubomgomo endala, iphindaphinda leso silinganiso ngenzuzo (indlela isenzo ebesingcono ngayo kunobekulindelekile), bese inqamula isilinganiso kububanzi obuncane obufana no-0.8 kuya ku-1.2. Lokhu kuhlanganisa ukuthi inqubomgomo ingahamba ibanga elingakanani isibuyekezo ngasinye, igcine ukufunda kuzinzile kuyilapho kuvumela ukuthuthuka okuqhubekayo. Kumodeli yolimi ye-RLHF, 'isenzo' sikhiqiza ithokheni noma impendulo, umvuzo uvela kumodeli yomklomelo, futhi inhlawulo ye-KL-divergence igcina imodeli ingakhukhuli kude kakhulu nokuziphatha kwayo kwasekuqaleni.

I-Technical Insight

I-PPO ikhulisa umgomo osikiwe: min(isilinganiso * inzuzo, isiqeshana(isilinganiso, 1-eps, 1+eps) * inzuzo), lapho isilinganiso singamathuba esenzo esisha esidala. Izinzuzo ngokuvamile zilinganiselwa nge-Generalized Advantage Estimation kanye nenethiwekhi yenani elifundiwe (eligxekayo). Ku-RLHF, isamba somklomelo sihlanganisa isikolo semodeli yomklomelo nenhlawulo ye-KL yethokheni ngayinye ngokumelene nenqubomgomo yesithenjwa, ukulinganisa inzuzo yomklomelo nokuhlala useduze nemodeli yoqobo.

I-Strategic Impact

Isivinini nesikali

Ukugeleza komsebenzi wolimi kungahamba ngokushesha ngaphandle kokudela ukuvumelana.

Finyelela futhi ufinyelele

Yandisa ukufinyelela kuzo zonke izilimi nezitayela zokuxhumana.

Izinqumo ezicacile

Amaqembu angachitha isikhathi esiningi ekwahluleleni kuyilapho i-automation isingatha impinda.

Ikusasa Lokuthuthukiswa Kwenqubomgomo Eseduze

I-PPO ihlala iqinile kodwa idume kabi: idinga inethiwekhi yenani ehlukile, ukushuna okucophelelayo kwepharamitha, nokubala okuningi. Ezinye izindlela ezilula ziyazuza, okuhlanganisa i-DPO (ayikho nhlobo i-RL) kanye ne-GRPO, eyehlisa inani lenethiwekhi ngokulinganisa izinzuzo ezivela emaqenjini empendulo eyisampula futhi inikeze amandla amamodeli akamuva okucabanga. I-PPO izoqhubeka lapho ukuhlola kwenqubomgomo kusiza ngempela, kodwa inkambu ihweba ngokuqhubekayo ngobunkimbinkimbi bayo ngezindlela ezishibhile.

Ukuqaliswa Komhlaba Wangempela

I-Fine-tuning InstructionGPT kanye ChatGPT ukulandela imiyalelo nokuthandwa abantu nge-RLHF

Ukuqeqesha okudlala umdlalo kanye nama-ejenti okulawula amarobhothi, isizinda soqobo se-PPO ngaphambi kwamamodeli olimi

Ukunciphisa ubuthi noma ukuthuthukisa usizo ngokwandisa isikolo semodeli yomvuzo ngaphansi kwengcindezi ye-KL

Ukuthuthukisa ukusetshenziswa kwamathuluzi noma ukuziphatha komenzeli wezinyathelo eziningi lapho imodeli iklonyeliswa ngokuqeda imisebenzi ngendlela efanele

Izingozi & Guardrails

Amaqiniso akhonjiwe angafaka ngokuthula imibiko, ukugeleza kosekelo, noma imiphumela yocwaningo.

Ukuzwela okusheshayo kungadala imiphumela engahambisani kuzo zonke izicelo ezifanayo.

Idatha yombhalo ebucayi ingase idalulwe uma izilawuli zokufinyelela zibuthakathaka.

Ukuqalisa Umhlahlandlela

1

Chaza ifomethi yokuphumayo, ithoni, namazinga wekhwalithi ngaphambi kokukhishwa.

2

Izimpendulo eziyisisekelo ngemithombo ethembekile noma nini lapho ukunemba kubalulekile.

3

Gcina indawo yokuhlola isibuyekezo somuntu ukuze uthole imiphumela ephezulu.

4

Landela amaphethini okuhluleka futhi uqeqeshe kabusha imiyalo noma ukuhamba komsebenzi njalo.

Qhubeka Uhlole

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Proximal Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Qala imibuzo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Umhlahlandlela olandelayo

Ukuthuthukiswa Kwenqubomgomo Ehlobene Neqembu

Imibuzo evame ukubuzwa

What is Proximal Policy Optimization?

I-Proximal Policy Optimization (PPO) iyi-algorithm yokufunda eqinisayo ehlotshaniswa kakhulu namamodeli wolimi wokushuna kahle okuvela empendulweni yomuntu. Ithuthukisa inqubomgomo ezinyathelweni ezicophelelayo, ezincane ukuze kugwenywe ukungazinzi okukhungethe izindlela zenqubomgomo ezingenangqondo.

Iyiphi inkinga 'isiqeshana' se-PPO esibhekana nayo ngokuyinhloko?

Ukusika isilinganiso samathuba kuvimbela noma isiphi isibuyekezo esisodwa ekuhambiseni inqubomgomo kude kakhulu, okuwumthombo oyinhloko wokungazinzi ezindleleni zegradient yenqubomgomo.

Kumodeli yolimi ye-RLHF ene-PPO, isignali yomvuzo ngokuvamile ivela kuphi?

Imodeli yomklomelo inikeza umvuzo wesikali wezimpendulo ezikhiqiziwe, njengoba ukuthola abantu bathole konke okukhiphayo ngesikhathi se-RL bekungeke kwenzeke.

Yenzani inhlawulo ye-KL-divergence ku-PPO-based RLHF?

Inhlawulo ye-KL yethokheni ngayinye ngokumelene nenqubomgomo yoqobo (inkomba) ayikhuthazi imodeli ekuguquleni ukuziphatha kwayo kakhulu ngenkathi ijaha umvuzo.

Ithini indima yenethiwekhi yenani (umgxeki) ku-PPO?

I-PPO iyindlela yokugxeka umlingisi; inethiwekhi yenani ilinganisela umvuzo olindelekile, ivumela izilinganiso zenzuzo (ngokuvamile nge-GAE) ezehlisa ukuhluka.

Imele ini 'inzuzo' ku-PPO?

Inzuzo ikala ukuthi kungcono kangakanani (noma okubi kakhulu) isenzo esikhethiwe esihlobene nesilinganiso senani, sitshela inqubomgomo ukuthi yiziphi izenzo okufanele ziqiniswe.