Uboreshaji wa Sera ya Karibu
Uboreshaji wa Sera ya Karibuni (PPO) ni kanuni ya uimarishaji ya ujifunzaji inayohusishwa zaidi na miundo ya kurekebisha lugha kutokana na maoni ya binadamu.
Muhtasari
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
Dive ya kina
PPO ilianzishwa na OpenAI mwaka wa 2017 na ikawa kazi kubwa nyuma ya RLHF kwa mifumo kama vile InstructGPT na ChatGPT. Changamoto kuu katika RL-gradient RL ni kwamba sasisho moja kubwa kupita kiasi linaweza kuporomosha utendakazi. PPO hushughulikia hili kwa 'lengo la urithi lililopunguzwa': hupima uwezekano mkubwa (au chini) wa kitendo dhidi ya sera ya zamani, huzidisha uwiano huo kwa faida (jinsi kitendo kilivyokuwa bora zaidi kuliko ilivyotarajiwa), na kubana uwiano hadi kiwango kidogo kama 0.8 hadi 1.2. Hii inajumlisha umbali ambao sera inaweza kusonga kwa kila sasisho, na kuweka mafunzo kwa utulivu huku ikiruhusu uboreshaji thabiti. Katika modeli ya lugha ya RLHF, 'kitendo' kinazalisha tokeni au jibu, zawadi hutoka kwa mtindo wa zawadi, na adhabu ya tofauti ya KL huzuia kielelezo kutoka mbali sana na tabia yake ya awali.
Ufahamu wa Kiufundi
PPO huongeza lengo lililofupishwa: min(ratio * advantage, klipu(ratio, 1-eps, 1+eps) * faida), ambapo uwiano ni uwezekano wa hatua mpya zaidi ya zamani. Manufaa kwa kawaida hukadiriwa na Makadirio ya Manufaa ya Jumla na mtandao wa thamani uliojifunza (mkosoaji). Katika RLHF, jumla ya zawadi huchanganya alama ya mfano wa zawadi na adhabu ya kila tokeni ya KL dhidi ya sera ya marejeleo, kusawazisha faida ya zawadi dhidi ya kukaa karibu na muundo asili.
Athari za kimkakati
Kasi na kiwango
Mitiririko ya kazi ya lugha inaweza kusonga kwa kasi zaidi bila kuacha uthabiti.
Kufikia na kufikia
Inapanua ufikiaji katika lugha na mitindo ya mawasiliano.
Maamuzi ya wazi zaidi
Timu zinaweza kutumia muda mwingi kufanya uamuzi huku otomatiki ikishughulikia marudio.
Mustakabali wa Uboreshaji wa Sera ya Karibu
PPO inasalia kuwa na nguvu lakini ina sifa mbaya sana: inahitaji mtandao tofauti wa thamani, urekebishaji makini wa kigezo, na hesabu nyingi. Njia mbadala rahisi zinazidi kuimarika, ikijumuisha DPO (hakuna RL hata kidogo) na GRPO, ambayo hupunguza mtandao wa thamani kwa kukadiria faida kutoka kwa vikundi vya majibu yaliyotolewa na imetumia mifano ya hivi majuzi ya kutoa hoja. PPO itaendelea pale ambapo uchunguzi kwenye sera husaidia kwa dhati, lakini uga unafanya biashara kwa bidii baadhi ya uchangamano wake kwa mbinu za bei nafuu.
Utekelezaji wa Ulimwengu Halisi
Maagizo ya kurekebisha vizuriGPT na ChatGPT kufuata maagizo na mapendeleo ya kibinadamu kupitia RLHF
Kutoa mafunzo kwa mawakala wa uchezaji na robotiki, kikoa asili cha PPO kabla ya miundo ya lugha
Kupunguza sumu au kuboresha usaidizi kwa kuongeza alama ya mfano wa zawadi chini ya kikwazo cha KL
Kuboresha tabia ya matumizi ya zana au wakala wa hatua nyingi ambapo mtindo hutuzwa kwa kukamilisha kazi kwa usahihi
Hatari & Walinzi
Mambo ya ukweli yanaweza kuingiza ripoti kwa utulivu, mitiririko ya usaidizi, au matokeo ya utafiti.
Usikivu wa haraka unaweza kuunda matokeo yasiyolingana katika maombi sawa.
Data nyeti ya maandishi inaweza kufichuliwa ikiwa vidhibiti vya ufikiaji ni dhaifu.
Ramani ya Utekelezaji
Bainisha umbizo la towe, toni na viwango vya ubora kabla ya kusambaza.
Majibu ya msingi na vyanzo vinavyoaminika wakati wowote usahihi ni muhimu.
Weka ukaguzi wa ukaguzi wa kibinadamu kwa matokeo ya juu.
Fuatilia mifumo ya kushindwa na fundisha tena vidokezo au mtiririko wa kazi mara kwa mara.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Uboreshaji wa Sera ya Uhusiano ya Kikundi
Maswali yanayoulizwa mara kwa mara
What is Proximal Policy Optimization?
Uboreshaji wa Sera ya Karibuni (PPO) ni kanuni ya uimarishaji ya ujifunzaji inayohusishwa zaidi na miundo ya kurekebisha lugha kutokana na maoni ya binadamu. Inaboresha sera katika hatua makini, ndogo ili kuepuka ukosefu wa uthabiti unaokumba mbinu za sera za ujinga.
Je, 'kupunguza' kwa PPO hushughulikia tatizo gani kimsingi?
Kupunguza uwiano wa uwezekano huzuia sasisho lolote lisisogeze sera mbali sana, ambayo ndiyo chanzo kikuu cha ukosefu wa uthabiti katika mbinu za upunguzaji wa sera.
Katika modeli ya lugha ya RLHF iliyo na PPO, ishara ya zawadi kawaida hutoka wapi?
Muundo wa zawadi hutoa malipo makubwa kwa majibu yanayotolewa, kwa kuwa kuwa na wanadamu kila matokeo wakati wa RL hakuwezi kufikiwa.
Je, adhabu ya KL-divergence hufanya nini katika RLHF yenye msingi wa PPO?
Adhabu ya kila tokeni ya KL dhidi ya sera ya asili (rejeleo) inakatisha tamaa mtindo wa kubadilisha tabia yake kwa kiasi kikubwa sana wakati wa kutafuta zawadi.
Je, ni jukumu gani la mtandao wa thamani (mkosoaji) katika PPO?
PPO ni mbinu ya muigizaji-mkosoaji; mtandao wa thamani unakadiria malipo yanayotarajiwa, kuwezesha makadirio ya faida (mara nyingi kupitia GAE) ambayo hupunguza tofauti.
Je, 'faida' inawakilisha nini katika PPO?
Faida hupima ni kiasi gani kitendo kilichochaguliwa kilikuwa bora zaidi (au mbaya zaidi) kililinganishwa na makadirio ya thamani, ikiambia sera ni hatua zipi za kuimarisha.