Urekebishaji wa Zawadi uliowekwa katika vikundi katika RLHF
Urekebishaji wa zawadi kwa vikundi husanifisha zawadi za mwanamitindo ndani ya kundi la majibu kwa dodoso sawa, na kugeuza alama za kelele kuwa mawimbi thabiti ya mafunzo.
Muhtasari
It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.
Dive ya kina
Katika kujifunza kwa uimarishaji kutoka kwa maoni ya binadamu (RLHF), modeli hutoa majibu na modeli ya zawadi huyapatia alama, lakini zawadi ghafi huwa na kelele na hutofautiana sana katika maongozi. Urekebishaji wa zawadi uliopangwa katika vikundi hurekebisha hili kwa kuiga kikundi cha majibu kadhaa kwa dodoso sawa, kisha kurekebisha kila zawadi kwa kupunguza wastani wa kikundi na kugawanya kwa mkengeuko wa kawaida wa kikundi. Alama hii ya z inakuwa faida. Mbinu hii ni muhimu katika Uboreshaji wa Sera ya Kikundi (GRPO), iliyoanzishwa na DeepSeek, ambayo ilisimamia hoja za DeepSeek-R1. Muhimu zaidi, GRPO huondoa mtandao tofauti wa thamani (mkosoaji) unaotumiwa na PPO, kwa kuwa wastani wa kikundi hutumika kama msingi. Hili hurahisisha mafunzo, nafuu, na uhifadhi kumbukumbu zaidi huku mawimbi ya gradient yakiwekwa vyema.
Ufahamu wa Kiufundi
Kwa kundi la matokeo yenye zawadi r_1...r_G, faida ni A_i = (r_i -maana(r)) / std(r). Majibu bora kuliko wastani wa kikundi chao hupata manufaa chanya na yanaimarishwa; mbaya zaidi kuliko wastani wanasukumwa chini. Kwa sababu ulinganisho unahusiana na kipimo cha haraka, kamili cha zawadi na ugumu wa kila mara moja kughairi, na kupunguza tofauti. GRPO huweka lengo lililofupishwa la PPO na adhabu ya KL dhidi ya sera ya marejeleo ili kuzuia kielelezo kusogezwa mbali sana.
Athari za kimkakati
Maamuzi ya wazi zaidi
Inakusaidia kutenganisha madai ya wazi ya kiufundi kutoka kwa lugha ya uuzaji.
Cost and budget
Unaweza kuuliza maswali ya utekelezaji bora kabla ya kutumia pesa au wakati.
Timu na mtiririko wa kazi
Timu zenye uelewa wa pamoja hufanya maamuzi bora ya bidhaa, sera na mafunzo.
Mustakabali wa Kurekebisha Tuzo kwa Makundi katika RLHF
Kurekebisha kwa vikundi kunachochea ukuaji wa modeli ya kufikiri, ambapo miundo hujifunza kutokana na zawadi zinazoweza kuthibitishwa kama vile majibu sahihi ya hesabu bila mkosoaji aliyejifunza. Utafiti unaiboresha: mijadala juu ya kugawanywa kwa mkengeuko wa kawaida, kushughulikia vikundi vilivyo sahihi au vibaya ambavyo hutoa faida sifuri, na kuongeza ukubwa wa kikundi. Tarajia mbinu zilizowekwa katika vikundi, zisizo na ukosoaji ili kuenea kwa utumiaji wa zana za mawakala na uundaji wa msimbo, ambapo vithibitishaji kiotomatiki hutoa ishara za zawadi za bei nafuu na nyingi.
Utekelezaji wa Ulimwengu Halisi
Kufunza modeli ya kusababu kwa sampuli kwa sampuli 16 za masuluhisho kwa kila tatizo na kuwatuza walio juu ya wastani wa usahihi wa kikundi.
Boresha manufaa ya chatbot kwa kuhalalisha alama za muundo wa zawadi katika majibu kadhaa ya watahiniwa kwa kila kidokezo cha mtumiaji.
Kuboresha kiratibu cha usimbaji ambapo kila sampuli ya suluhu inapata alama kwa iwapo itafaulu majaribio ya kitengo, kisha kusawazishwa ndani ya kikundi.
Kupunguza kumbukumbu ya GPU katika bomba la RLHF kwa kuacha mtandao wa wahakiki wa PPO na kutumia maana ya kikundi kama msingi badala yake.
Hatari & Walinzi
Timu tofauti zinaweza kutumia neno moja tofauti, kwa hivyo fafanua upeo mapema.
Vigezo vinaweza kuonekana kuwa na nguvu ilhali utendakazi wa ulimwengu halisi haufanani.
Kupuuza ubora wa data na mipango ya tathmini mara nyingi huleta matokeo tete.
Ramani ya Utekelezaji
Anza na ufafanuzi wa lugha rahisi wa matokeo unayohitaji.
Chagua kipimo kimoja cha mafanikio na hali moja ya kutofaulu kabla ya kujaribu.
Tekeleza majaribio madogo yenye data wakilishi, si seti ya onyesho iliyoboreshwa.
Hati ambapo Urekebishaji wa Zawadi kwa Vikundi katika RLHF husaidia na ambapo mbinu rahisi ni bora zaidi.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grouped Reward Normalization in RLHF quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Urekebishaji wa Urefu katika Uboreshaji wa Mapendeleo
Maswali yanayoulizwa mara kwa mara
What is Grouped Reward Normalization in RLHF?
Urekebishaji wa zawadi kwa vikundi husanifisha zawadi za mwanamitindo ndani ya kundi la majibu kwa dodoso sawa, na kugeuza alama za kelele kuwa mawimbi thabiti ya mafunzo. Ni hila kuu nyuma ya GRPO, algoriti inayowezesha miundo mingi ya kisasa ya kufikiri.
Katika urekebishaji wa zawadi uliowekwa katika vikundi, je, kila jibu lina thawabu gani ikilinganishwa na?
Kila zawadi inabadilishwa kuwa z-alama kwa kutumia wastani na mkengeuko wa kawaida wa kundi la majibu kwa kidokezo sawa.
Ni algorithm gani inayohusishwa zaidi na urekebishaji wa zawadi uliowekwa katika vikundi?
GRPO, iliyoletwa na DeepSeek na kutumika katika DeepSeek-R1, imejengwa kwa kuhalalisha zawadi ndani ya kikundi.
Ni sehemu gani ya PPO ya kawaida ambayo GRPO inaondoa haswa?
Kwa kutumia wastani wa kikundi kama msingi, GRPO huacha mkosoaji aliyejifunza, kuhifadhi kumbukumbu na kukokotoa.
Nini kinatokea kwa jibu ambalo malipo yake yako chini ya wastani wa kundi lake?
Kuondoa kikundi kunamaanisha hufanya majibu ya chini ya wastani kuwa na faida hasi, kusukuma sera mbali nao.
Kwa nini kuhalalisha ndani ya kikundi kunapunguza tofauti za mafunzo?
Kwa sababu ulinganisho unahusiana katika kila dodoso, tofauti katika kiwango kamili na ugumu wa haraka huondolewa.