MUONGOZO wa Misingi

Mfano wa Tuzo la Bradley-Terry

Mfano wa Bradley-Terry ni mbinu ya kitakwimu ya karne ya kubadilisha ulinganisho wa jozi (A beats B) kuwa alama za nambari.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

In modern AI it powers reward models that learn human preferences from 'which answer is better?' labels, the backbone of RLHF.

Dive ya kina

Bradley-Terry, iliyoanzishwa mwaka wa 1952, inachukulia kwamba kila kitu kina alama ya nguvu iliyofichwa, na uwezekano kwamba kipengee A kinashinda kipengee B ndio kipengele cha utendakazi cha tofauti zao za alama. Katika upatanishi wa AI, ramani hii inaweka kwa usahihi data ya mapendeleo: viweka lebo vya binadamu huona majibu mawili ya modeli na kuchagua bora zaidi, badala ya kutoa ukadiriaji kamili ambao ni ngumu kusawazisha. Kielelezo cha zawadi, kwa kawaida kielelezo cha lugha chenye kichwa cha pato, hufunzwa ili jibu ambalo wanadamu wanapendelea lipate zawadi ya juu zaidi. Hasara ni uwezekano hasi wa kumbukumbu wa uwezekano wa Bradley-Terry: ongeza log-sigmoid ya (zawabu iliyochaguliwa kutoa zawadi ya iliyokataliwa). Kisha muundo wa zawadi hupata matokeo kiholela, ikitoa ishara kwamba kanuni za uimarishaji za kujifunza kama vile PPO huboresha dhidi ya kufanya miundo iwe ya manufaa zaidi na iliyopangwa.

Ufahamu wa Kiufundi

Upotezaji wa mafunzo kwa kulinganisha ni minus log-sigmoid ya (r_chosen - r_rejected), kwa hivyo mfano hujifunza tofauti za jamaa. Hii inamaanisha kuwa zawadi zinaweza kutambulika tu hadi nyongeza isiyobadilika; kiwango kamili ni kiholela. Kwa sababu ulinganishaji ni rahisi na thabiti zaidi kwa wanadamu kuliko alama 1 hadi 10, data ya Bradley-Terry haina kelele nyingi. Uboreshaji wa Mapendeleo ya Moja kwa Moja baadaye ulionyesha kuwa unaweza kuruka muundo tofauti wa zawadi na kuboresha lengo la Bradley-Terry moja kwa moja kwenye sera.

Athari za kimkakati

Maamuzi ya wazi zaidi

Inakusaidia kutenganisha madai ya wazi ya kiufundi kutoka kwa lugha ya uuzaji.

Cost and budget

Unaweza kuuliza maswali ya utekelezaji bora kabla ya kutumia pesa au wakati.

Timu na mtiririko wa kazi

Timu zenye uelewa wa pamoja hufanya maamuzi bora ya bidhaa, sera na mafunzo.

Mustakabali wa Uundaji wa Tuzo la Bradley-Terry

Bradley-Terry huchukua cheo kimoja thabiti na mapendeleo ya mpito, ambayo huvunjika wakati wanadamu hawakubaliani au mzunguko wa mapendeleo. Utafiti unaelekea kwenye miundo inayonasa ugawaji wa mapendeleo, zawadi za pande nyingi (usaidizi, usalama, uaminifu uliowekwa kando), na mbinu kama vile Nash kujifunza kutokana na maoni ya binadamu ambayo hupunguza dhana ya alama moja. DPO na vibadala vyake vinazidi kukunja lengo la Bradley-Terry moja kwa moja katika mafunzo ya sera. Tarajia mifumo bora zaidi ya ulinganishaji, ikijumuisha viwango vya zaidi ya vitu viwili na mapendeleo yaliyopimwa uaminifu, ili kupunguza udukuzi wa zawadi.

Utekelezaji wa Ulimwengu Halisi

Kufunza muundo wa zawadi katika RLHF unaoorodhesha majibu mawili ya gumzo na kulisha mawimbi mbaya zaidi kwa urekebishaji mzuri wa PPO.

Uboreshaji wa Mapendeleo ya Moja kwa Moja kurekebisha muundo moja kwa moja kwenye jozi za jibu zilizochaguliwa dhidi ya kukataliwa kwa kutumia upotezaji wa logi-sigmoid ya Bradley-Terry.

Kuorodhesha wachezaji wa chess au esports kupitia Elo, ambaye kimahesabu ni binamu wa karibu wa mtindo wa Bradley-Terry kuhusu matokeo ya mchezo.

Kuunda kiwango cha mapendekezo ya maudhui kutoka kwa data ya 'watumiaji wanaopendelea A kuliko B' badala ya ukadiriaji kamili wa nyota.

Hatari & Walinzi

Timu tofauti zinaweza kutumia neno moja tofauti, kwa hivyo fafanua upeo mapema.

Vigezo vinaweza kuonekana kuwa na nguvu ilhali utendakazi wa ulimwengu halisi haufanani.

Kupuuza ubora wa data na mipango ya tathmini mara nyingi huleta matokeo tete.

Ramani ya Utekelezaji

1

Anza na ufafanuzi wa lugha rahisi wa matokeo unayohitaji.

2

Chagua kipimo kimoja cha mafanikio na hali moja ya kutofaulu kabla ya kujaribu.

3

Tekeleza majaribio madogo yenye data wakilishi, si seti ya onyesho iliyoboreshwa.

4

Hati ambapo Bradley-Terry Reward Modeling husaidia na ambapo mbinu rahisi ni bora zaidi.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Bradley-Terry Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Uundaji wa Tuzo

Maswali yanayoulizwa mara kwa mara

What is Bradley-Terry Reward Modeling?

Mfano wa Bradley-Terry ni mbinu ya kitakwimu ya karne ya kubadilisha ulinganisho wa jozi (A beats B) kuwa alama za nambari. Katika AI ya kisasa inawapa nguvu mifano ya malipo ambayo hujifunza mapendeleo ya binadamu kutoka kwa 'jibu lipi ni bora zaidi?' lebo, uti wa mgongo wa RLHF.

Je, mtindo wa Bradley-Terry unabadilisha nini kuwa alama za nambari?

Bradley-Terry huchukua ulinganisho wa 'A beats B' kwa jozi na huingiza alama ya nguvu iliyofichwa kwa kila kipengee, ndiyo maana inalingana na uwekaji lebo wa mapendeleo ya binadamu vizuri.

Katika Bradley-Terry, uwezekano kwamba A beats B ni matokeo ya nini?

Mfano huweka P(A beats B) sawa na logistic (sigmoid) ya tofauti kati ya alama za nguvu zilizofichwa za A na B.

Kwa nini zawadi za Bradley-Terry zinaweza kutambulika hadi nyongeza isiyobadilika?

Upotezaji wa mafunzo hutumia tu tofauti kati ya zawadi zilizochaguliwa na zilizokataliwa, kwa hivyo kubadilisha alama zote kwa kiwango sawa huacha hasara bila kubadilika; kiwango kamili ni kiholela.

Je, ni hasara gani ya kawaida kwa ulinganisho mmoja wa mapendeleo katika uundaji wa zawadi?

Uwezekano hasi wa kumbukumbu ya Bradley-Terry hupunguza hadi toa log-sigmoid ya tofauti ya zawadi iliyochaguliwa-minus-iliyokataliwa, na hivyo kusukuma zawadi ya jibu lililochaguliwa kuwa juu zaidi.

Ni njia gani inayoruka muundo tofauti wa zawadi kwa kuboresha lengo la Bradley-Terry moja kwa moja kwenye sera?

DPO hurekebisha lengo la mapendeleo la Bradley-Terry ili liweze kutumika moja kwa moja kwa muundo wa sera, na hivyo kuondoa hitaji la kutoa mafunzo na kuuliza mfano wa zawadi unaojitegemea.