Kukataliwa Sampuli Fine-Tuning
Urekebishaji Bora wa Sampuli ya Kukataa (RFT) hutoa majibu mengi ya watahiniwa, huweka yale yaliyopata alama bora pekee, na hufunza tena muundo kwa washindi hao.
Muhtasari
It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.
Dive ya kina
Kukataliwa Sampuli Urekebishaji Sahihi, wakati mwingine huitwa usanifu-bora wa-N, ni kiungo muhimu katika jinsi miundo kama Meta ya Llama 2 na Llama 3 zilivyopangwa. Kichocheo ni rahisi: kwa kila kidokezo, sampuli ya majibu kadhaa (sema 4 hadi 64) kutoka kwa muundo wa sasa, weka alama kwa kila modeli ya zawadi au kikagua kiotomatiki, kisha utupe ('kataa') yote isipokuwa matokeo ya daraja la juu. Sampuli zilizosalia za ubora wa juu huwa seti mpya ya data ya usanifu unaosimamiwa, na muundo huo hufunzwa juu yao kwa hasara ya kawaida inayofuata. Kurudia kitanzi hiki mara kwa mara hugusa mtindo kuelekea kutoa majibu bora peke yake. Kwa sababu muundo hujifunza kutokana na matokeo yake yenyewe yaliyochujwa, RFT huepuka kuyumba na kurekebisha maumivu ya kichwa ya RL-gradient RL huku ikiendelea kutumia mawimbi ya zawadi.
Ufahamu wa Kiufundi
RFT hutumia ukweli kwamba sampuli mara nyingi na kuweka jibu la zawadi ya juu zaidi kukadiria kuchagua kutoka kwa usambazaji ulioboreshwa, wa ubora wa juu. Mafunzo kwa washindi hao kupitia njia ya kawaida ya kuvuka entropy yanasafisha tabia bora zaidi ya N hadi kwenye matokeo ya sampuli moja ya modeli. Kwa vikoa vinavyoweza kuthibitishwa kama vile hesabu au msimbo, 'zawabu' inaweza kuwa iwapo jibu la mwisho au jaribio la kitengo litafaulu, hivyo basi kuondoa hitaji la muundo wa zawadi uliofunzwa kabisa.
Athari za kimkakati
Kasi na kiwango
Mitiririko ya kazi ya lugha inaweza kusonga kwa kasi zaidi bila kuacha uthabiti.
Kufikia na kufikia
Inapanua ufikiaji katika lugha na mitindo ya mawasiliano.
Maamuzi ya wazi zaidi
Timu zinaweza kutumia muda mwingi kufanya uamuzi huku otomatiki ikishughulikia marudio.
Mustakabali wa Kukataliwa Sampuli Urekebishaji Mzuri
RFT ni kitovu cha mafunzo ya kisasa ya baada ya mafunzo, mara nyingi hutumika kabla au kando ya mbinu za RL kama PPO na DPO. Rufaa yake hukua kwa makisio ya bei nafuu na vithibitishaji vikali vya kiotomatiki: jinsi miundo inavyoboreka katika kujitengenezea na kujichunguza, sampuli za kukataliwa mara kwa mara huauni data-sanisi na vitanzi vya kujiboresha. Tarajia muunganisho mkali zaidi na miundo ya hoja inayozalisha misururu ya mawazo inayoweza kuthibitishwa, na utafiti unaoendelea wa jinsi ya kuepuka udukuzi wa zawadi na kuporomoka kwa anuwai wakati wa mafunzo mara kwa mara juu ya matokeo ya mtindo mwenyewe.
Utekelezaji wa Ulimwengu Halisi
Kulinganisha miundo ya mtindo wa Llama kwa kuchukua sampuli za majibu mengi kwa kila mara, kwa kuweka alama za juu zaidi za muundo wa zawadi, kisha SFT kwenye hizo
Kuboresha kisuluhishi cha hesabu kwa kutoa suluhu nyingi na kubakiza zile tu zinazofikia jibu sahihi na linaloweza kukaguliwa.
Uzalishaji wa msimbo ambapo watahiniwa hutunzwa ikiwa tu watafaulu majaribio ya kitengo, kisha kutumika kama data ya mafunzo
Kuunda hifadhidata za maagizo ya usanifu kwa kuchuja majibu bora zaidi ya modeli mwenyewe ya duru inayofuata ya mafunzo.
Hatari & Walinzi
Mambo ya ukweli yanaweza kuingiza ripoti kwa utulivu, mitiririko ya usaidizi, au matokeo ya utafiti.
Usikivu wa haraka unaweza kuunda matokeo yasiyolingana katika maombi sawa.
Data nyeti ya maandishi inaweza kufichuliwa ikiwa vidhibiti vya ufikiaji ni dhaifu.
Ramani ya Utekelezaji
Bainisha umbizo la towe, toni na viwango vya ubora kabla ya kusambaza.
Majibu ya msingi na vyanzo vinavyoaminika wakati wowote usahihi ni muhimu.
Weka ukaguzi wa ukaguzi wa kibinadamu kwa matokeo ya juu.
Fuatilia mifumo ya kushindwa na fundisha tena vidokezo au mtiririko wa kazi mara kwa mara.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rejection Sampling Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
QLoRA na 4-Bit Fine-Tuning
Maswali yanayoulizwa mara kwa mara
What is Rejection Sampling Fine-Tuning?
Urekebishaji Bora wa Sampuli ya Kukataa (RFT) hutoa majibu mengi ya watahiniwa, huweka yale yaliyopata alama bora pekee, na hufunza tena muundo kwa washindi hao. Ni muhimu kwa sababu inatoa manufaa mengi ya RLHF kwa kutumia ujifunzaji unaosimamiwa moja kwa moja badala ya ujifunzaji changamano wa kuimarisha.
Wazo la msingi la Kukataa Sampuli za Urekebishaji Bora ni lipi?
RFT hutolea sampuli za majibu mengi, vichujio hadi vilivyopata alama za juu, na kurekebisha muundo kwa washindi hao.
Katika vikoa vinavyoweza kuthibitishwa kama vile hesabu au msimbo, ni zawadi gani inaweza kutumika kama zawadi?
Kwa kazi zinazoweza kukaguliwa, RFT inaweza kutumia usahihi kamili au kufaulu majaribio ya kitengo, kuepuka muundo uliofunzwa wa zawadi.
Ni familia gani ya kielelezo maarufu ilitumia sampuli za kukataliwa wakati wa upatanishi?
Meta imefafanuliwa kwa kutumia sampuli ya kukataliwa kama sehemu ya kichocheo cha baada ya mafunzo kwa miundo ya Llama 2 na Llama 3.
Kwa nini timu zinaweza kupendelea RFT kuliko RL-gradient RL kama PPO?
RFT hujizoeza tena na upotezaji wa kawaida unaofuata kwenye sampuli zilizochujwa, ikiepusha ugumu wa urekebishaji na ukosefu wa uthabiti wa mbinu za upunguzaji wa sera.
Mafunzo juu ya sampuli za malipo ya juu kwa ufanisi hufanya nini?
Kwa kujifunza kutoka kwa majibu ya juu yaliyochujwa, mtindo huweka tabia ya ubora wa juu katika kizazi kimoja.