Lugha AI MWONGOZO

Uboreshaji wa Uwiano wa Mapendeleo

Uboreshaji wa Mapendeleo ya Uwiano wa Odds (ORPO) ni mbinu ya kupanga vizuri inayofunza mtindo wa lugha tabia nzuri na mapendeleo ya binadamu katika pasi moja ya mafunzo.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It matters because it skips the usual separate reward model and reference model, making alignment cheaper and simpler.

Dive ya kina

ORPO, iliyoanzishwa na Hong, Lee, na Thorne mwaka wa 2024, inachanganya urekebishaji mzuri unaosimamiwa na upatanishi wa mapendeleo katika hatua moja. Mabomba mengi ya upangaji kwanza hufanya SFT kwenye mifano mizuri, kisha endesha njia ya pili kama RLHF au DPO ambayo inahitaji nakala iliyogandishwa ya modeli (rejeleo) pamoja na jozi za upendeleo zilizohifadhiwa. ORPO huondoa mtindo wa marejeleo kabisa. Upotevu wake huongeza muda wa adhabu kwa lengo la kawaida la ishara inayofuata: huongeza uwezekano wa mfano kwa jibu lililochaguliwa (lililopendekezwa) huku ukisukuma chini uwezekano wa lililokataliwa. Kwa sababu hutumia uwiano wa odds badala ya pengo kubwa la uwezekano wa logi, adhabu ni laini, kwa hivyo mtindo hujifunza kupendelea majibu mazuri bila kusahau kizazi fasaha.

Ufahamu wa Kiufundi

Hasara ya ORPO ni hasara ya mtambuka ya SFT pamoja na log-sigmoid yenye uzito ya uwiano wa odd kati ya majibu yaliyochaguliwa na kukataliwa. Tabia mbaya ni sawa na p/(1-p), kwa hivyo uwiano unalinganisha ni uwezekano gani zaidi wa mfano kupata jibu zuri dhidi ya mbaya. Kutumia odd badala ya uwezekano ghafi huweka utofautishaji kuwa mpole, ambao huzuia ukandamizaji kupita kiasi wa tokeni zilizokataliwa ambazo zinaweza kudhalilisha muundo ambao haujarejelewa.

Athari za kimkakati

Kasi na kiwango

Mitiririko ya kazi ya lugha inaweza kusonga kwa kasi zaidi bila kuacha uthabiti.

Kufikia na kufikia

Inapanua ufikiaji katika lugha na mitindo ya mawasiliano.

Maamuzi ya wazi zaidi

Timu zinaweza kutumia muda mwingi kufanya uamuzi huku otomatiki ikishughulikia marudio.

Mustakabali wa Uboreshaji wa Uwiano wa Odds

ORPO inavutia kwa sababu inapunguza kumbukumbu na kukokotoa kwa kuacha muundo wa marejeleo, ambao unavutia timu kurekebisha maunzi machache. Tarajia kuonekana mara nyingi zaidi katika mapishi ya chanzo huria na kama chaguo-msingi katika maktaba kama vile Hugging Face TRL. Kazi ya siku zijazo ina uwezekano wa kurekebisha uzani wa lambda kiotomatiki, kuchanganya ORPO na malengo mengine yasiyo na marejeleo, na kuipanua hadi miundo mingi na mikubwa sana ambapo kuhifadhi nakala mbili kwenye kumbukumbu ni gharama kubwa.

Utekelezaji wa Ulimwengu Halisi

Kurekebisha muundo wa gumzo wa chanzo huria wa 7B kwenye jozi za mapendeleo bila kupakia nakala ya pili ya marejeleo, na kupunguza nusu ya kumbukumbu ya GPU.

Anzisho la kupanga msaidizi wa usaidizi kwa mteja ili kupendelea majibu ya heshima, ya sera katika mafunzo moja badala ya SFT-basi-DPO.

Watafiti wanaolinganisha ORPO dhidi ya DPO kwenye mkusanyiko wa data sawa ili kuonyesha upatanishi unaolingana na komputa ya chini

Kurekebisha muundo msingi kwa kikoa maalum (k.m., kuandika kisheria) ambapo jozi nzuri na mbaya za mifano zinapatikana lakini bajeti ya mfano wa zawadi haipo.

Hatari & Walinzi

Mambo ya ukweli yanaweza kuingiza ripoti kwa utulivu, mitiririko ya usaidizi, au matokeo ya utafiti.

Usikivu wa haraka unaweza kuunda matokeo yasiyolingana katika maombi sawa.

Data nyeti ya maandishi inaweza kufichuliwa ikiwa vidhibiti vya ufikiaji ni dhaifu.

Ramani ya Utekelezaji

1

Bainisha umbizo la towe, toni na viwango vya ubora kabla ya kusambaza.

2

Majibu ya msingi na vyanzo vinavyoaminika wakati wowote usahihi ni muhimu.

3

Weka ukaguzi wa ukaguzi wa kibinadamu kwa matokeo ya juu.

4

Fuatilia mifumo ya kushindwa na fundisha tena vidokezo au mtiririko wa kazi mara kwa mara.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Odds Ratio Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Uboreshaji wa Mapendeleo ya Moja kwa moja

Maswali yanayoulizwa mara kwa mara

What is Odds Ratio Preference Optimization?

Uboreshaji wa Mapendeleo ya Uwiano wa Odds (ORPO) ni mbinu ya kupanga vizuri inayofunza mtindo wa lugha tabia nzuri na mapendeleo ya binadamu katika pasi moja ya mafunzo. Ni muhimu kwa sababu inaruka modeli tofauti ya kawaida ya zawadi na modeli ya marejeleo, na kufanya upatanishi kuwa nafuu na rahisi.

Ni faida gani kuu ya vitendo ya ORPO juu ya njia kama DPO?

ORPO hukunja ujifunzaji wa mapendeleo katika upotevu wa SFT na haihitaji nakala ya marejeleo iliyogandishwa ya modeli, kuhifadhi kumbukumbu na kukokotoa.

'Uwiano wa tabia mbaya' katika ORPO unalinganisha nini?

ORPO hutumia uwiano wa odds (p/(1-p)) modeli inapeana jibu linalopendekezwa dhidi ya lile lisilopendelewa.

ORPO hufanya kazi gani mbili katika pasi moja ya mafunzo?

ORPO inachanganya lengo la kawaida la tokeni la SFT na adhabu ya mapendeleo katika hasara moja iliyounganishwa.

Kwa nini ORPO hutumia odd badala ya tofauti mbichi ya uwezekano wa logi kwa adhabu?

Adhabu inayotokana na uwezekano ni nyepesi zaidi, na kusaidia mtindo ambao haujarejelewa kuweka kizazi cha ufasaha huku ukipendelea majibu mazuri.

Hasara ya ORPO inafafanuliwa vyema kuwa ni mchanganyiko gani?

ORPO huongeza muda wa uwiano wa odds-ratio uliowekewa uzito juu ya upotevu unaosimamiwa wa mtambuka.