Uboreshaji wa Mapendeleo ya Moja kwa moja
Uboreshaji wa Mapendeleo ya Moja kwa Moja (DPO) ni njia ya kuoanisha miundo ya lugha na mapendeleo ya binadamu bila kufundisha muundo tofauti wa zawadi au kuendesha mafunzo ya uimarishaji.
Muhtasari
It collapses a complex multi-stage pipeline into a single, stable training loss.
Dive ya kina
DPO, iliyoanzishwa na Rafailov na wenzake huko Stanford mnamo 2023, inafikiria upya jinsi tunavyofundisha mfano kile ambacho watu wanapendelea. Mbinu ya kitamaduni (RLHF) hufunza mfano wa zawadi juu ya ulinganisho wa binadamu, kisha hutumia mafunzo ya uimarishaji ili kuongeza zawadi hiyo. Maarifa muhimu ya DPO ni ya kihisabati: sera bora chini ya lengo hilo la RLHF ina uhusiano wa karibu na zawadi, kwa hivyo unaweza kupanga upya milinganyo na kuboresha muundo wa lugha moja kwa moja kwenye jozi za mapendeleo. Unaipa haraka, jibu 'lililochaguliwa' (lililopendekezwa), na jibu 'lililokataliwa', na upotezaji rahisi wa mtindo wa uainishaji hugusa kielelezo ili kufanya jibu lililochaguliwa liwe na uwezekano zaidi. Hakuna mfano wa zawadi, hakuna kitanzi cha sampuli, hakuna udukuzi wa zawadi. Ni rahisi zaidi na thabiti zaidi kukimbia.
Ufahamu wa Kiufundi
DPO hutumia upotezaji wa mtambuka wa binary juu ya jozi za mapendeleo. Huongeza uwiano wa uwezekano wa kumbukumbu wa jibu lililochaguliwa linalohusiana na lililokataliwa, kila moja ikipimwa dhidi ya muundo wa marejeleo uliogandishwa (kwa kawaida ni sehemu ya kuanzia inayosimamiwa-iliyopangwa vizuri). Beta ya kigezo cha halijoto hudhibiti umbali ambao sera inaweza kusogea kutoka kwa marejeleo hayo, ikitekeleza kikwazo cha KL ambacho RLHF inatumika kwa uwazi. Thawabu haipatikani kamwe; imejumuishwa katika uwezekano wa kumbukumbu wa sera.
Athari za kimkakati
Kasi na kiwango
Mitiririko ya kazi ya lugha inaweza kusonga kwa kasi zaidi bila kuacha uthabiti.
Kufikia na kufikia
Inapanua ufikiaji katika lugha na mitindo ya mawasiliano.
Maamuzi ya wazi zaidi
Timu zinaweza kutumia muda mwingi kufanya uamuzi huku otomatiki ikishughulikia marudio.
Mustakabali wa Uboreshaji wa Mapendeleo ya Moja kwa Moja
DPO imekuwa njia chaguo-msingi ya upangaji kwa sababu ni ya bei nafuu na inaweza kuzaliana tena, na ilizaa familia ya lahaja: IPO hurekebisha kutosheleza kwa mapendeleo yanayokaribia kubainishwa, KTO hujifunza kutoka kwa lebo moja nzuri au mbaya badala ya jozi, na ORPO hukunja ujifunzaji wa upendeleo katika kupanga vizuri bila kielelezo cha marejeleo. Tarajia kazi inayoendelea ya kuchanganya DPO na data ya sera na upotoshaji wa urefu/ubora, ukipunguza pengo lililobaki na RLHF kamili ya mtandaoni.
Utekelezaji wa Ulimwengu Halisi
Kurekebisha miundo ya gumzo ya uzani wazi kama vile Zephyr na derivatives nyingi za Llama na Mistral, ambazo ziliunganishwa na DPO kwenye seti za data za mapendeleo.
Kupunguza matokeo yanayodhuru au yasiyofaa kwa kutumia jozi ambapo jibu salama na la kusaidia 'limechaguliwa' juu ya tatizo.
Kufundisha msaidizi wa usimbaji kupendelea suluhu sahihi, zilizo na kumbukumbu vizuri kuliko zile zenye hitilafu kwa kutumia ulinganisho uliokadiriwa na msanidi
Kurekebisha mtindo wa muhtasari ili miundo ipendeze muhtasari mfupi na mwaminifu kuliko wa kitenzi au ulionasishwa
Hatari & Walinzi
Mambo ya ukweli yanaweza kuingiza ripoti kwa utulivu, mitiririko ya usaidizi, au matokeo ya utafiti.
Usikivu wa haraka unaweza kuunda matokeo yasiyolingana katika maombi sawa.
Data nyeti ya maandishi inaweza kufichuliwa ikiwa vidhibiti vya ufikiaji ni dhaifu.
Ramani ya Utekelezaji
Bainisha umbizo la towe, toni na viwango vya ubora kabla ya kusambaza.
Majibu ya msingi na vyanzo vinavyoaminika wakati wowote usahihi ni muhimu.
Weka ukaguzi wa ukaguzi wa kibinadamu kwa matokeo ya juu.
Fuatilia mifumo ya kushindwa na fundisha tena vidokezo au mtiririko wa kazi mara kwa mara.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Direct Preference Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Uboreshaji wa Uwiano wa Mapendeleo
Maswali yanayoulizwa mara kwa mara
What is Direct Preference Optimization?
Uboreshaji wa Mapendeleo ya Moja kwa Moja (DPO) ni njia ya kuoanisha miundo ya lugha na mapendeleo ya binadamu bila kufundisha muundo tofauti wa zawadi au kuendesha mafunzo ya uimarishaji. Inaporomosha bomba la hatua nyingi katika hasara moja, thabiti ya mafunzo.
Je, DPO huondoa nini ikilinganishwa na RLHF ya jadi?
Faida kuu ya DPO ni kuondoa muundo wa zawadi dhahiri na kitanzi cha sampuli cha RL, kuboresha sera moja kwa moja kwenye jozi za mapendeleo badala yake.
Mfano mmoja wa mafunzo ya DPO una data gani?
DPO hufunza kwa jozi za mapendeleo: haraka pamoja na moja inayopendelewa ('iliyochaguliwa') na jibu moja lisilopendelewa ('lililokataliwa').
Mfano wa marejeleo una jukumu gani katika DPO?
Rejea iliyogandishwa (kawaida modeli ya SFT) inashikilia upotezaji; kigezo cha beta hudhibiti umbali ambao sera iliyofunzwa inaweza kutoka kwayo.
Katika DPO, 'tuzo' inawakilishwa wapi?
Utoto wa DPO unaonyesha kuwa zawadi ni dhahiri katika uwiano wa uwezekano wa kumbukumbu kati ya sera na marejeleo, kwa hivyo hakuna mfano wa zawadi dhahiri unaohitajika.
Je, kigezo cha beta (joto) katika DPO kinadhibiti nini?
Beta inasimamia kikwazo kisicho wazi cha KL: beta ya juu huweka sera karibu na marejeleo, beta ya chini inaruhusu mkengeuko zaidi.