Xulashada tooska ah
Horumarinta Tooska ah (DPO) waa hab lagu waafajiyo moodooyinka luqadda iyo dookhyada aadanaha iyada oo aan la tababarin nooc abaalmarin gaar ah ama la wado barashada xoojinta
Dulmar
It collapses a complex multi-stage pipeline into a single, stable training loss.
quusid qoto dheer
DPO, oo ay soo bandhigeen Rafailov iyo asxaabtiisa Stanford sanadka 2023, waxa ay dib uga fakarayaan sida aan u barno tusaalaha waxa ay dadku door bidaan. Habka dhaqameed (RLHF) wuxuu tababbaraa qaabka abaalmarinta ee isbarbardhigga aadanaha, ka dibna wuxuu adeegsadaa barashada xoojinta si loo kordhiyo abaalmarintaas. Aragtida muhiimka ah ee DPO waa xisaab: siyaasadda ugu habboon ee hoos timaada ujeeddada RLHF waxay leedahay xiriir qaabaysan oo abaal-marin ah, si aad dib u habayn karto isla'egyada oo aad u wanaajiso qaabka luqadda si toos ah lammaane doorbidaya. Waxaad siisay degdeg ah, jawaab 'la doortay' (doorbiday) iyo jawaab 'la diiday', iyo luminta qaab-kala-soocidda fudud ayaa nuujinaysa qaabka si jawaabta la doortay uga dhigto mid aad u badan. Nooc abaal-marin ah, ma jiro muunad loop, ma jiro abaal-marin jabsi ah. Way ka fudud tahay oo aad bay u xasilloon tahay in la ordo.
Aragtida Farsamada
DPO waxay isticmaashaa khasaaraha laba-geesoodka ah ee entropy marka loo eego lammaanaha doorbida. Waxay kordhisaa saamiga jaan-goynta-ixtimaal ee jawaabta la doortay marka loo eego tii la diiday, mid walba waxaa lagu cabbiraa qaabka tixraaca ee la qaboojiyey (sida caadiga ah barta bilowga ee la kormeero-wanaagsan). Heerkulbeegga beta ayaa koontaroolaya inta ay siyaasaddu uga fogaan karto tixraacaas, iyadoo si maldahan u dhaqangelinaysa xannibaadda KL ee RLHF ay si cad u khusayso. Abaalmarinta weligeed lama hirgelin; waa mid dahsoon oo ku jirta siyaasada ixtimaalkeeda.
Saamaynta Istiraatijiyadeed
Xawaaraha iyo miisaanka
Socodka shaqada luqaddu si dhakhso leh ayay u socon kartaa iyada oo aan la hurayn joogteynta.
Helitaanka iyo gaarsiinta
Waxay balaadhisaa gelitaanka luqadaha iyo qaababka isgaarsiinta.
Go'aamo cad
Kooxuhu waxay waqti badan ku qaadan karaan xukunka halka otomaatiggu uu qabanayo ku celcelinta.
Mustaqbalka Xulashada Tooska ah ee Hagaajinta
DPO waxay noqotay hab toosan sababtoo ah waa mid raqiis ah oo dib loo soo saari karo, waxayna dhashay qoys kala duwan: IPO waxay hagaajisaa ku-habboonaanta dookhyada go'aaminta dhow, KTO waxay wax ka barataa hal calaamad oo wanaagsan ama xun halkii lammaane, iyo ORPO waxay laalaabtaa doorbidida barashada si fiican u habeyn aan lahayn qaab tixraaceed. Filo shaqada sii socota ee isku darka DPO iyo xogta siyaasadda iyo dhererka/tayo-xumida, yaraynta farqiga haray iyo RLHF online buuxa.
Dhaqangelinta Adduunka-dhabta ah
Hagaajinta qaababka wada sheekaysiga miisaanka furan sida Zephyr iyo noocyo badan oo Llama iyo Mistral ah, kuwaas oo la jaanqaaday DPO ee xog-ururinta
Yaraynta wax soo saarka waxyeellada leh ama aan waxtarka lahayn iyadoo la adeegsanayo lammaane halkaas oo badbaadada, jawaabta waxtarka leh ay 'doortay' mid dhibaato leh
Bar kaaliyaha codaynta inuu ka door bido xalal sax ah oo si wanaagsan loo diiwaangeliyay oo ka sarreeya kuwa buggy iyadoo la adeegsanayo isbarbardhigga horumariyaha
Habaynta qaabka koobitaanka si ay moodooyinka u door bidaan koobab kooban, aamin ah oo ku saabsan kuwa afka ah ama dhalanteed
Khatarta & Dariiqyada Ilaalada
Xaqiiqooyinka dhalanteed waxay si deggan u geli karaan warbixinnada, taageerada socodka, ama natiijooyinka cilmi-baarista.
Dareenka degdega ahi wuxuu abuuri karaa natiijooyin aan iswaafaqayn codsiyada la midka ah.
Xogta qoraalka xasaasiga ah ayaa laga yaabaa in la kashifo haddii kontaroolada gelitaanka ay daciif yihiin.
Qorshe Hawleedka Dhaqangelinta
Qeex qaabka wax soo saarka, codka, iyo heerarka tayada ka hor inta aan la baahin.
Jawaabaha salka ku haya ilo lagu kalsoon yahay mar kasta oo saxnidu ay muhiim tahay.
Hayso isbaarada dib u eegista bini aadamka ee wax soo saarka sare.
Lasoco qaababka guuldarada oo dib u leyli dardargelinta ama socodka shaqada si joogto ah.
Sii wad Sahaminta
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Direct Preference Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hagaha xiga
Kordhinta Xulashada Saamiga Khasaarada
Su'aalaha soo noqnoqda
What is Direct Preference Optimization?
Horumarinta Tooska ah (DPO) waa hab lagu waafajiyo moodooyinka luqadda iyo dookhyada aadanaha iyada oo aan la tababarin nooc abaalmarin gaar ah ama la wado barashada xoojinta Waxay burburisaa dhuumo isku dhafan oo heerar kala duwan leh oo gala hal, khasaare tababar oo deggan.
Maxay DPO baabi'isaa marka la barbar dhigo RLHF-dhaqameedka?
Faa'iidada ugu weyn ee DPO waa meesha ka saarta qaabka abaal-marineed ee cad iyo wareegga muunada RL, iyada oo hagaajinaysa siyaasadda si toos ah lammaane doorbidaya beddelkeeda.
Waa maxay xogta uu ka kooban yahay hal tusaale tababar oo DPO ah?
DPO waxay ku tababartaa lammaane dookh: degdeg ah iyo mid la door biday ('la doortay') iyo mid aan la jeclaysan ('la diiday') jawaab.
Doorkee buu ka ciyaaraa tusaalaha tixraaca ee DPO?
Tixraac la qaboojiyey (sida caadiga ah qaabka SFT) ayaa ku dhejinaya khasaaraha; Halbeegga beta ayaa koontaroolaya ilaa inta siyaasadda la tababaray ay uga guuri karto.
Gudaha DPO, xagee 'abaalmarinta' lagu matalay?
Kala soocida DPO waxay tusinaysaa in abaalgudku ku qarsoon yahay saamiga ixtimaalka log-ka ee u dhexeeya siyaasadda iyo tixraaca, markaa looma baahna nooc abaal-marin oo cad.
Waa maxay qiyaasta beta (heerkulka) ee DPO?
Beta ayaa maamusha xaddidaadda KL ee daahsoon: beta sare waxay ilaalinaysaa siyaasadda ku dhow tixraaca, beta hoose waxay ogolaataa leexasho badan.