Nkwalite mmasị ozugbo
Direct Preference Optimization (DPO) bụ ụzọ iji kwado ụdị asụsụ na mmasị mmadụ na-enyeghị ọzụzụ ụdị ụgwọ ọrụ dị iche iche ma ọ bụ na-agba ọsọ mmụta nkwado.
Nchịkọta
It collapses a complex multi-stage pipeline into a single, stable training loss.
Ime miri emi
DPO, nke Rafailov na ndị ọrụ ibe webatara na Stanford na 2023, tụgharịrị uche ka anyị si kuzie ihe nlereanya ihe ndị mmadụ masịrị. Usoro ọdịnala (RLHF) na-azụ ụdị ụgwọ ọrụ na ntụnyere mmadụ, wee na-eji mmụta nkwalite iji bulie ụgwọ ọrụ ahụ. Isi nghọta DPO bụ mgbakọ na mwepụ: amụma kacha mma n'okpuru ebumnobi RLHF ahụ nwere mmekọrịta mechiri emechi na ụgwọ ọrụ ahụ, yabụ ị nwere ike hazie nha nha ma kwalite ụdị asụsụ ozugbo na ụzọ abụọ mmasị. Ị na-enye ya ngwa ngwa, nzaghachi 'ahọpụtara' (ọkachamma) yana nzaghachi 'ajụjụ ọnụ', yana mfu ụdị nhazi dị mfe na-eme ka ihe atụ ahụ mee ka azịza ahọpụtara yie ka ọ dịtụ. Enweghị ụdị ụgwọ ọrụ, enweghị loop nlele, enweghị mbanye ụgwọ ọrụ. Ọ dị nnọọ mfe ma kwụsie ike ịgba ọsọ.
Nghọta nka nka
DPO na-eji ọnụọgụ abụọ cross-entropy mfu karịa ụzọ abụọ mmasị. Ọ na-abawanye ogo log-ihe gbasara omume nke nzaghachi ahọpụtara n'ihe metụtara nke a jụrụ, nke ọ bụla na-atụ n'ụdị ntụaka oyi kpọnwụrụ (na-abụkarị ebe mmalite a na-enyocha-nke ọma). Oke beta okpomọkụ na-achịkwa ogologo amụma a nwere ike isite na ntụaka ahụ, na-eme ka mmachi KL na RLHF na-emetụta n'ụzọ doro anya. A naghị enweta ụgwọ ọrụ ahụ; ọ pụtara n'ụzọ doro anya na usoro iwu nke log-probabilities.
Mmetụta atụmatụ
Ọsọ na ọnụ ọgụgụ
Usoro ọrụ asụsụ nwere ike ịga ngwa ngwa n'achụghị nkwụsi ike.
Nweta na iru
Ọ na-agbasawanye ohere n'ofe asụsụ na ụdị nzikọrịta ozi.
Mkpebi doro anya
Ndị otu nwere ike itinyekwu oge na ikpe ebe akpaaka na-ejikwa nkwughachi.
Ọdịnihu nke nkwalite mmasị ozugbo
DPO abụrụla usoro nhazi ndabara n'ihi na ọ dị ọnụ ala ma nwee ike ịmụgharị ya, ọ zụlitere ezinụlọ dị iche iche: IPO na-edozi overfitting na mmasị dị nso, KTO na-amụta site na otu aha ọma ma ọ bụ ọjọọ kama ịbụ ụzọ abụọ, na ORPO na-atụgharị mmasị mmụta n'ime nhazi nke ọma na-enweghị ihe atụ. Na-atụ anya ka ọrụ na-aga n'ihu na ijikọta DPO na data gbasara amụma yana nhụsianya ogologo/ịdị mma, na-ebelata oghere fọdụrụ na RLHF zuru ezu n'ịntanetị.
Mmejuputa n'ezie n'ụwa
Ụdị nkata mepere emepe nke ọma dị ka Zephyr na ọtụtụ ụdị Llama na Mistral, bụ ndị akwadoro na DPO na datasets mmasị.
Ibelata mpụta emerụ ma ọ bụ nke na-adịghị enye aka site na iji ụzọ abụọ ebe nchekwa, azịza enyemaka bụ 'ahọpụtara' karịa nke nwere nsogbu.
Ịkụziri onye inyeaka koodu ka ịhọrọ usoro ziri ezi, edekọtara nke ọma karịa ndị na-adịghị mma site na iji ntụnyere ndị nrụpụta kwadoro.
Ntugharị ụdị nchịkọta akụkọ ka ụdị na-akwado nchịkọta nkenke, nke kwesịrị ntụkwasị obi n'okwu ọnụ ma ọ bụ nke a na-adịghị ahụkebe.
Ihe ize ndụ & okporo ụzọ nche
Eziokwu ndị e chepụtara echepụta nwere ike jiri nwayọ tinye akụkọ, nkwado nkwado, ma ọ bụ nsonaazụ nyocha.
Mmetụta ngwa ngwa nwere ike ịmepụta nsonaazụ na-ekwekọghị ekwekọ n'ofe arịrịọ ndị yiri ya.
Enwere ike ikpughe data ederede nwere mmetụta ma ọ bụrụ na njikwa ohere adịghị ike.
Map mmejuputa
Kọwaa usoro mmepụta, ụda, na ụkpụrụ ịdịmma tupu ibugharị.
Weghachite nzaghachi site na isi mmalite ntụkwasị obi mgbe ọ bụla izi ezi dị mkpa.
Debe ebe nleba anya mmadụ maka mpụta dị elu.
Sochie ụkpụrụ ọdịda ma na-azụghachi mkpali ma ọ bụ usoro ọrụ mgbe niile.
Nọgide na-eme nchọpụta
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Direct Preference Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Ntuziaka na-esote
Nwelite Mmasị Ratio ọdịghị mma
Ajụjụ a na-ajụkarị
What is Direct Preference Optimization?
Direct Preference Optimization (DPO) bụ ụzọ iji kwado ụdị asụsụ na mmasị mmadụ na-enyeghị ọzụzụ ụdị ụgwọ ọrụ dị iche iche ma ọ bụ na-agba ọsọ mmụta nkwado. Ọ na-akụda ọkpọkọ dị mgbagwoju anya n'ọtụtụ ọkwa n'ime otu mfu ọzụzụ siri ike.
Kedu ihe DPO na-ewepụ ma e jiri ya tụnyere RLHF omenala?
Isi uru DPO nwere bụ iwepụ ụdị ụgwọ ọrụ doro anya yana akara ngosi RL, na-ebuli amụma ahụ ozugbo na ụzọ abụọ mmasị kama.
Kedu data ka otu ihe atụ ọzụzụ DPO nwere?
DPO na-azụ na ụzọ abụọ mmasị: ngwa ngwa gbakwunyere otu ọkacha mmasị ('ahọpụtara') yana nzaghachi anabataghị ('ajụjụ ọnụ').
Kedu ọrụ nrụtụ aka na-arụ na DPO?
Akwụkwọ ntụaka oyi kpọnwụrụ (nke na-abụkarị ụdị SFT) na-egbochi ọnwụ ahụ; paramita beta na-achịkwa ebe amụma a zụrụ azụ nwere ike isi na ya pụọ.
Na DPO, kedu ebe a na-anọchi anya 'ụgwọ ọrụ'?
Mwepụta DPO na-egosi nkwụghachi ụgwọ ahụ dabara na nha nke puru omume log n'etiti amụma na ntụnye aka, yabụ enweghị ụdị ụgwọ ọrụ doro anya achọrọ.
Kedu ihe oke beta (okpomọkụ) dị na njikwa DPO?
Beta na-achịkwa mmachi KL doro anya: beta dị elu na-eme ka amụma ahụ dịrị nso na ntụaka ahụ, beta dị ala na-enye ohere karịa.