ቀጥተኛ ምርጫ ማመቻቸት
ቀጥተኛ ምርጫ ማሻሻያ (DPO) የተለየ የሽልማት ሞዴል ሳያሰለጥኑ ወይም የማጠናከሪያ ትምህርትን ሳያካሂዱ የቋንቋ ሞዴሎችን ከሰዎች ምርጫዎች ጋር የማጣጣም መንገድ ነው።
አጠቃላይ እይታ
It collapses a complex multi-stage pipeline into a single, stable training loss.
ጥልቅ ዳይቭ
በ2023 በራፋይሎቭ እና ባልደረቦቹ በስታንፎርድ ያስተዋወቀው DPO፣ ሰዎች የሚመርጡትን ሞዴል እንዴት እንደምናስተምር በድጋሚ ያስባል። ባህላዊው አካሄድ (RLHF) በሰዎች ንፅፅር ላይ የሽልማት ሞዴልን ያሠለጥናል፣ ከዚያም ሽልማቱን ከፍ ለማድረግ የማጠናከሪያ ትምህርት ይጠቀማል። የDPO ቁልፍ ግንዛቤ ሒሳባዊ ነው፡ በዚያ RLHF አላማ ስር ያለው ጥሩው ፖሊሲ ከሽልማቱ ጋር የተዘጋ ግንኙነት አለው፣ ስለዚህ እኩልታዎችን እንደገና ማስተካከል እና የቋንቋ ሞዴሉን በምርጫ ጥንዶች ላይ በቀጥታ ማሻሻል ይችላሉ። መጠየቂያ፣ 'የተመረጠ' (የተመረጠ) ምላሽ እና 'የተወገደው' ምላሽ ትሰጣለህ፣ እና ቀላል የምደባ አይነት ኪሳራ የተመረጠውን መልስ በአንፃራዊነት የበለጠ እድል እንዲኖረው ለማድረግ ሞዴሉን ይንቀጠቀጣል። ምንም የሽልማት ሞዴል የለም፣ ምንም የናሙና ምልልስ የለም፣ ምንም የሽልማት መጥለፍ የለም። ለመሮጥ በጣም ቀላል እና የበለጠ የተረጋጋ ነው።
ቴክኒካዊ ግንዛቤ
DPO በምርጫ ጥንዶች ላይ ባለ ሁለትዮሽ-ኢንትሮፒ ኪሳራ ይጠቀማል። ከተከለከለው አንጻር የተመረጠው ምላሽ የምዝግብ ማስታወሻ-ይሁንታ ሬሾን ይጨምራል፣ እያንዳንዱ የሚለካው በቀዘቀዘ የማጣቀሻ ሞዴል (ብዙውን ጊዜ ቁጥጥር የሚደረግበት-በተስተካከለ የመነሻ ነጥብ) ነው። የሙቀት መለኪያ ቤታ ፖሊሲው ከዚያ ማጣቀሻ ምን ያህል ርቀት እንደሚርቅ ይቆጣጠራል፣ RLHF በግልፅ የሚመለከተውን የKL ገደብ በተዘዋዋሪ ያስፈጽማል። ሽልማቱ ፈጽሞ አይፈጸምም; በፖሊሲው ውስጥ የራሱ የሆነ የምዝግብ ማስታወሻ-ይሆናል.
ስልታዊ ተጽእኖ
ፍጥነት እና ልኬት
የቋንቋ የስራ ፍሰቶች ወጥነትን ሳያጠፉ በፍጥነት ሊንቀሳቀሱ ይችላሉ።
መድረስ እና መድረስ
በቋንቋዎች እና በመግባቢያ ዘይቤዎች ተደራሽነትን ያሰፋዋል።
ግልጽ ውሳኔዎች
አውቶሜሽን ድግግሞሹን ሲቆጣጠር ቡድኖች በፍርድ ላይ ብዙ ጊዜ ሊያጠፉ ይችላሉ።
የቀጥታ ምርጫ ማመቻቸት የወደፊት
ዲፒኦ ዋጋው ርካሽ እና ሊባዛ የሚችል ስለሆነ ነባሪ አሰላለፍ ዘዴ ሆኗል፣እና የተለያዩ ቤተሰብን ፈጥሯል፡ IPO በቅርበት በሚወስኑ ምርጫዎች ላይ ከመጠን በላይ መገጣጠምን ያስተካክላል፣ KTO በጥንድ ምትክ ከነጠላ ጥሩ ወይም መጥፎ መለያዎች ይማራል፣ እና ORPO ምርጫን በማጣመም መማርን ያለምንም ማመሳከሪያ ሞዴል ማስተካከል ይችላል። የቀጠለውን DPO ከፖሊሲ መረጃ እና ከርዝመት/ጥራት ማጉደል ጋር በማጣመር ቀሪውን ክፍተት ከሙሉ የመስመር ላይ RLHF ጋር በማጥበብ ቀጣይ ስራ ይጠብቁ።
የእውነተኛ-ዓለም አተገባበር
በምርጫ ዳታ ስብስቦች ላይ ከDPO ጋር የተጣጣሙ እንደ Zephyr እና ብዙ የላማ እና ሚስትራል ተዋጽኦዎች ያሉ ጥሩ ማስተካከያ ያላቸው ክፍት የክብደት ቻት ሞዴሎች
ጥንዶችን በመጠቀም ጎጂ ወይም ጠቃሚ ያልሆኑ ውጤቶችን በመቀነስ፣ አጋዥ የሆነ መልስ ከችግር ይልቅ 'የተመረጠ'
በገንቢ ደረጃ የተሰጣቸውን ንጽጽሮችን በመጠቀም የኮድ ረዳት ትክክለኛ እና በደንብ የተመዘገቡ መፍትሄዎችን ከስህተት ይልቅ እንዲመርጥ ማስተማር
የማጠቃለያ ዘይቤን ማስተካከል ስለዚህ ሞዴሎች በቃላት ወይም በቅዠት ላይ አጭር፣ ታማኝ ማጠቃለያዎችን ይመርጣሉ።
አደጋዎች እና የጥበቃ መንገዶች
የተሳሳቱ እውነታዎች በጸጥታ ወደ ሪፖርቶች፣ የድጋፍ ፍሰቶች ወይም የምርምር ውጤቶችን ማስገባት ይችላሉ።
ፈጣን ትብነት በተመሳሳይ ጥያቄዎች ላይ የማይጣጣሙ ውጤቶችን ሊፈጥር ይችላል።
የመዳረሻ መቆጣጠሪያዎች ደካማ ከሆኑ ሚስጥራዊነት ያለው የጽሑፍ ውሂብ ሊጋለጥ ይችላል።
የትግበራ ፍኖተ ካርታ
ከመልቀቅዎ በፊት የውጤት ቅርጸትን፣ ድምጽን እና የጥራት ደረጃዎችን ይግለጹ።
ትክክለኛነት አስፈላጊ በሚሆንበት ጊዜ ሁሉ ከታመኑ ምንጮች ጋር ምላሾች።
ከፍተኛ ውጤት ለማግኘት የሰው የግምገማ ነጥብ አቆይ።
የውድቀት ንድፎችን ይከታተሉ እና ጥያቄዎችን ወይም የስራ ፍሰቶችን በመደበኛነት ያሠለጥኑ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Direct Preference Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
የዕድል መጠን ምርጫ ማመቻቸት
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
What is Direct Preference Optimization?
ቀጥተኛ ምርጫ ማሻሻያ (DPO) የተለየ የሽልማት ሞዴል ሳያሰለጥኑ ወይም የማጠናከሪያ ትምህርትን ሳያካሂዱ የቋንቋ ሞዴሎችን ከሰዎች ምርጫዎች ጋር የማጣጣም መንገድ ነው። ውስብስብ ባለ ብዙ ደረጃ የቧንቧ መስመር ወደ አንድ ነጠላ የተረጋጋ የሥልጠና ኪሳራ ይወድቃል።
DPO ከባህላዊ RLHF ጋር ሲወዳደር ምን ያስወግዳል?
የDPO ዋና ጥቅማጥቅም ግልጽ የሆነ የሽልማት ሞዴል እና የ RL ናሙና ምልልስን ማስወገድ ነው፣ በምትኩ ፖሊሲውን በቀጥታ በምርጫ ጥንዶች ላይ ማመቻቸት ነው።
አንድ የDPO ስልጠና ምሳሌ ምን መረጃን ያካትታል?
DPO በምርጫ ጥንዶች ያሠለጥናል፡ ፈጣን እና አንድ ተመራጭ ('የተመረጠ') እና አንድ ያልተወደደ ('ተቀባይ') ምላሽ።
የማጣቀሻ ሞዴል በ DPO ውስጥ ምን ሚና ይጫወታል?
የቀዘቀዘ ማመሳከሪያ (በተለምዶ የ SFT ሞዴል) ኪሳራውን ያስተካክላል; የቅድመ-ይሁንታ መለኪያው የሰለጠነ ፖሊሲ ከሱ ምን ያህል መራቅ እንደሚችል ይቆጣጠራል።
በDPO ውስጥ 'ሽልማቱ' የት ነው የሚወከለው?
የDPO አመጣጥ የሚያሳየው ሽልማቱ በፖሊሲ እና በማጣቀሻ መካከል ባለው የምዝግብ ማስታወሻ-ይቻላል ጥምርታ ውስጥ ነው፣ ስለዚህ ግልጽ የሆነ የሽልማት ሞዴል አያስፈልግም።
በDPO ውስጥ ያለው የቅድመ-ይሁንታ (የሙቀት) መለኪያ ምን ይቆጣጠራል?
ቤታ ስውር የKL ገደቦችን ይቆጣጠራል፡ ከፍ ያለ የቅድመ-ይሁንታ መመሪያ ፖሊሲውን ወደ ዋቢው ያቀራርበዋል፣ የታችኛው ቤታ ተጨማሪ ልዩነትን ይፈቅዳል።