የቋንቋ AI መመሪያ

የዕድል መጠን ምርጫ ማመቻቸት

Odds Ratio Preference Optimization (ORPO) የቋንቋ ሞዴል መልካም ባህሪን እና የሰዎችን ምርጫ በአንድ የስልጠና ማለፊያ የሚያስተምር ጥሩ ማስተካከያ ዘዴ ነው።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

አስፈላጊ የሆነው የተለመደው የተለየ የሽልማት ሞዴል እና የማጣቀሻ ሞዴል በመዝለል አሰላለፍ ርካሽ እና ቀላል ያደርገዋል።

ጥልቅ ዳይቭ

በ2024 በሆንግ፣ ሊ እና ቶርን ያስተዋወቀው ORPO፣ ክትትል የሚደረግበት ጥሩ ማስተካከያ እና ምርጫን ወደ አንድ እርምጃ ያጣምራል። አብዛኛዎቹ የአሰላለፍ ቧንቧዎች በመጀመሪያ ጥሩ ምሳሌዎች ላይ SFT ያደርጋሉ፣ በመቀጠል እንደ RLHF ወይም DPO ያለ ሁለተኛ ዘዴ ያሂዱ ይህም የሞዴሉ የቀዘቀዘ ቅጂ (ማጣቀሻ) እና የተከማቸ ምርጫ ጥንዶች። ORPO የማመሳከሪያውን ሞዴል ሙሉ በሙሉ ያስወግዳል. የእሱ መጥፋት ወደ መደበኛው ቀጣይ ማስመሰያ ዓላማ የቅጣት ቃልን ይጨምራል፡ ውድቅ የተደረገውን ዕድሎች እያሽቆለቆለ ሞዴሉ ለተመረጠው (ተመራጭ) ምላሽ የሚሰጠውን ዕድሎች ከፍ ያደርገዋል። ምክንያቱም ከጠንካራ የምዝግብ ማስታወሻ-ይቻላል ክፍተት ይልቅ የዕድል ሬሾን ስለሚጠቀም ቅጣቱ የዋህ ነው፣ ስለዚህ ሞዴሉ ጥሩ መልስ መስጠትን ይማራል፣ ያለአንዳች ብልህ ትውልድ ሳይረሳ።

ቴክኒካዊ ግንዛቤ

የORPO ኪሳራ የ SFT ተሻጋሪ-ኢንትሮፒ ኪሳራ እና በተመረጡት እና ውድቅ በሆኑ ምላሾች መካከል ያለው የሎግ odds ጥምርታ ክብደት ያለው ሎግ-ሲግሞይድ ነው። ዕድሉ እኩል p/(1-p)፣ ስለዚህ ሬሾው ሞዴሉ ምን ያህል ጥሩ መልስ እንደሚያገኝ ከመጥፎው ጋር ያወዳድራል። ከጥሬ እድል ፈንታ ዕድሎችን መጠቀም ንፅፅሩ ለስላሳ ያደርገዋል፣ ይህም ያልተጠቀሰ ሞዴልን ሊያዋርዱ የሚችሉ ውድቅ ምልክቶችን ከመጠን በላይ ማፈንን ይከላከላል።

ስልታዊ ተጽእኖ

ፍጥነት እና ልኬት

የቋንቋ የስራ ፍሰቶች ወጥነትን ሳያጠፉ በፍጥነት ሊንቀሳቀሱ ይችላሉ።

መድረስ እና መድረስ

በቋንቋዎች እና በመግባቢያ ዘይቤዎች ተደራሽነትን ያሰፋዋል።

ግልጽ ውሳኔዎች

አውቶሜሽን ድግግሞሹን ሲቆጣጠር ቡድኖች በፍርድ ላይ ብዙ ጊዜ ሊያጠፉ ይችላሉ።

የዕድል ውድር ምርጫ ማመቻቸት የወደፊት ዕጣ

ORPO የማስታወስ ችሎታን ስለሚቀንስ እና የማመሳከሪያ ሞዴሉን በመጣል ማስላት እየጨመረ ነው ፣ይህም በተወሰኑ ሃርድዌር ላይ ለቡድኖች ጥሩ ማስተካከያ ነው። በክፍት ምንጭ የምግብ አዘገጃጀቶች እና እንደ ነባሪ አማራጭ እንደ Hugging Face TRL ባሉ ቤተ-መጻህፍት ውስጥ በብዛት እንዲታይ ይጠብቁ። የወደፊቱ ስራ የላምዳ ክብደትን በራስ-ሰር ያስተካክላል፣ ORPOን ከሌሎች ማጣቀሻ-ነጻ አላማዎች ጋር ያዋህዳል እና ወደ መልቲሞዳል እና በጣም ትልቅ ሞዴሎች ሁለት ቅጂዎችን በማህደረ ትውስታ መያዝ ብዙ ወጪ የሚጠይቅ ይሆናል።

የእውነተኛ-ዓለም አተገባበር

ሁለተኛ የማመሳከሪያ ቅጂ ሳይጭኑ የክፍት ምንጭ 7B ቻት ሞዴልን በምርጫ ጥንዶች ማስተካከል፣ የጂፒዩ ማህደረ ትውስታን በግማሽ በመቀነስ

ከSFT-ከዚያ-DPO ይልቅ በአንድ የሥልጠና ሩጫ የደንበኛ ድጋፍ ሰጪን በትህትና፣ በፖሊሲ ላይ ያሉ መልሶችን እንዲመርጥ የሚያስማማ ጅምር።

ተመራማሪዎች ከዝቅተኛ ስሌት ጋር ተመጣጣኝ አሰላለፍ ለማሳየት በተመሳሳይ የውሂብ ስብስብ ላይ ORPOን ከ DPO ጋር ሲያወዳድሩ

ጥሩ እና መጥፎ ጥንዶች ባሉበት ነገር ግን የሽልማት-ሞዴል ባጀት ወደሌለበት ልዩ ጎራ (ለምሳሌ ህጋዊ ማርቀቅ) መሰረታዊ ሞዴልን ማላመድ

አደጋዎች እና የጥበቃ መንገዶች

የተሳሳቱ እውነታዎች በጸጥታ ወደ ሪፖርቶች፣ የድጋፍ ፍሰቶች ወይም የምርምር ውጤቶችን ማስገባት ይችላሉ።

ፈጣን ትብነት በተመሳሳይ ጥያቄዎች ላይ የማይጣጣሙ ውጤቶችን ሊፈጥር ይችላል።

የመዳረሻ መቆጣጠሪያዎች ደካማ ከሆኑ ሚስጥራዊነት ያለው የጽሑፍ ውሂብ ሊጋለጥ ይችላል።

የትግበራ ፍኖተ ካርታ

1

ከመልቀቅዎ በፊት የውጤት ቅርጸትን፣ ድምጽን እና የጥራት ደረጃዎችን ይግለጹ።

2

ትክክለኛነት አስፈላጊ በሚሆንበት ጊዜ ሁሉ ከታመኑ ምንጮች ጋር ምላሾች።

3

ከፍተኛ ውጤት ለማግኘት የሰው የግምገማ ነጥብ አቆይ።

4

የውድቀት ንድፎችን ይከታተሉ እና ጥያቄዎችን ወይም የስራ ፍሰቶችን በመደበኛነት ያሠለጥኑ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Odds Ratio Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

ቀጣይ መመሪያ

ቀጥተኛ ምርጫ ማመቻቸት

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

Odds Ratio Preference Optimization ምንድን ነው?

Odds Ratio Preference Optimization (ORPO) የቋንቋ ሞዴል መልካም ባህሪን እና የሰዎችን ምርጫ በአንድ የስልጠና ማለፊያ የሚያስተምር ጥሩ ማስተካከያ ዘዴ ነው። አስፈላጊ የሆነው የተለመደው የተለየ የሽልማት ሞዴል እና የማጣቀሻ ሞዴል በመዝለል አሰላለፍ ርካሽ እና ቀላል ያደርገዋል።

እንደ DPO ካሉ ዘዴዎች ይልቅ የORPO ዋና ተግባራዊ ጠቀሜታ ምንድነው?

ORPO ምርጫን መማርን ወደ SFT ኪሳራ በማጠፍ እና የአምሳያው የቀዘቀዘ የማጣቀሻ ቅጂ አያስፈልገውም ፣ ማህደረ ትውስታን እና ስሌትን ይቆጥባል።

በORPO ውስጥ ያለው 'የዕድል ጥምርታ' ምን ያነጻጽራል?

ORPO የዕድሎችን ሬሾን ይጠቀማል (p/(1-p)) ሞዴሉ ለተመረጠው መልስ ከማይመረጥ ጋር ይመድባል።

ORPO በአንድ የሥልጠና ማለፊያ ውስጥ የትኞቹን ሁለት ተግባራትን ያከናውናል?

ORPO መደበኛውን የኤስኤፍቲ ቀጣይ ማስመሰያ ዓላማን በአንድ የተዋሃደ ኪሳራ ከምርጫ ቅጣት ጋር ያጣምራል።

ለምንድነው ORPO ለቅጣቱ ከጥሬ የምዝግብ ማስታወሻ-ይቻላል ልዩነት ይልቅ ዕድሎችን ይጠቀማል?

በአጋጣሚዎች ላይ የተመሰረተ ቅጣት ቀላል ነው፣ ይህም ያልተጠቀሰው ሞዴል ጥሩ መልሶችን እየመረጠ አቀላጥፎ እንዲቀጥል ይረዳል።

የ ORPO ኪሳራ በተሻለ ሁኔታ የሚገለፀው በየትኛው ጥምረት ነው?

ORPO ክትትል ከሚደረግበት የመስቀል-ኢንትሮፒ ኪሳራ በላይ ክብደት ያለው ሎግ-ሲግሞይድ odds-ratio ቃል ይጨምራል።