መሰረታዊ መመሪያ

ብራድሌይ-ቴሪ ሽልማት ሞዴሊንግ

የብራድሌይ-ቴሪ ሞዴል ጥንድ ጥምር ንጽጽሮችን (A ቢቶች ለ) ወደ ቁጥራዊ ውጤቶች ለመቀየር የመቶ ዓመት ዕድሜ ያለው የስታቲስቲክስ ዘዴ ነው።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

In modern AI it powers reward models that learn human preferences from 'which answer is better?' labels, the backbone of RLHF.

ጥልቅ ዳይቭ

እ.ኤ.አ. በ 1952 አስተዋወቀው ብራድሌይ-ቴሪ ፣ እያንዳንዱ ንጥል ነገር የተደበቀ የጥንካሬ ነጥብ እንዳለው ይገምታል ፣ እና ንጥል ሀ ንጥልን ቢ የመታ እድሉ የነጥባቸው ልዩነታቸው የሎጂስቲክስ ተግባር ነው። በ AI አሰላለፍ፣ ይህ ካርታዎች በምርጫ ውሂብ ላይ በጥሩ ሁኔታ ይያዛሉ፡ የሰው መለያ ሰሪዎች ሁለት የሞዴል ምላሾችን አይተው የተሻለውን ይምረጡ፣ ለመለካት አስቸጋሪ የሆኑ ፍፁም ደረጃዎችን ከመስጠት ይልቅ። የሽልማት ሞዴል፣ አብዛኛው የቋንቋ ሞዴል scalar የውጤት ጭንቅላት ያለው፣ የሰለጠነው የሰው ልጅ የሚመርጠው ምላሽ ከፍተኛ የሆነ ሽልማት እንዲያገኝ ነው። ኪሳራው የብራድሌይ-ቴሪ ዕድል አሉታዊ የምዝግብ ማስታወሻ ዕድል ነው፡ ሎግ-ሲግሞይድን ከፍ ያድርጉት (የተመረጠው የተቀነሰ ሽልማት)። የተገኘው የሽልማት ሞዴል የዘፈቀደ ውጤቶችን ያስመዘግባል፣ ይህም እንደ PPO ያሉ የመማር ስልተ ቀመሮችን የሚያጠናክሩትን ሞዴሎች የበለጠ አጋዥ እና የተጣጣሙ እንዲሆኑ ለማድረግ ምልክት ይሰጣል።

ቴክኒካዊ ግንዛቤ

ለማነፃፀር የሥልጠና ኪሳራ በቀላሉ ሎግ-ሲግሞይድ (r_chosen -r_rejected) ነው፣ ስለዚህ ሞዴሉ የሚማረው አንጻራዊ ልዩነቶችን ብቻ ነው። ይህ ማለት ሽልማቶች የሚታወቁት እስከ ተጨማሪ ቋሚ ድረስ ብቻ ነው; ፍፁም መለኪያው የዘፈቀደ ነው። ንጽጽር ለሰዎች ከ1-10 ነጥብ የበለጠ ቀላል እና የበለጠ ወጥነት ያለው ስለሆነ የብራድሌይ-ቴሪ መረጃ ብዙም ጫጫታ የለውም። ቀጥተኛ ምርጫ ማመቻቸት በኋላ የተለየውን የሽልማት ሞዴል መዝለል እንደሚችሉ እና የብራድሌይ-ቴሪን አላማ በቀጥታ በፖሊሲው ላይ ማሳደግ እንደሚችሉ አሳይቷል።

ስልታዊ ተጽእኖ

ግልጽ ውሳኔዎች

ግልጽ ቴክኒካዊ የይገባኛል ጥያቄዎችን ከገበያ ቋንቋ እንዲለዩ ያግዝዎታል።

ወጪ እና በጀት

ገንዘብን ወይም ጊዜን ከማጥፋትዎ በፊት የተሻሉ የትግበራ ጥያቄዎችን መጠየቅ ይችላሉ።

ቡድን እና የስራ ፍሰት

የጋራ ግንዛቤ ያላቸው ቡድኖች የተሻለ ምርት፣ ፖሊሲ እና የመማር ውሳኔዎችን ያደርጋሉ።

የብራድሌይ-ቴሪ ሽልማት ሞዴሊንግ የወደፊት ዕጣ

ብራድሌይ-ቴሪ አንድ ወጥ የሆነ የደረጃ አሰጣጥ እና የመሸጋገሪያ ምርጫዎችን ይወስዳል፣ ይህም ሰዎች አለመስማማት ሲጀምሩ ወይም ምርጫዎች ሲዞሩ ይፈርሳሉ። ምርምር የምርጫ ስርጭቶችን፣ ባለብዙ-ልኬት ሽልማቶችን (ረዳትነት፣ ደህንነት፣ ታማኝነት በተናጥል የተመዘገቡ) እና እንደ ናሽ ከሰዎች ግብረ መልስ ወደ ነጠላ-ነጥብ ግምት ወደሚያስቀምጡ ወደሚያዙ ሞዴሎች እየተንቀሳቀሰ ነው። DPO እና ተለዋዋጮቹ የብራድሌይ-ቴሪን አላማ በቀጥታ ወደ ፖሊሲ ስልጠና በማጣጠፍ። የሽልማት ጠለፋን ለመቀነስ ከሁለት በላይ እቃዎች ደረጃዎችን እና በራስ የመተማመን ምርጫዎችን ጨምሮ የበለጸጉ የንፅፅር እቅዶችን ይጠብቁ።

የእውነተኛ-ዓለም አተገባበር

በ RLHF ውስጥ የሽልማት ሞዴልን ማሰልጠን ሁለት የቻትቦት ምላሾችን ደረጃ የያዘ እና የተሻለውን የከፋውን የ PPO ጥሩ ማስተካከያ ምልክት ይመገባል።

የብራድሌይ-ቴሪ ሎግ-ሲግሞይድ መጥፋትን በመጠቀም በተመረጡ-የተቃወሙ መልስ ጥንዶች ላይ በቀጥታ ሞዴልን በጥሩ ሁኔታ ማስተካከል።

በኤሎ በኩል የቼዝ ደረጃ መስጠት ወይም ተጫዋቾችን መላክ በሂሳብ የብራድሌይ-ቴሪ ሞዴል የቅርብ ዘመድ በሆነው በጨዋታ ውጤቶች ላይ።

ከፍፁም የኮከብ ደረጃ አሰጣጦች ይልቅ 'ከተጠቃሚዎች ከ A በላይ B' ጠቅታ ዳታ የይዘት ምክር ደረጃ ሰሪ መገንባት።

አደጋዎች እና የጥበቃ መንገዶች

የተለያዩ ቡድኖች ተመሳሳይ ቃል በተለያየ መንገድ ሊጠቀሙ ይችላሉ፣ ስለዚህ ወሰንን ቀደም ብለው ይግለጹ።

የገሃዱ ዓለም አፈጻጸም ያልተስተካከለ ሆኖ ሳለ ማመሳከሪያዎች ጠንካራ ሊመስሉ ይችላሉ።

የውሂብ ጥራት እና የግምገማ እቅዶችን ችላ ማለት ብዙውን ጊዜ ደካማ ውጤቶችን ይፈጥራል.

የትግበራ ፍኖተ ካርታ

1

የሚፈልጉትን ውጤት በግልፅ ቋንቋ ትርጉም ይጀምሩ።

2

ከመሞከርዎ በፊት አንድ የስኬት መለኪያ እና አንድ የውድቀት ሁኔታ ይምረጡ።

3

አንድ ትንሽ አብራሪ በተወካይ ውሂብ ያሂዱ እንጂ የተጣራ ማሳያ ስብስብ አይደለም።

4

የ Bradley-Terry ሽልማት ሞዴሊንግ የሚረዳበት እና ቀላል ዘዴዎች የተሻሉበት ሰነድ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Bradley-Terry Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

What is Bradley-Terry Reward Modeling?

የብራድሌይ-ቴሪ ሞዴል ጥንድ ጥምር ንጽጽሮችን (A ቢቶች ለ) ወደ ቁጥራዊ ውጤቶች ለመቀየር የመቶ ዓመት ዕድሜ ያለው የስታቲስቲክስ ዘዴ ነው። በዘመናዊው AI የሰዎችን ምርጫ 'ከየትኛው መልስ ይሻላል?' የሚማሩ የሽልማት ሞዴሎችን ያበረታታል። መለያዎች፣ የ RLHF የጀርባ አጥንት።

የ Bradley-Terry ሞዴል ወደ የቁጥር ውጤቶች የሚለወጠው ምንድን ነው?

ብራድሌይ-ቴሪ በጥንድ መንገድ 'A ቢትስ ቢ' ንፅፅሮችን ይወስዳል እና ለእያንዳንዱ እቃ የተደበቀ የጥንካሬ ነጥብን ይገልፃል፣ለዚህም ነው የሰዎችን ምርጫ መለያ ስያሜ በሚገባ የሚስማማው።

በብራድሌይ-ቴሪ ሀ የመታ ቢን የመምታት እድሉ የምን ተግባር ነው?

አምሳያው P (A ቢትስ ለ) ከሎጂስቲክስ (ሲግሞይድ) ጋር እኩል ያዘጋጃል በ A እና B መካከል የተደበቁ የጥንካሬ ውጤቶች።

ለምንድነው የብራድሌይ-ቴሪ ሽልማቶች እስከ ተጨማሪ ቋሚ ብቻ የሚታወቁት?

የሥልጠና ኪሳራው በተመረጡት እና ውድቅ በሆኑ ሽልማቶች መካከል ያለውን ልዩነት ብቻ ይጠቀማል ፣ ስለሆነም ሁሉንም ውጤቶች በተመሳሳይ ቋሚ መለወጥ ኪሳራውን ሳይለወጥ ይቀራል። ፍፁም መለኪያው የዘፈቀደ ነው።

በሽልማት ሞዴሊንግ ውስጥ የአንድ ምርጫ ንጽጽር መደበኛ ኪሳራ ምንድነው?

የብራድሌይ-ቴሪ አሉታዊ ሎግ-ዕድል ከተመረጠው ተቀንሶ ውድቅ የተደረገ የሽልማት ልዩነት ወደ ሎግ-ሲግሞይድ ይቀንሳል፣ ይህም የተመረጠውን ምላሽ ሽልማት ከፍ ያደርገዋል።

የ Bradley-Terry ዓላማን በቀጥታ በፖሊሲው ላይ በማሻሻል የተለየ የሽልማት ሞዴል የሚዘልለው የትኛው ዘዴ ነው?

DPO የብሬድሌይ-ቴሪ ምርጫ አላማን በማስተካከል በቀጥታ በፖሊሲው ሞዴል ላይ እንዲተገበር በማድረግ ራሱን የቻለ የሽልማት ሞዴል የማሰልጠን እና የመጠየቅ አስፈላጊነትን ያስወግዳል።