ውድቅ የተደረገ ናሙና ጥሩ-ማስተካከል
Rejection Sampling Fine-Tuning (RFT) ብዙ የእጩ መልሶችን ያመነጫል፣ ጥሩ ውጤት ያስመዘገቡትን ብቻ ያስቀምጣል እና በእነዚያ አሸናፊዎች ላይ ሞዴሉን እንደገና ያሠለጥናል።
አጠቃላይ እይታ
It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.
ጥልቅ ዳይቭ
ውድቅ የተደረገ ናሙና ጥሩ ማስተካከያ፣ አንዳንድ ጊዜ ምርጥ-ኦቭ-ኤን ጥሩ ማስተካከያ ተብሎ የሚጠራው እንደ Meta's Llama 2 እና Llama 3 ያሉ ሞዴሎች እንዴት እንደተጣመሩ ቁልፍ ንጥረ ነገር ነው። የምግብ አዘገጃጀቱ ቀላል ነው፡ ለእያንዳንዱ ጥያቄ፣ አሁን ካለው ሞዴል ብዙ ምላሾችን (ከ4 እስከ 64 ይበሉ) ናሙና ያድርጉ፣ እያንዳንዱን በሽልማት ሞዴል ወይም አውቶማቲክ አረጋጋጭ ያስመዝግቡ እና ከዚያ ከፍተኛ ደረጃ ከተሰጣቸው በስተቀር ሁሉንም ያስወግዱ ('ውድቅ')። የተረፉት ከፍተኛ ጥራት ያላቸው ናሙናዎች አዲስ ክትትል የሚደረግባቸው ጥሩ ማስተካከያ የውሂብ ስብስብ ይሆናሉ፣ እና ሞዴሉ በተለመደው ቀጣይ ማስመሰያ ኪሳራ የሰለጠነ ነው። ይህንን ሉፕ ደጋግሞ መድገም ሞዴሉን በራሱ የተሻሉ መልሶችን ወደ ማመንጨት ያሳድገዋል። ሞዴሉ ከራሱ ከተጣሩ ውጤቶች ስለሚማር፣ RFT አሁንም የሽልማት ምልክት እየተጠቀመ የፖሊሲ-ግራዲየንት RL አለመረጋጋትን እና ራስ ምታትን ያስወግዳል።
ቴክኒካዊ ግንዛቤ
RFT ብዙ ጊዜ ናሙና ማድረግ እና ከፍተኛውን የሽልማት ምላሾችን በመጠበቅ ከተሳለ ከፍተኛ ጥራት ካለው ስርጭት ውስጥ ግምታዊ ግምቶችን በመያዝ ይጠቀምበታል። በነዚያ አሸናፊዎች ላይ በመደበኛ መስቀል-ኢንትሮፒ ማሰልጠን ያን ምርጥ የ N ባህሪን ወደ አምሳያው ነጠላ-ናሙና ውጤቶች እንዲመለስ ያደርጋል። እንደ ሂሳብ ወይም ኮድ ላሉ ሊረጋገጡ የሚችሉ ጎራዎች፣ 'ሽልማቱ' በቀላሉ የመጨረሻው መልስ ወይም የክፍል ፈተና ካለፈ ሊሆን ይችላል፣ ይህም የተማረ የሽልማት ሞዴል ፍላጎትን ሙሉ በሙሉ ያስወግዳል።
ስልታዊ ተጽእኖ
ፍጥነት እና ልኬት
የቋንቋ የስራ ፍሰቶች ወጥነትን ሳያጠፉ በፍጥነት ሊንቀሳቀሱ ይችላሉ።
መድረስ እና መድረስ
በቋንቋዎች እና በመግባቢያ ዘይቤዎች ተደራሽነትን ያሰፋዋል።
ግልጽ ውሳኔዎች
አውቶሜሽን ድግግሞሹን ሲቆጣጠር ቡድኖች በፍርድ ላይ ብዙ ጊዜ ሊያጠፉ ይችላሉ።
ውድቅ የተደረገ ናሙና ጥሩ-ማስተካከል የወደፊት
RFT ለዘመናዊ የድህረ-ስልጠና ማዕከላዊ ነው፣ ብዙ ጊዜ ከ RL ዘዴዎች በፊት ወይም ከ PPO እና DPO ጋር ጥቅም ላይ ይውላል። የእሱ ማራኪነት በርካሽ ግምት እና በጠንካራ አውቶማቲክ አረጋጋጮች ያድጋል፡ ሞዴሎች እራሳቸውን በማመንጨት እና በመፈተሽ የተሻሉ ሲሆኑ፣ ተደጋጋሚ ውድቅ የተደረገ ናሙና ሰው ሰራሽ-ውሂብ እና ራስን ማሻሻል ቀለበቶችን ይደግፋል። ሊረጋገጡ የሚችሉ የአስተሳሰብ ሰንሰለቶችን ከሚያመነጩ የማመዛዘን ሞዴሎች ጋር ጥብቅ ውህደት እና የሽልማት ጠለፋን እና የልዩነት ውድቀትን እንዴት ማስወገድ እንደሚቻል ላይ ቀጣይነት ያለው ጥናት በአንድ ሞዴል የራሱ ውጤቶች ላይ ደጋግሞ ሲለማመድ ይጠብቁ።
የእውነተኛ-ዓለም አተገባበር
የላማ አይነት ሞዴሎችን በአንድ ጊዜ ብዙ መልሶችን በማሳየት፣ ከፍተኛውን የሽልማት-ሞዴል ውጤቶች በመጠበቅ፣ ከዚያም SFT በእነዚያ ላይ ማመጣጠን
ብዙ መፍትሄዎችን በማፍለቅ እና ትክክለኛውን እና ሊረጋገጥ የሚችል መልስ ላይ የደረሱትን ብቻ በማቆየት የሂሳብ ፈታኙን ማሻሻል
የክፍል ፈተናዎችን ካለፉ ብቻ የሚቀመጡበት ኮድ ማመንጨት እና እንደ ስልጠና መረጃ ጥቅም ላይ ይውላል
ለቀጣዩ የሥልጠና ዙር የአንድ ሞዴል የራሱን ምርጥ በራስ የመነጩ ምላሾችን በማጣራት ሰው ሰራሽ የማስተማር መረጃ ስብስቦችን መገንባት።
አደጋዎች እና የጥበቃ መንገዶች
የተሳሳቱ እውነታዎች በጸጥታ ወደ ሪፖርቶች፣ የድጋፍ ፍሰቶች ወይም የምርምር ውጤቶችን ማስገባት ይችላሉ።
ፈጣን ትብነት በተመሳሳይ ጥያቄዎች ላይ የማይጣጣሙ ውጤቶችን ሊፈጥር ይችላል።
የመዳረሻ መቆጣጠሪያዎች ደካማ ከሆኑ ሚስጥራዊነት ያለው የጽሑፍ ውሂብ ሊጋለጥ ይችላል።
የትግበራ ፍኖተ ካርታ
ከመልቀቅዎ በፊት የውጤት ቅርጸትን፣ ድምጽን እና የጥራት ደረጃዎችን ይግለጹ።
ትክክለኛነት አስፈላጊ በሚሆንበት ጊዜ ሁሉ ከታመኑ ምንጮች ጋር ምላሾች።
ከፍተኛ ውጤት ለማግኘት የሰው የግምገማ ነጥብ አቆይ።
የውድቀት ንድፎችን ይከታተሉ እና ጥያቄዎችን ወይም የስራ ፍሰቶችን በመደበኛነት ያሠለጥኑ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rejection Sampling Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
QLoRA እና 4-bit Fine-Tuning
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
What is Rejection Sampling Fine-Tuning?
Rejection Sampling Fine-Tuning (RFT) ብዙ የእጩ መልሶችን ያመነጫል፣ ጥሩ ውጤት ያስመዘገቡትን ብቻ ያስቀምጣል እና በእነዚያ አሸናፊዎች ላይ ሞዴሉን እንደገና ያሠለጥናል። ውስብስብ የማጠናከሪያ ትምህርትን ሳይሆን ቀጥተኛ ክትትል የሚደረግበት ትምህርትን በመጠቀም አብዛኛው የRLHF ጥቅም ስለሚሰጥ አስፈላጊ ነው።
ውድቅ የተደረገ ናሙና ጥሩ ማስተካከያ ዋናው ሀሳብ ምንድን ነው?
አርኤፍቲ ብዙ ምላሾችን ያቀርባል፣ ከፍተኛ ውጤት ያስመዘገቡትን ያጣራል፣ እና ሞዴሉን በእነዚያ አሸናፊዎች ላይ ያስተካክላል።
እንደ ሂሳብ ወይም ኮድ ባሉ ሊረጋገጡ በሚችሉ ጎራዎች ውስጥ እንደ ሽልማቱ ምን ሊያገለግል ይችላል?
ሊፈተሹ ለሚችሉ ተግባራት፣ RFT የተማረ የሽልማት ሞዴልን በማስወገድ ትክክለኛ ትክክለኛነትን ወይም የማለፊያ ክፍል ፈተናዎችን መጠቀም ይችላል።
የትኛው ሞዴል ቤተሰብ በአሰላለፍ ወቅት ውድቅ የተደረገ ናሙናን ተጠቅሟል?
Meta የለማ 2 እና ላማ 3 ሞዴሎች የድህረ-ስልጠና አሰራር አካል የሆነውን ውድቅ የተደረገ ናሙና በመጠቀም ተገልጿል.
ለምንድነው ቡድኖች እንደ PPO ካሉ የፖሊሲ-ግራዲየንት RL ይልቅ RFTን የሚመርጡት?
RFT የማስተካከል ችግርን እና የፖሊሲ-ግራዲየንት ዘዴዎች አለመረጋጋትን ወደ ጎን በመተው በተጣሩ ናሙናዎች ላይ ከመደበኛ ቀጣይ ማስመሰያ ኪሳራ ጋር እንደገና ያሠለጥናል።
በከፍተኛ የሽልማት ናሙናዎች ላይ ማሰልጠን ምን ያደርጋል?
ከላይ ከተጣሩ ምላሾች በመማር ሞዴሉ ከፍተኛ ጥራት ያለው ባህሪን በአንድ ትውልድ ውስጥ ያስገባል.