መሰረታዊ መመሪያ

በ RLHF ውስጥ የቡድን ሽልማት መደበኛነት

የቡድን ሽልማቶች መደበኛነት የአንድን ሞዴል ሽልማቶች ለተመሳሳይ ምላሽ በተሰጡ ምላሾች ውስጥ ደረጃውን የጠበቀ ሲሆን ጫጫታ ውጤቶችን ወደ የተረጋጋ የሥልጠና ምልክት ይለውጣል።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.

ጥልቅ ዳይቭ

በሰዎች ግብረመልስ (RLHF) ማጠናከሪያ ትምህርት ውስጥ አንድ ሞዴል ምላሾችን ያመነጫል እና የሽልማት ሞዴል ያስቆጥራቸዋል፣ ነገር ግን ጥሬ ሽልማቶች ጫጫታ ናቸው እና በጥያቄዎች ሁሉ ይለያያሉ። የቡድን ሽልማቶች መደበኛነት ይህንን ያስተካክላል ለተመሳሳይ ጥያቄ በርካታ ምላሾችን በቡድን በማንሳት እና በመቀጠል እያንዳንዱን ሽልማት የቡድኑን አማካይ በመቀነስ እና በቡድኑ መደበኛ መዛባት በመከፋፈል። ይህ z-score ጥቅሙ ይሆናል። አቀራረቡ በ DeepSeek አስተዋወቀው የቡድን አንጻራዊ ፖሊሲ ማሻሻያ (GRPO) ማእከል ነው፣ እሱም የ DeepSeek-R1ን ምክንያት በታዋቂነት ያጎለብታል። በወሳኝ ሁኔታ፣ የቡድን አማካኝ እንደ መነሻ ሆኖ ስለሚያገለግል፣ GRPO በPPO የሚጠቀምበትን የተለየ የእሴት አውታር (ሃያሲ) ያስወግዳል። ይህ የግራዲየንት ምልክቱን በሚገባ ሚዛን ጠብቆ በማቆየት ስልጠናን ቀላል፣ ርካሽ እና የበለጠ የማስታወስ ችሎታ ያለው ያደርገዋል።

ቴክኒካዊ ግንዛቤ

ለሽልማት r_1...r_G ቡድን ጥቅሙ A_i = (r_i - አማካኝ(r)) / std(r) ነው። ከቡድናቸው አማካይ የተሻሉ ምላሾች አዎንታዊ ጥቅም ያገኛሉ እና ይጠናከራሉ; ከአማካይ የባሰ ወደ ታች ይገፋሉ። ንጽጽር በአፋጣኝ አንጻራዊ ስለሆነ፣ ፍፁም የሽልማት ልኬት እና ወዲያውኑ ችግር መሰረዝ፣ ልዩነትን ይቀንሳል። GRPO አምሳያው በጣም ርቆ እንዳይሄድ ለመከላከል የ PPOን የተቀነጨበ ዓላማ እና የKL ቅጣትን ከማጣቀሻ ፖሊሲ ጋር ያቆያል።

ስልታዊ ተጽእኖ

ግልጽ ውሳኔዎች

ግልጽ ቴክኒካዊ የይገባኛል ጥያቄዎችን ከገበያ ቋንቋ እንዲለዩ ያግዝዎታል።

ወጪ እና በጀት

ገንዘብን ወይም ጊዜን ከማጥፋትዎ በፊት የተሻሉ የትግበራ ጥያቄዎችን መጠየቅ ይችላሉ።

ቡድን እና የስራ ፍሰት

የጋራ ግንዛቤ ያላቸው ቡድኖች የተሻለ ምርት፣ ፖሊሲ እና የመማር ውሳኔዎችን ያደርጋሉ።

በRLHF ውስጥ የቡድን ሽልማቶች መደበኛነት የወደፊት ዕጣ

በቡድን የተደራጁ ኖርማልላይዜሽን የማመዛዘን-ሞዴል እድገትን እያቀጣጠለ ነው፣ ሞዴሎች ያለተማረ ሃያሲ ልክ እንደ ትክክለኛ የሂሳብ መልሶች ካሉ ከሚረጋገጡ ሽልማቶች የሚማሩበት። ምርምር እያጣራው ነው፡ በፈረንጅ ዲቪኤሽን ለመከፋፈል፣ ዜሮ ጥቅም የሚፈጥሩ ሁሉንም ትክክል ወይም የተሳሳቱ ቡድኖችን ማስተናገድ እና የቡድን መጠንን ማመጣጠን ላይ ክርክሮች። አውቶማቲክ አረጋጋጮች ርካሽ እና ብዙ የሽልማት ምልክቶችን ወደሚያቀርቡበት የተቧደኑ፣ ከትችት ነጻ የሆኑ ዘዴዎችን ወደ ወኪል መሣሪያ አጠቃቀም እና ኮድ ማመንጨትን ይጠብቁ።

የእውነተኛ-ዓለም አተገባበር

በአንድ ችግር 16 መፍትሄዎችን በማንሳት እና ከቡድኑ አማካኝ ትክክለኛነት በላይ የሆኑትን በመሸለም የሂሳብ ማመዛዘን ሞዴልን ማሰልጠን።

ለእያንዳንዱ ተጠቃሚ ጥያቄ በብዙ እጩ ምላሾች ላይ የሽልማት-ሞዴል ውጤቶችን መደበኛ በማድረግ የቻትቦትን እገዛ በጥሩ ሁኔታ ማስተካከል።

እያንዳንዱ የናሙና መፍትሄ የሚመዘገብበት የኮዲንግ ረዳትን ማሻሻል የዩኒት ፈተናዎችን በማለፉ እና ከዚያም በቡድኑ ውስጥ መደበኛ ነው።

በ RLHF ቧንቧ ውስጥ የጂፒዩ ማህደረ ትውስታን መቀነስ የ PPO ሃያሲ ኔትወርኩን በመጣል እና ቡድኑን በመጠቀም በምትኩ እንደ መነሻ መስመር ማለት ነው።

አደጋዎች እና የጥበቃ መንገዶች

የተለያዩ ቡድኖች ተመሳሳይ ቃል በተለያየ መንገድ ሊጠቀሙ ይችላሉ፣ ስለዚህ ወሰንን ቀደም ብለው ይግለጹ።

የገሃዱ ዓለም አፈጻጸም ያልተስተካከለ ሆኖ ሳለ ማመሳከሪያዎች ጠንካራ ሊመስሉ ይችላሉ።

የውሂብ ጥራት እና የግምገማ እቅዶችን ችላ ማለት ብዙውን ጊዜ ደካማ ውጤቶችን ይፈጥራል.

የትግበራ ፍኖተ ካርታ

1

የሚፈልጉትን ውጤት በግልፅ ቋንቋ ትርጉም ይጀምሩ።

2

ከመሞከርዎ በፊት አንድ የስኬት መለኪያ እና አንድ የውድቀት ሁኔታ ይምረጡ።

3

አንድ ትንሽ አብራሪ በተወካይ ውሂብ ያሂዱ እንጂ የተጣራ ማሳያ ስብስብ አይደለም።

4

በ RLHF ውስጥ የቡድን ሽልማቶች መደበኛነት የሚረዳበት እና ቀላል ዘዴዎች የተሻሉበት ሰነድ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped Reward Normalization in RLHF quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

ቀጣይ መመሪያ

በምርጫ ማመቻቸት ውስጥ የርዝማኔ መደበኛነት

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

What is Grouped Reward Normalization in RLHF?

የቡድን ሽልማቶች መደበኛነት የአንድን ሞዴል ሽልማቶች ለተመሳሳይ ምላሽ በተሰጡ ምላሾች ውስጥ ደረጃውን የጠበቀ ሲሆን ጫጫታ ውጤቶችን ወደ የተረጋጋ የሥልጠና ምልክት ይለውጣል። ብዙ ዘመናዊ የማመዛዘን ሞዴሎችን የሚያበረታታ ከ GRPO በስተጀርባ ያለው ዋና ዘዴ ነው።

በቡድን የሽልማት መደበኛነት፣ የእያንዳንዱ ምላሽ ሽልማት ከምን ጋር ሲነጻጸር ነው?

እያንዳንዱ ሽልማት ለተመሳሳይ ምላሽ የቡድኑን አማካኝ እና መደበኛ ልዩነት በመጠቀም ወደ z-score ይቀየራል።

የትኛው ስልተ ቀመር ከቡድን ሽልማቶች መደበኛነት ጋር በጣም የተያያዘ ነው?

GRPO፣ በ DeepSeek የተዋወቀው እና በ DeepSeek-R1 ውስጥ ጥቅም ላይ የዋለ፣ በቡድን ውስጥ ሽልማቶችን በማስተካከል ላይ የተገነባ ነው።

GRPO የትኛውን የመደበኛ PPO አካል በተለይ ያስወግዳል?

የቡድን አማካዩን እንደ መነሻ መስመር በመጠቀም፣ GRPO የተማረውን ተቺ ይጥላል፣ ማህደረ ትውስታን ይቆጥባል እና ያሰላል።

ሽልማቱ ከቡድኑ አማካይ በታች የሆነ ምላሽ ምን ይሆናል?

የቡድኑን አማካኝ መቀነስ ከአማካይ በታች ምላሾች አሉታዊ ጠቀሜታ እንዲኖራቸው ያደርጋል፣ ፖሊሲውን ከነሱ ያርቃል።

በቡድን ውስጥ መደበኛ መሆን የሥልጠና ልዩነትን ለምን ይቀንሳል?

ንጽጽር በእያንዳንዱ ፍጥነት አንጻራዊ ስለሆነ፣ የፍፁም ሚዛን ልዩነቶች እና ፈጣን ችግር መታጠብ።