የቡድን አንጻራዊ ፖሊሲ ማመቻቸት
የቡድን አንጻራዊ ፖሊሲ ማበልጸጊያ (ጂአርፒኦ) የቋንቋ ሞዴሎችን ለማስተካከል የማጠናከሪያ-መማሪያ ዘዴ ሲሆን እያንዳንዱን መልስ በቡድን ወንድም እህት ለተመሳሳይ ጥያቄ መልስ ይሰጣል፣ ይህም PPO የሚጠቀምበትን የተለየ የእሴት አውታረ መረብ ያስወግዳል።
አጠቃላይ እይታ
ከ DeepSeek የማመዛዘን ሞዴሎች በስተጀርባ ያለው ዋና የሥልጠና ዘዴ ሆኖ ታዋቂ ሆነ።
ጥልቅ ዳይቭ
GRPO ትላልቅ የቋንቋ ሞዴሎችን RL ጥሩ ማስተካከያ ርካሽ እና የበለጠ የተረጋጋ ለማድረግ የተነደፈ የፖሊሲ-ግራዲየንት የማጠናከሪያ ትምህርት ልዩነት ነው። እያንዳንዱ ማስመሰያ ምን ያህል ጥሩ እንደሆነ ለመገመት መደበኛ PPO የተማረ 'ሃያሲ' (የእሴት ሞዴል) ይፈልጋል። GRPO ያንን ተቺ ሙሉ በሙሉ ያስወግዳል። ለእያንዳንዱ ጥያቄ የማጠናቀቂያ ቡድኖችን ናሙና (8-64 ይበሉ)፣ ሁሉንም በሽልማት ምልክት ያስመዘግባል፣ እና በመቀጠል ሽልማቱን ከቡድኑ አማካኝ እና መደበኛ መዛባት ጋር በማስተካከል የእያንዳንዱን ማጠናቀቂያ ጥቅም ያሰላል። ከአማካይ በላይ መልሶች የተጠናከሩ እና ከአማካይ በታች ያሉት የታፈኑ ናቸው። የKL-ልዩነት ቃል ሞዴሉን ከማጣቀሻ ፖሊሲ ጋር ያቆየዋል። በ DeepSeek አስተዋውቋል፣ DeepSeekMath እና DeepSeek-R1 የማመዛዘን ሞዴሎችን አንቀሳቅሷል።
ቴክኒካዊ ግንዛቤ
ዋናው ሃሳብ የ PPO የተማረውን እሴት መነሻ መስመር በሞንቴ ካርሎ የቡድን መነሻ መስመር መተካት ነው። ሽልማቶች r_i ላለባቸው የውጤቶች ቡድን እያንዳንዱ ጥቅም A_i = (r_i - አማካኝ(r)) / std (r) ነው። ያ መደበኛ ውጤት ልክ እንደ PPO እና የ KL ቅጣት የተቀነጨበውን የይሁንታ ሬሾን ያበዛል እና በቀዘቀዘ የማጣቀሻ ሞዴል ላይ የKL ቅጣት ተንሳፋፊን ይገድባል። አንድም ተቺ ስላልሰለጠነ፣ የማስታወስ ችሎታ እና በግምት በግማሽ ያህል ያሰላል፣ እና ፈጣን መደበኛነት በተፈጥሮ የተመጣጠነ ዝቅተኛ-ልዩነት ጥቅሞችን ይሰጣል።
ስልታዊ ተጽእኖ
ወጪ እና በጀት
የስነ-ህንፃ ውሳኔዎች ለዓመታት አፈጻጸምን እና የሥራ ማስኬጃ ወጪዎችን ያንቀሳቅሳሉ.
ግልጽ ውሳኔዎች
የቴክኒክ ትምህርት ቡድኖች አዲሱን ብቻ ሳይሆን ትክክለኛውን ቁልል እንዲመርጡ ይረዳል።
የጥራት ቁጥጥር
የተሻሉ የምህንድስና ምርጫዎች በምርት ውስጥ አስተማማኝነት ክስተቶችን ይቀንሳሉ.
የቡድን አንጻራዊ ፖሊሲ ማመቻቸት የወደፊት ዕጣ
GRPO ፈጣን የማመዛዘን ሞዴሎችን ለማሰልጠን ነባሪ የምግብ አዘገጃጀት መመሪያ ሆኗል፣ እና ቤተ-ሙከራዎች ደካማ ቦታዎች ላይ እየደጋገሙ ነው። ተመራማሪዎች የርዝመት እና የችግር አድልዎ (እንደ ዶ/ር ጂአርፒኦ ያሉ)፣ የማስመሰያ ደረጃ ከቅደም ተከተል ደረጃ መደበኛነት ይልቅ፣ እና የKL ቃልን በማስወገድ ወይም በመቅረጽ ላይ ናቸው። ሊረጋገጡ ከሚችሉ ሽልማቶች (ሂሳብ፣ ኮድ፣ የመሳሪያ አጠቃቀም)፣ በጥቃቅን ምልክቶች በተሻለ አያያዝ እና የቡድን መነሻ መስመሮችን ከቀላል ተቺዎች ጋር ለተወካዩ፣ ባለብዙ ደረጃ ስራዎች የሚያዋህዱ ውህደቶችን ይጠብቁ።
የእውነተኛ-ዓለም አተገባበር
በሂሳብ ችግሮች ላይ ህግን መሰረት ያደረጉ የትክክለኛ ሽልማቶችን በመጠቀም ረጅም የአስተሳሰብ ሰንሰለትን ለማምረት DeepSeek-R1 እና DeepSeekMath ማሰልጠን
ጥሩ ማስተካከያ ኮድ-ትውልድ ሞዴሎች እያንዳንዱ የናሙና መፍትሄ የዩኒት ፈተናዎችን በማለፉ የሚቆጠርበት እና ቡድኑ አሸናፊዎችን ለመምረጥ የተለመደ ነው።
የክፍት ምንጭ RLHF ቧንቧዎችን (ለምሳሌ በTRL እና verl ቤተ-መጽሐፍት ውስጥ) GRPOን በመጠቀም የውይይት ሞዴሎችን ለተለየ የእሴት አውታር ሳይከፍሉ ለማስማማት
በአንድ ጊዜ ብዙ ምላሾችን በማንሳት እና የሽልማት ሞዴል ዋጋ ያላቸውን ከእኩዮቻቸው አንፃር ከፍተኛ ዋጋ በመስጠት የትምህርት-መከተል ወይም የደህንነት ባህሪን ማሻሻል
አደጋዎች እና የጥበቃ መንገዶች
አንድ ቤንችማርክን ማሳደግ ሰፋ ያሉ የስርዓት ድክመቶችን ሊደብቅ ይችላል።
የመሠረተ ልማት እና የጥገና ወጪዎች ብዙ ጊዜ ዝቅተኛ ናቸው.
ስርዓቶች ይበልጥ ውስብስብ ሲሆኑ የደህንነት እና የታዛቢነት ክፍተቶች ሊያድጉ ይችላሉ።
የትግበራ ፍኖተ ካርታ
ከመተግበሩ በፊት የቆይታ፣ የጥራት እና የወጪ ግቦችን ይግለጹ።
ቤንችማርክ በእውነተኛ ጭነት እና የውሂብ ሁኔታዎች።
ለስህተቶች፣ ተንሸራታች እና የተጠቃሚ ተጽእኖ የመሳሪያ ክትትል።
ከመጠኑ በፊት የመመለሻ እና የአደጋ ምላሽ መንገዶችን ያዘጋጁ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Group Relative Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
የፕሮክሲማል ፖሊሲ ማመቻቸት
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
የቡድን አንጻራዊ ፖሊሲ ማመቻቸት ምንድን ነው?
የቡድን አንጻራዊ ፖሊሲ ማበልጸጊያ (ጂአርፒኦ) የቋንቋ ሞዴሎችን ለማስተካከል የማጠናከሪያ-መማሪያ ዘዴ ሲሆን እያንዳንዱን መልስ በቡድን ወንድም እህት ለተመሳሳይ ጥያቄ መልስ ይሰጣል፣ ይህም PPO የሚጠቀምበትን የተለየ የእሴት አውታረ መረብ ያስወግዳል። ከ DeepSeek የማመዛዘን ሞዴሎች በስተጀርባ እንደ ዋናው የስልጠና ዘዴ ዝነኛ ሆነ።
GRPO የትኛውን ዋና የ PPO አካል ያስወግዳል?
የ GRPO ፊርማ ለውጥ PPO የተማረውን እሴት/ተቺ ሞዴል እየጣለ ነው፣ ይህም በመደበኛነት ከፖሊሲው ጋር ተመሳሳይ መጠን ያለው፣ ከፍተኛ ማህደረ ትውስታን እና ስሌትን ይቆጥባል።
GRPO ለአንድ የተወሰነ ማጠናቀቂያ ያለውን ጥቅም እንዴት ያሰላል?
የእያንዳንዱ ማጠናቀቂያ ጥቅም (ሽልማት - የቡድን አማካኝ) / የቡድን መደበኛ ልዩነት ነው, ስለዚህ ለተመሳሳይ ጥያቄ መልሶች ቡድን እንደ መነሻ መስመር ይሠራል.
የትኞቹ ሞዴሎች GRPO በደንብ እንዲታወቅ አድርገዋል?
GRPO በ DeepSeek አስተዋወቀ እና ታዋቂ ሆኗል፣በተለይ በ DeepSeekMath እና ከ DeepSeek-R1 የማመዛዘን ሞዴሎች በስተጀርባ ያለው የ RL ሞተር።
የKL-divergence ቃል በ GRPO ውስጥ ምን ሚና ይጫወታል?
በማጣቀሻ (በተለምዶ ቅድመ-አርኤል) ሞዴል ላይ የKL ቅጣት ስልጠናውን መደበኛ ያደርገዋል ስለዚህ ፖሊሲው ሳይፈርስ ወይም ወደ መጥፎ ውጤቶች ሳይሸጋገር ይሻሻላል።
ለምንድነው GRPO በተለይ በሂሳብ ወይም በኮድ ላይ የማመዛዘን ሞዴሎችን ለማሰልጠን የሚስብ የሆነው?
ብዙ መፍትሄዎችን ናሙና ማድረግ እና እነሱን በራስ-ሰር ትክክለኛነት ማረጋገጥ ከ GRPO ቡድን-ከተለመዱ ጥቅሞች ጋር በንጽህና ይጣመራሉ፣ ምንም ተቺ አያስፈልግም።