ወደ ዜና ተመለስ
ፈጠራAI Understanding አጭር መግለጫ

አርክቴክቸርን የሚያውቅ ክሬዲት ምደባ ለቋንቋ ሞዴሎች የማጠናከሪያ ትምህርትን ያሻሽላል

የarXiv ቅድመ-ህትመት CompPOን ያስተዋውቃል፣ የቋንቋ ሞዴል የራሱ ትኩረት ቅጦችን በመጠቀም የስልጠና ክሬዲትን በቶከኖች ላይ ይመድባል። ደራሲዎቹ በQwen3-4B እና በLlama-3.1-8B-Instruct ላይ በተደረጉ ሙከራዎች ከተስተካከለው GRPO የበለጠ ትክክለኛነትን እና የበለጠ መረጋጋትን ሪፖርት አድርገዋል።

6 min readRead the primary source
Source-page capture accompanying Architecture-aware credit assignment improves reinforcement learning for language models
ዋና-ምንጭ ሰነድምንጭ ተመዝግቧል
አታሚ
arxiv.org
ምንጭ አገናኝ
arxiv.orghttps://arxiv.org/abs/2608.21501
የምንጭ ዓይነት
ዋና ሰነድ - ኦፊሴላዊ ማስታወቂያ ፣ ወረቀት ፣ ፋይል ወይም የመጀመሪያ ወገን ገጽ በቀጥታ እናነባለን።
አውድይህንን በ60 ሰከንድ ውስጥ ይረዱት።

እዚ ጀምር

ቁልፍ ቃላት

የማጠናከሪያ ትምህርት
ወኪሉ የረጅም ጊዜ መመለሻን ከፍ የሚያደርጉ ድርጊቶችን የሚማርበት የሽልማት ምልክቶችን ማሰልጠን።
ትልቅ የቋንቋ ሞዴል (LLM)
ጽሑፍን ለማፍለቅ እና ለመተንተን በትልቅ ጽሑፍ ኮርፖራ ላይ የሰለጠነ የቋንቋ ሞዴል።
ማህደረ ትውስታ (ወኪል ማህደረ ትውስታ)
የተከማቸ አውድ የኤ ወኪል ቀጣይነትን ለማሻሻል በሁሉም ደረጃዎች ወይም ክፍለ ጊዜዎች ይጠቀማል።
እራስህን ፈትን።AI ሞዴሎች የተብራሩ ጥያቄዎች

ምን ተፈጠረ

ተመራማሪዎች በምላሽ ጊዜ በቋንቋው ሞዴል በተሰራው ስሌት መሰረት የማጠናከሪያ-ትምህርት ክሬዲትን ለግለሰብ ቶከኖች የመመደብ ዘዴ የሆነውን ስሌት-ኮንዲሽነዲድ የብድር ትራንስፖርት አስተዋውቀዋል። የእነርሱ አተገባበር, CompPO, ትኩረት ትኩረትን በመጠቀም በእያንዳንዱ-ቶከን ማቆያ በርን ይፈጥራል እና የተዋናይውን ድብቅ ግዛቶች እና የማዘዋወር መረጃን እንደገና ከሚጠቀም ተቺ ጋር ያጣምራል።

በነሀሴ 21 ለarXiv የቀረበው ቅድመ ህትመት ለትልቅ የቋንቋ ሞዴሎች በማጠናከሪያ ትምህርት ወቅት ክሬዲት ለመመደብ አዲስ መንገድ ያቀርባል። ወረቀቱ የብድር ድልድልን በሦስት ክፍሎች ይከፍላል፡ ልቀቱ ተሳክቷል የሚለውን ማስረጃ፣ ያንን ማስረጃ ወደ ማስመሰያ ደረጃ ጥቅማጥቅሞች የሚቀይር የትራንስፖርት ኦፕሬተር እና ጥቅሞቹን ወደ ፖሊሲ ለውጦች የሚቀይረው የዝማኔ ጂኦሜትሪ። ደራሲዎቹ የቅርብ ጊዜ ስራዎች የመጀመሪያውን እና ሶስተኛውን ክፍል አሻሽለዋል ብለው ይከራከራሉ, በተለምዶ ጥቅም ላይ የዋሉ የትራንስፖርት ህጎች ከአምሳያው አርክቴክቸር ነፃ ናቸው ።

የታቀደው ማዕቀፍ በስሌት-ኮንዲሽነዲድ ክሬዲት ማጓጓዣ ተብሎ የሚጠራው የታችኛው ተፋሰስ እሴት በታቀደ ልቀት እንዴት እንደሚጓጓዝ ለመለካት ከባህሪ ፖሊሲው የውስጥ ስሌት የተለየ ስታቲስቲክስን ይጠቀማል። የኮንክሪት አልጎሪዝም፣ CompPO፣ የቤተኛ ትኩረት ትኩረትን ለእያንዳንዱ ማስመሰያ ወደ የታሰረ ማቆያ በር ይለውጣል። ያ በር ለሁለቱም ለአንድ-እርምጃ ማስነሻ እና ኮም-ጂኤኢ ለሚባለው የመንገድ ላይ ጥገኛ አጠቃላይ-ጥቅማጥቅም ጥቅም ላይ ይውላል። ጸሃፊዎቹ የቋሚ በር ዘዴውን ወደ ቋሚ-ተመጣጣኝ አጠቃላይ ጥቅም ግምትን እንደሚቀንስ እና ከመደበኛ መነሻ መስመር ጋር እንዲገናኝ እንደሚያደርግ ይገልጻሉ።

CompPO ከትራንስፖርት ጋር የተጣጣመ ተቺን ወይም TACንም ያካትታል። ተመሳሳይ ሚዛን ሁለተኛ ትራንስፎርመር ከመጨመር ይልቅ፣ TAC የተዋናዩን የተደበቀ ሁኔታ እና የማዘዋወር መረጃን እንደገና ይጠቀማል። ወረቀቱ የተግባር ሽልማቱ እና የተቀነጨፈው PPO ፖሊሲ አላማ ሳይለወጡ እንደሚቆዩ ይናገራል። የይገባኛል ጥያቄው ለውጥ ብድር እንዴት እንደሚጓጓዝ እና ተቺው ከዚያ መጓጓዣ ጋር እንዴት እንደሚጣጣም ነው። አምስት Qwen3-4B ዘሮችን በሚጠቀሙ ሙከራዎች፣ ደራሲዎቹ 61.4% የመጨረሻውን የተያዙ ትክክለኛነትን ሪፖርት አድርገዋል፣ በ95% የመተማመን ክፍተት ከ60.8% እስከ 62.0%፣ ከ53.8% ጋር ሲነጻጸር፣ ከ52.9% እስከ 54.7%፣ ለተስተካከለ GRPO።

የወረቀቱ የመጥፋት ውጤቶች ውጤቱን ወደ አካላት ጥምርነት ያመለክታሉ. Comp-GAE ከመደበኛ ተቺ ጋር የተጣመረ 55.2% ሲደርስ TAC ከቋሚ በር ጋር የተጣመረ 56.4% ደርሷል። ከሙሉ ስርዓቱ ጋር አይዛመዱም። ደራሲዎቹ የ2.4 ነጥብ መስተጋብር ውጤትን ሪፖርት አድርገዋል፣ በ95% የመተማመን ክፍተት ከ1.9 እስከ 2.9 ነጥብ። ውዝዋዜ እና የቦታ ቁጥጥሮች ለትራጀክቲካል-ተኮር አሰላለፍ እንደሚደግፉ ተዘግቧል። CompPO በ10 ከ12 ፒፒኦ-ግሪድ ሩጫዎች የተረጋጋ ነበር፣ ለንፅፅር ማዋቀር ከ 3 ከ12 ጋር ሲነጻጸር። በታሰሩ ግምገማዎች ላይ፣ ደራሲዎቹ በቅደም ተከተል በጂአርፒኦ የ4.3 እና 3.9 ስግብግብ pass@1 ማክሮ ነጥቦች በQwen3-4B እና Llama-3.1-8B-Instruct ላይ ማሻሻያዎችን ሪፖርት አድርገዋል።

የምንጭ ዝርዝሮች: arxiv.org ↗

ለምን አስፈላጊ ነው።

ውጤቱ ለትልቅ የቋንቋ ሞዴሎች የማጠናከሪያ ትምህርት ተግባራዊ ማነቆን ይመለከታል፡ የትኛው የረዥም ምላሽ ክፍሎች ለመጨረሻው ውጤት ምስጋና ወይም ተወቃሽ እንደሚገባቸው መወሰን። ደራሲዎቹ በተስተካከሉ GRPO ላይ ማሻሻያዎችን ሪፖርት አድርገዋል፣ ነገር ግን ማስረጃው ከቅድመ-ህትመት እና ከተወሰኑ የሙከራዎች ስብስብ የመጣ ነው፣ ስለዚህ የስልቱ አጠቃላይነት እና የአሰራር ወጪ እርግጠኛ አይደሉም።

ለቋንቋ ሞዴሎች ማጠናከሪያ ትምህርት የመጨረሻውን ሽልማት ከብዙ የግለሰብ ምልክቶች እና መካከለኛ ውሳኔዎች ጋር ማገናኘት አለበት። ምላሹ ጠቃሚ እና የማይጠቅሙ እርምጃዎችን ሊይዝ ይችላል፣ነገር ግን በጠቅላላው ምላሽ ላይ ተመሳሳይ የውጤት ስታቲስቲክስን የሚያሰራጭ ዘዴ ደካማ መመሪያ ሊሰጥ ይችላል። የወረቀቱ ማዕከላዊ የይገባኛል ጥያቄ የአምሳያው የራሱ ስሌት ክሬዲት ከአንዱ ቶክ ወደ ሌላው ምን ያህል ጠንካራ መሆን እንዳለበት ለመወሰን የበለጠ የተለየ ምልክት ሊያቀርብ ይችላል።

የተዘገበው ተፅዕኖ ሰፋ ባሉ ቦታዎች ላይ የሚይዝ ከሆነ፣ አርክቴክቸርን የሚያውቅ የብድር ትራንስፖርት የተለየ የሽልማት ትርጉም ወይም የፖሊሲ አላማ ሳያስፈልገው የማጠናከሪያ-ትምህርት ዝመናዎችን የበለጠ ኢላማ ሊያደርግ ይችላል። ያ አስፈላጊ ነው ምክንያቱም በብድር ምደባ ላይ የተደረጉ ለውጦች አሁን ባለው የPPO አይነት የስልጠና ቧንቧዎች ውስጥ ሊካተቱ ስለሚችሉ ነው። ከጂአርፒኦ ጋር የተዘገበው ንፅፅር በተለይ አሁን ካለው የኤልኤልኤም ማጠናከሪያ-ትምህርት ልምምድ ጋር ጠቃሚ ነው ምክንያቱም የታቀደውን ዘዴ እንደ አዲስ ሞዴል ቤተሰብ ወይም ተጠቃሚን ፊት ለፊት ከሚመለከት ምርት ይልቅ የስልጠና ምልክት ላይ ለውጥ አድርጎ ስለሚቀር ነው።

የተዘገበው ጥፋቶች ጠቃሚ ናቸው ምክንያቱም ውጤቱ ትኩረት በተሰጠው በር ወይም እንደገና ጥቅም ላይ የዋለው ተቺ ብቻ እንዳልተገለጸ ይጠቁማሉ። ሙሉው ዘዴ በቀረበው ውጤት ከሁለቱም ከፊል ልዩነቶች የተሻለ አፈጻጸም አሳይቷል፣ እና ደራሲዎቹ እንደተናገሩት ውዝዋዜው እና የቦታ ቁጥጥሮች አቅጣጫ-ተኮር አሰላለፍ ጉዳዮችን ይደግፋሉ። የመረጋጋት ንፅፅርም ሊኖር የሚችለውን ተግባራዊ ጥቅም ይጠቁማል፡- ጥቂት ያልተረጋጋ ሩጫዎች የሚባክኑ የስልጠና ሙከራዎችን ሊቀንሱ ይችላሉ፣ ምንም እንኳን ምንጩ የሂሳብ ወይም የወጪ መለኪያዎችን ባይሰጥም።

ማስረጃው አሁንም እንደ መጀመሪያ የምርምር ውጤት ሊነበብ ይገባል. ምንጩ የarXiv ቅድመ-ህትመት ነው እንጂ በአቻ የተገመገመ ሕትመት አይደለም፣ እና ረቂቅ ተግባሮቹ፣ የመረጃ ቋቶች መጠኖች፣ የመነሻ መስመር ትግበራ ዝርዝሮች፣ የሥልጠና በጀቶች፣ ወይም ስታቲስቲካዊ አሠራሮችን ከዘገቡት የመተማመን ክፍተቶች በላይ አይገልጽም። በተጨማሪም ጥቅሞቹ ከተጨማሪ ማህደረ ትውስታ፣ ዘግይቶ፣ የምህንድስና ውስብስብነት ወይም ለትኩረት ቅጦች ስሜታዊነት ጋር ይመጡ እንደሆነ አያረጋግጥም። የስልቱ ህዝባዊ ተጽእኖ የሚወሰነው ገለልተኛ ተመራማሪዎች ውጤቱን እንደገና ማባዛት እንደሚችሉ እና አቀራረቡ ወደ ትላልቅ ሞዴሎች እና የተለያዩ የማጠናከሪያ-ትምህርት ዓላማዎች በመተላለፉ ላይ ነው።

Interactive Mechanism

በይነተገናኝ ሜካኒዝም፡ በትክክል እንዴት እንደሚሰራ

ከዚህ ልማት በስተጀርባ ያለውን ቴክኖሎጂ በይነተገናኝ ያስሱ።

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
በይነተገናኝ ጽንሰ-ሐሳብ ቼክ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

ቀጥሎ ምን እንደሚታይ

አስፈላጊዎቹ ቀጣይ ፈተናዎች ገለልተኛ ማባዛት፣ ሰፋ ያለ ሞዴል ​​እና የተግባር ሽፋን እና የስልጠና ወጪን፣ የማስታወስ አጠቃቀምን እና የአሂድ ጊዜን የሚያካትቱ ንጽጽሮች ናቸው። ምንጩ CompPO ከዘገበው Qwen3-4B እና Llama-3.1-8B-Instruct ግምገማዎች ባሻገር በአስተማማኝ ሁኔታ እንደሚሰራ ወይም ትኩረትን መሰረት ያደረገ ምልክቱ በተለያዩ የሞዴል አርክቴክቸርዎች ላይ ጠቃሚ እንደሆነ አላረጋገጠም።

የመጀመሪያው ቅድሚያ የሚሰጠው ከአምስቱ Qwen3-4B ዘሮች እና ከታሰሩት ግምገማዎች ባሻገር ማባዛት ነው። ገለልተኛ ቡድኖች ዘዴውን በበለጠ የሞዴል መጠኖች፣ የስልጠና ተግባራት፣ የሽልማት አወቃቀሮች እና የቋንቋ-ሞዴል አርክቴክቸር መሞከር አለባቸው። ምንጩ Qwen3-4B እና Llama-3.1-8B-Instruct የሚል ስያሜ ተሰጥቶታል፣ነገር ግን ስልቱ በተለያዩ ሞዴሎች የተገመገመ ስለመሆኑ ወይም የትኩረት ምልክቱ በተለያዩ የማዘዋወር ወይም ትኩረት ዲዛይን ባላቸው አርክቴክቸር ውስጥ ተመሳሳይ ባህሪ እንዳለው አይገልጽም።

ተመራማሪዎችም የስልጠናውን ሙሉ ውጤት መለካት አለባቸው። ወረቀቱ TAC ተዋንያን የተደበቁ ግዛቶችን እና መረጃን ያለ ሁለተኛ ተመሳሳይ መጠን ያለው ትራንስፎርመር እንደገና ይጠቀማል ይላል ነገር ግን ምንጩ የማህደረ ትውስታ ፍጆታን፣ የግድግዳ ሰዓት የስልጠና ጊዜን፣ የሃርድዌር መስፈርቶችን ወይም አጠቃላይ ስሌትን አይገልጽም። እነዚያ መለኪያዎች የተዘገበው ትክክለኛነት እና የመረጋጋት ግኝቶች ውድ የማጠናከሪያ-መማሪያ ቧንቧዎችን ለሚያካሂዱ ድርጅቶች ተግባራዊ መሆናቸውን ይወስናሉ።

ተጨማሪ ስራ ትኩረትን የሚስብ ማቆያ በር ምን ያህል ጠንካራ እንደሆነ መመርመር አለበት. የተዘገበው ውዥንብር እና የቦታ ቁጥጥሮች በሙከራዎቹ ውስጥ ትራጀክሪ-ተኮር አሰላለፍ ይደግፋሉ፣ ነገር ግን ምንጩ በሩ ረጅም አውዶች፣ ያልተለመዱ የማመዛዘን አሻራዎች፣ ትንሽ ወይም ጫጫታ ሽልማቶች፣ ወይም በመነሳሳት እና በናሙና ላይ የተደረጉ ለውጦችን አያሳይም። የትኩረት ማተኮር ለስሌት ጠቀሜታ አስተማማኝ ተኪ ወይም ለተፈተኑት ልዩ ሞዴሎች እና ተግባራት ጠቃሚ ምልክት እንደሆነ አይታወቅም።

በመጨረሻም, እንደ ቅድመ-ህትመት ዘዴው ያለው ሁኔታ አስፈላጊ ነው. ምንጩ የገለልተኛ ማረጋገጫን፣ የምርት ማሰማራትን፣ የኮድ መገኘትን ወይም የአቻ-ግምገማ ውጤቶችን አያሳውቅም። እነዚያ ግድፈቶች ግኝቶቹን አያበላሹም ነገር ግን ስለ መባዛት እና አጠቃላይነት አስፈላጊ ጥያቄዎችን ይተዋል. ጠንከር ያለ ጉዳይ የተለቀቁ የማስፈጸሚያ ዝርዝሮችን፣ ተዛማጅ ወጪ መነሻ መስመሮችን፣ ተጨማሪ አርክቴክቸር ውጤቶችን እና መሻሻሎች ከደራሲዎች ግምገማ ማዋቀር ውጭ እንደሚቀጥሉ የሚያሳይ ማስረጃ ያስፈልገዋል።

ተዛማጅ መመሪያዎች እና ጥያቄዎች

AI ሞዴሎች ተብራርተዋልAI ስልጠናትራንስፎርመሮችየAI መጪው ጊዜየሚያውቁትን ይሞክሩ - ነፃ የ AI ጥያቄዎችን ይሞክሩበእኛ የቃላት መፍቻ ውስጥ የ AI ቃልን ይፈልጉየ AI ሞዴል መልቀቂያ መከታተያ ይከተሉ
ይህ ጠቃሚ ሆኖ ተገኝቷል?