ወደ ዜና ተመለስ
ፈጠራAI Understanding አጭር መግለጫ

ወረቀት እርግጠኛ ባልሆኑ ግምገማዎች LLMዎችን ለመምረጥ ባለ ሁለት ደረጃ ፈተናን ያቀርባል

አዲስ ቅድመ-ህትመት ኩባንያዎች አንዳንድ ጊዜ የሞዴል-ጥራት ግምቶች እርግጠኛ ባይሆኑም እንኳ ለተደጋጋሚ የሥራ ጫናዎች የትላልቅ ቋንቋ ሞዴሎችን ምርጡን ድልድል ማረጋገጥ እንደሚችሉ ይከራከራሉ። ባለሁለት መፍትሄ ፈተና እና ማስረጃ የመሰብሰቢያ ዘዴ CASE የተባለ ዘዴን ያቀርባል።

6 min readRead the primary source
Source-provided image accompanying Paper proposes a two-step test for choosing LLMs under uncertain evaluations
ዋና-ምንጭ ሰነድምንጭ ተመዝግቧል
አታሚ
arxiv.org
ምንጭ አገናኝ
arxiv.orghttps://arxiv.org/abs/2608.29560
የምንጭ ዓይነት
ዋና ሰነድ - ኦፊሴላዊ ማስታወቂያ ፣ ወረቀት ፣ ፋይል ወይም የመጀመሪያ ወገን ገጽ በቀጥታ እናነባለን።
አውድይህንን በ60 ሰከንድ ውስጥ ይረዱት።

እዚ ጀምር

ቁልፍ ቃላት

ትልቅ የቋንቋ ሞዴል (LLM)
ጽሑፍን ለማፍለቅ እና ለመተንተን በትልቅ ጽሑፍ ኮርፖራ ላይ የሰለጠነ የቋንቋ ሞዴል።
ጥንካሬ
የአንድ ሞዴል አፈፃፀም በጩኸት፣ በፈረቃ ወይም በተቃዋሚ ግብዓቶች ስር የማቆየት ችሎታ።
ቤንችማርክ
የሞዴል አፈጻጸምን ለመለካት እና ለማነፃፀር የሚያገለግል ደረጃውን የጠበቀ ሙከራ ወይም የውሂብ ስብስብ።
እራስህን ፈትን።ChatGPT እና LLMs ጥያቄዎች

ምን ተፈጠረ

ተመራማሪዎች ሃመድ ክሆስራቪ እና ዢያንግ ሁዎ አንድ ድርጅት ቋሚ AI በጀት ሲኖረው ነገር ግን ስለ ሞዴል ​​ጥራት ያልተሟላ ወይም አስተማማኝ ማስረጃ ሲኖር በትላልቅ ቋንቋዎች ሞዴሎች መካከል የስራ ጫናዎችን ለመመደብ ማዕቀፍ አቅርበዋል. ወረቀቱ እያንዳንዱን ሞዴል በእያንዳንዱ የሥራ ዓይነት ላይ ምን ያህል በጥሩ ሁኔታ እንደሚሠራ ለመገመት አንድን ሥራ የማመቻቸት ችግርን ከከባድ ችግር ይለያል።

የarXiv መዝገብ ወረቀቱን እ.ኤ.አ. ነሐሴ 30 ቀን 2026 እንደቀረበ ይዘረዝራል። ርዕሰ ጉዳዩ በቋሚ አርቴፊሻል ኢንተለጀንስ ባጀት ውስጥ ሲሰራ እያንዳንዱን ተደጋጋሚ የስራ ጫና የትኛውን ትልቅ ቋንቋ መወጣት እንዳለበት የሚመርጥ ኩባንያ ነው። አስተማማኝ ጥራት ያለው ሠንጠረዥ ከተገኘ በኋላ ደራሲዎቹ የምደባውን ችግር እንደቀላል ይገልፁታል፡ እያንዳንዱ የሠንጠረዥ ግቤት አንድ ሞዴል በአንድ የተወሰነ የስራ አይነት ላይ ምን ያህል ጥሩ አፈጻጸም እንዳለው ያሳያል። የእነሱ መከራከሪያ ያንን ጠረጴዛ መገንባት አስቸጋሪው ክፍል ነው, የተፈጠረውን የምደባ ችግር መፍታት አይደለም.

ደራሲዎቹ ሁለት የጥርጣሬ ምንጮችን ይለያሉ. በመጀመሪያ, ሞዴሎች ብዙውን ጊዜ በተመሳሳይ ስራ ላይ አይወዳደሩም, ይህም ቀጥተኛ የአፈፃፀም ንፅፅሮችን አስቸጋሪ ያደርገዋል. ሁለተኛ፣ የተመዘገቡ የግምገማ ውጤቶች አንድ ኩባንያ በእውነቱ ዋጋ ከሚሰጠው ውጤት ይልቅ ፕሮክሲን ሊለካ ይችላል። አብስትራክቱ የምክንያት እና ከፖሊሲ ውጭ የሆኑ ዘዴዎች በፕሮክሲው ላይ በመመስረት የመጀመሪያውን ችግር ሊፈቱ ይችላሉ፣ የግምገማ ማረጋገጫ ዘዴዎች ግን የምደባ ውሳኔውን ሳያጠናቅቁ ሁለተኛውን ሊፈቱ ይችላሉ ይላል። ወረቀቱ በተጨማሪ በዘፈቀደ የተደረጉ ድጋሚ ግምገማዎችን መግዛት አንድ ውጤት እንዴት እንደሚመጣ እርግጠኛ አለመሆንን አይፈታም ሲል ተከራክሯል።

የታቀደው የውሳኔ ፈተና አንድ የስራ ጫና ምደባ ከተገኘው ማስረጃ ጋር በሚስማማ መልኩ በእያንዳንዱ የጥራት ሠንጠረዥ ላይ ጥሩ ሆኖ እንደቀጠለ ይጠይቃል። ለቋሚ በጀት መቼት፣ ደራሲዎቹ ትክክለኛውን ባለ ሁለት-መፍትሄ ሰርተፍኬት ይገልጻሉ፡ አንድ ማመቻቸት የሚገመተውን የጥራት ሠንጠረዥ ይጠቀማል፣ ሁለተኛው ደግሞ በትንሹ ምቹ ሠንጠረዥ ይጠቀማል። በሁለቱ መፍትሄዎች መካከል ያለው ስምምነት በወረቀቱ ማዕቀፍ ውስጥ ያለውን ምደባ ያረጋግጣል. አለመግባባቶች ተጨማሪ ማስረጃ ውሳኔውን ሊለውጡ የሚችሉ የሞዴል-የሥራ ጫና ጥንዶችን ይለያል።

ወረቀቱ በተጨማሪ CASE ወይም መንስኤ ንቁ ተከታታይ ሙከራዎችን ያቀርባል። ዘዴው ተጨማሪ ግምገማን ወደ ሞዴል-የስራ ጫና ጥንዶች ወደ እርግጠኛ ላልሆነ ውሳኔ ይመራል፣ ከዚያም አዲስ ማስረጃ ሲመጣ የጥንካሬ ፈተናውን ይደግማል። የአብስትራክት ሪፖርቶች የምርት ምዝግብ ማስታወሻ እና የሚከፈልባቸው የሶፍትዌር ተግባራት ውጤቶች ናቸው፣ ነገር ግን የእነዚያን ሙከራዎች መጠን እና ዲዛይን በተናጥል ለመገምገም በቂ ዝርዝር በምንጭ ጽሑፍ ውስጥ አይገልጽም። ምደባውን በትክክል ማረም በምርት-ምዝግብ ማስታወሻው መቼት ላይ አብዛኛው ኪሳራ እንደቀረ፣ በዘፈቀደ የተደረገ ዳግም ግምገማ የመለኪያ ችግርን አላስቀረምም፣ እና ያሉ ማስረጃዎች ብዙውን ጊዜ ልዩ የሆነ ስራን ለመወሰን እንዳልቻሉ ይናገራል።

የምንጭ ዝርዝሮች: arxiv.org ↗

ለምን አስፈላጊ ነው።

የወረቀቱ ማዕከላዊ የይገባኛል ጥያቄ ደካማ ግምቶች ላይ የተገነቡ ውሳኔዎችን በተደጋጋሚ ከማመቻቸት የተሻለ መለኪያ የበለጠ ዋጋ ሊያመጣ ይችላል. ከተዘገቡት ሙከራዎች በላይ ከተረጋገጠ፣ ማዕቀፉ ድርጅቶቹ ማስረጃዎቻቸው ለሞዴል-የስራ ጫና ስራ ለመፈፀም ጠንካራ ሲሆኑ እና ተጨማሪ ምርመራ ሲደረግ እንዲወስኑ ሊረዳቸው ይችላል።

ተግባራዊ መዋጮው አንድ ድርጅት እንዲያሻሽል በተጠየቀው ላይ ለውጥ ነው። ሞዴሎችን የሚመርጥ ቡድን ለአሁኑ የቤንችማርክ ውጤቶች በሂሳብ ምርጡን ስራ በማግኘት ላይ ሊያተኩር ይችላል። ይህ ጽሁፍ እንደሚያመለክተው ምደባ እነዚያ ውጤቶች ታማኝ መሆናቸውን እና ከድርጅቱ ትክክለኛ ዓላማ ጋር ተዛማጅነት ያላቸውን ከመወሰን ያነሰ አስፈላጊ ሊሆን ይችላል። ያ ልዩነት አንድ ሞዴል በመጠን ማመሳከሪያ ላይ ጠንካራ ሆኖ ሲታይ ነገር ግን ወጪን፣ ገቢን፣ መዘግየትን ወይም አደጋን በሚያስገኝ ስራ ላይ በተለየ ሁኔታ ሲያከናውን አስፈላጊ ነው።

የቀረበው የምስክር ወረቀት የተዋቀረ የማቆሚያ ህግን ሊያቀርብ ይችላል። በግምታዊው የጠረጴዛ መፍትሄ እና በትንሹ-አመቺ-የጠረጴዛ መፍትሄ መካከል ያለው ስምምነት አንድ አይነት ስራ ከወረቀቱ የተረጋገጠ እርግጠኛ አለመሆን እንደሚተርፍ ያሳያል። አለመግባባቶች አሸናፊውን ሞዴል አይለይም ነገር ግን እርግጠኛ አለመሆንን ወደ ልዩ ሞዴል-የስራ ጭነት ጥንዶች ያጠባል። በመርህ ደረጃ፣ ያ የግምገማ ወጪን የበለጠ ዒላማ ሊያደርግ እና ድርጅቶች በስምሪት ውሳኔ ላይ ተጽዕኖ ሊያሳርፉ የማይችሉ ብዙ መረጃዎችን እንዳይሰበስቡ ሊያግድ ይችላል።

ምንም እንኳን ምንጩ ምንም አይነት የውጤት መጠን ባይሰጥም የተዘገበው ሙከራዎች ጠቃሚ ሊሆን የሚችል የአሰራር ትምህርት ያመለክታሉ። በሚከፈልባቸው የሶፍትዌር ስራዎች ላይ ደራሲዎቹ ስለ ሞዴል ​​ጥራት የተሻለ መረጃ ማግኘታቸው ተመሳሳይ ግምቶችን በመጠቀም ምደባውን ከማመቻቸት የበለጠ ቁጠባዎችን እንዳስገኘ ይናገራሉ። ያ ውጤት ጠቅለል ያለ ከሆነ፣ ጥሩ ጥራት ያለው የማዞሪያ ውሳኔ ከማድረጋቸው በፊት ድርጅቶች ለተግባር-ተኮር ልኬት፣ የውጤት ማረጋገጫ እና ተመጣጣኝ ፈተናዎች ላይ ኢንቨስት በማድረግ ተጠቃሚ ሊሆኑ ይችላሉ። ውጤቱ አንድ ሞዴል በሰፊው የላቀ መሆኑን አያረጋግጥም; በበጀት አመዳደብ ችግር ውስጥ ያለውን የመረጃ ዋጋ ይመለከታል።

ግኝቶቹ የመሪዎች ሰሌዳ አይነት ንፅፅር ወሰንንም ያጎላሉ። ነጥብ ጠቃሚ የሚሆነው አንድ ድርጅት የሚያስብለትን ውጤት እስከሚከታተል ድረስ ብቻ ነው፣ እና ሞዴሎች በተለያዩ ስራዎች ላይ ሲፈተኑ ንፅፅር አስቸጋሪ ይሆናል። ስለዚህ ወረቀቱ ሞዴል ምርጫን ከቀላል የደረጃ ልምምድ ይልቅ እንደ መለኪያ እና የውሳኔ ችግር አድርጎ ያስቀምጣል። ያ ፍሬም አወጣጥ ብዙ ሞዴሎችን ለሚጠቀሙ ኢንተርፕራይዞች ጠቃሚ ነው፣ ነገር ግን ምንጩ CASE ምን ያህል የማስፈጸሚያ ጥረት እንደሚያስፈልግ ወይም ግምቶቹ ከእውነተኛ ግዥ እና የስርጭት ስርዓቶች ጋር የሚስማሙ መሆን አለመሆኑን ምንጩ አልገለጸም።

Interactive Mechanism

በይነተገናኝ ሜካኒዝም፡ በትክክል እንዴት እንደሚሰራ

ከዚህ ልማት በስተጀርባ ያለውን ቴክኖሎጂ በይነተገናኝ ያስሱ።

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
በይነተገናኝ ጽንሰ-ሐሳብ ቼክ+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

ቀጥሎ ምን እንደሚታይ

ስራው የarXiv ቅድመ-ህትመት ነው፣ እና ምንጩ የናሙና መጠኖችን፣ የሞዴል ስሞችን፣ የተግባር ብዛትን፣ የወጪ አሃዞችን፣ የውጤት መጠኖችን፣ ኮድን ወይም ገለልተኛ ማረጋገጫን አይሰጥም። ተጨማሪ ምርመራ የታቀደው የምስክር ወረቀት እና የCASE ዘዴ በተለያዩ የስራ ጫናዎች፣ ሞዴል አቅራቢዎች፣ የዋጋ አወቃቀሮች እና የግምገማ መለኪያዎች ላይ መያዙን መመርመር አለበት።

ዋናው የማይታወቅ ዘገባ ከተዘገበው የምርት-ምዝግብ ማስታወሻ እና የተከፈለ-ሶፍትዌር-ተግባር ውጤቶች በስተጀርባ ያለው ማስረጃ ነው። የምንጭ ጽሑፉ ምን ያህል ጥያቄዎች፣ የሥራ ጫናዎች፣ ሞዴሎች ወይም ግምገማዎች እንደተካተቱ አይገልጽም። የ AI በጀት እንዴት እንደተገለጸ; የትኞቹ ወጪዎች እና ውጤቶች ተለክተዋል; ወይም የተዘገበው ቁጠባ እና ቀሪ ኪሳራ ምን ያህል ትልቅ ነበር። እነዚያ ዝርዝሮች ከሌሉ የግኝቶቹ አቅጣጫ ከአብስትራክት ግልጽ ነው፣ ነገር ግን ተግባራዊ ግዝነታቸው አይደለም።

ተጨማሪ ግምገማ እርግጠኛ ካልሆኑት ስብስብ እና አነስተኛ ተወዳጅ ሠንጠረዥ በስተጀርባ ያሉትን ግምቶች መሞከር አለበት። የምስክር ወረቀቱ በተገለጸው መሰረት ለቋሚ የበጀት ችግር ትክክለኛ ነው, ነገር ግን ጠቃሚነቱ የተመካው የጥራት ሰንጠረዦች ስብስብ በተሰማራ ቡድን ላይ የሚያጋጥሙትን እርግጠኛ ያልሆኑ ሁኔታዎች በትክክል መያዙ ላይ ነው. አስፈላጊ የማከፋፈያ ፈረቃ፣ የሥራ ጫና መቀየር፣ የሞዴል ማሻሻያ ወይም የዋጋ አወጣጥ ለውጦች ካልተካተቱ በሁለቱ መፍትሄዎች መካከል ያለው ስምምነት ከመደበኛው ውጤት ያነሰ ማረጋገጫ ሊሰጥ ይችላል።

የታቀዱት ተከታታይ ሙከራዎችም መመርመርን ያስገድዳሉ። CASE የምደባ ውሳኔውን ሊለውጡ የሚችሉ ግምገማዎችን ለመምረጥ የታለመ ነው፣ ነገር ግን ምንጩ የሙከራ ፕሮቶኮሉን፣ የማቆሚያ ህግን፣ የስታቲስቲክስ ዋስትናዎችን እና በጣም ጥቂት ምልከታዎችን መደምደሚያ ላይ እንዳይደርስ የሚከላከለውን አይገልጽም። ተመራማሪዎች እና ባለሙያዎች ሙሉውን የወረቀት ዘዴዎች, የተለቀቁ መረጃዎችን ወይም ኮድን, የስሜታዊነት ትንታኔዎችን እና ንፅፅሮችን ከቀላል የግምገማ ስልቶች ጋር መፈለግ አለባቸው.

በመጨረሻም ሥራው ራሱን ችሎ ከተቋቋመ የኢንዱስትሪ ደረጃ ሳይሆን እንደ ቅድመ ማተሚያ ተደርጎ መታየት አለበት። ምንጩ ትክክለኛ የምስክር ወረቀት ይለያል እና የሙከራ የይገባኛል ጥያቄዎችን ሪፖርት ያደርጋል፣ ነገር ግን የአቻ ግምገማን ወይም ውጫዊ ድግግሞሽን አይጠቅስም። አስፈላጊ የክትትል ጥያቄዎች ዘዴው የሚሰራው ከሶፍትዌር ላልሆኑ የስራ ጫናዎች፣ እንደ ጥራት፣ መዘግየት እና ደህንነት ያሉ በርካታ አላማዎችን መያዙን እና ድርጅቶች የተኪ ውጤቶችን ወደ ሚለኩ እና ከውሳኔ ጋር የሚዛመዱ ውጤቶችን መተርጎም ይችሉ እንደሆነ ያካትታሉ።

ተዛማጅ መመሪያዎች እና ጥያቄዎች

ChatGPT እና LLMsAI ሞዴሎች ተብራርተዋልAI ስልጠናየAI መጪው ጊዜየሚያውቁትን ይሞክሩ - ነፃ የ AI ጥያቄዎችን ይሞክሩበእኛ የቃላት መፍቻ ውስጥ የ AI ቃልን ይፈልጉየ AI ሞዴል መልቀቂያ መከታተያ ይከተሉ
ይህ ጠቃሚ ሆኖ ተገኝቷል?