ወደ ዜና ተመለስ
ፈጠራAI Understanding አጭር መግለጫ

በ AI የታገዘ የሂሳብ ጥናት በረዥም ጊዜ ቋሚ ላይ ድንበሮችን ያጠነክራል።

የጉዳይ ጥናት እንደዘገበው የኤአይ የምርምር ስርዓት በግሮቴንዲክ ቋሚ ላይ ያለውን ወሰን ለማሻሻል ረድቷል፣ ደራሲዎቹ ደግሞ የሰው ተመራማሪዎች ቁልፍ ምሶሶን መርጠው የቲዎረም ደረጃ ውጤቱን ብቻ እንዳረጋገጡ አፅንዖት ሰጥተዋል።

6 min readRead the primary source
ዋና-ምንጭ ሰነድምንጭ ተመዝግቧል
አታሚ
Long-horizon AI mathematics case study on arXiv
ምንጭ አገናኝ
arxiv.orghttps://arxiv.org/abs/2608.11195
የምንጭ ዓይነት
ዋና ሰነድ - ኦፊሴላዊ ማስታወቂያ ፣ ወረቀት ፣ ፋይል ወይም የመጀመሪያ ወገን ገጽ በቀጥታ እናነባለን።
አውድይህንን በ60 ሰከንድ ውስጥ ይረዱት።

እዚ ጀምር

ቁልፍ ቃላት

ኤፒአይ (የመተግበሪያ ፕሮግራሚንግ በይነገጽ)
አንድ የሶፍትዌር ስርዓት ከሌላ ስርዓት ጥያቄዎችን ለመላክ እና ምላሽ የሚቀበልበት የተቀናጀ መንገድ።
ማህደረ ትውስታ (ወኪል ማህደረ ትውስታ)
የተከማቸ አውድ የኤ ወኪል ቀጣይነትን ለማሻሻል በሁሉም ደረጃዎች ወይም ክፍለ ጊዜዎች ይጠቀማል።
ቤንችማርክ
የሞዴል አፈጻጸምን ለመለካት እና ለማነፃፀር የሚያገለግል ደረጃውን የጠበቀ ሙከራ ወይም የውሂብ ስብስብ።
እራስህን ፈትን።AI ወኪሎች ጥያቄዎች

ምን ተፈጠረ

አዲስ የ arXiv ኬዝ ጥናት የኤአይ የምርምር ሥርዓት የሂሳብ ሊቃውንት በግሮቴንዲክ ቋሚ ላይ ያለውን የታወቁ ድንበሮች እንዲያሻሽሉ እንዴት እንደረዳቸው ይገልፃል፣ ከ1953 ጀምሮ የነበረው ክፍት ችግር። ወረቀቱ ሁለቱንም የሂሳብ ውጤቶች እና ስርዓቱ በጥሩ ሁኔታ የተከናወነበትን፣ ሰዎች እንዲመሩት የተገደዱበት፣ እና የይገባኛል ጥያቄዎች በሰው ከመረጋገጡ ይልቅ በማሽን የተረጋገጡ መሆናቸውን ያሳያል።

የግሮቴንዲክ ቋሚ በጠንካራ ጥምር የማመቻቸት ችግር እና ይበልጥ በቀላሉ ሊጎተት በሚችል ከፊል የተወሰነ መዝናናት መካከል ያለውን ክፍተት ይለካል። ዝቅተኛ 6pi/11፣ ወደ 1.7135፣ እና የላይኛው ወሰን 1.7818 ያለውን አዲስ ክፍተት አዘጋጆቹ ሪፖርት አድርገዋል። አጃቢው የሂሳብ ወረቀት ማስረጃዎቹን ያቀርባል። የታችኛው የታሰረው ውጤት የሚታወቅ ነው, ምክንያቱም ጠንካራ ምሳሌን ስለማይገነባ; በምትኩ በሚመለከታቸው የማዞሪያ እቅዶች ላይ የሚተገበር እንቅፋት ያመጣል።

የምርምር ሥርዓቱ የማመዛዘን ሞዴልን ከኮዲንግ ወኪል ጋር አጣምሮታል። ወረቀቱ ሩጫው GPT-5.5-Pro ​​እና በኋላ GPT-5.6-ሶል ለማመሳከሪያነት፣ Claude Code ከ Opus እና በኋላ ፋብል 5ን ለአፈፃፀም እና አራት-ጂፒዩ መስቀለኛ መንገድን ለቁጥር ፍለጋ ተጠቅሟል። ክፍለ-ጊዜዎች በአንድ ያልተቋረጠ አውድ ላይ ከመታመን ይልቅ በፋይሎች፣ ግልባጮች፣ የሙከራ ምዝግብ ማስታወሻዎች እና የይገባኛል ጥያቄዎችን እንደ ተረጋገጡ፣ በቁጥር የተደገፈ፣ ግምታዊ ወይም ሂዩሪስቲክ በሆነ ማጠቃለያ ቀጣይነት አከናውነዋል።

ሩጫው ከሰኔ 16 እስከ ጁላይ 24 ባለው ጊዜ ውስጥ 240 የምርምር ክፍለ ጊዜዎችን ሸፍኗል፣ በ2,091 የማመዛዘን-ሞዴል ጥሪዎች እና በግምት 152 ሚሊዮን ቶከኖች በ$5,400 የኤፒአይ ወጪ። ወደ 40 የሚጠጉ የሰው መመሪያዎች ሥራውን መርተውታል። በላይኛው የታሰረ ፍለጋ ጠፍጣፋ በሆነ ጊዜ ኦፕሬተሮቹ ተደጋጋሚ አለመሳካቶች አጠቃላይ እንቅፋት ሊሆኑ እንደሚችሉ ተገንዝበው ስርዓቱን ወደ ዝቅተኛ-ታሰረ ክርክር አዛውረውታል። ወረቀቱ በምርምር አቅጣጫ የሚቀየረው እንደ ሰው ጣልቃ ገብነት እንጂ ራሱን የቻለ ውሳኔ እንዳልሆነ ይገልጻል።

ስርዓቱ ለ6pi/11 የታችኛው ወሰን ማዕከላዊ ማሻሻያ እና የተሟላ ማረጋገጫ አቅርቧል። በተጨማሪም የውስጥ የፍተሻ ፕሮቶኮልን ያለፉ ጠንካራ የላይ እና ዝቅተኛ እጩዎችን አፍርቷል፣ ነገር ግን ደራሲዎቹ እነዚያን የምስክር ወረቀቶች በራሳቸው አላረጋገጡም እና እንደ ንድፈ ሃሳቦች አልገለጹም። ስለዚህ ወረቀቱ የተረጋገጠውን የሂሳብ ውጤት ከስርዓቱ የበለጠ ግምታዊ ወይም በማሽን የተፈተነ ውጤት ይለያል።

የምንጭ ዝርዝሮች: Long-horizon AI mathematics case study on arXiv ↗

ለምን አስፈላጊ ነው።

ጥናቱ ከአንድ ቤንችማርክ ተግባር ይልቅ በምርምር ፕሮግራም ውስጥ ስለ AI ጥቅም ላይ የዋለው ያልተለመደ ተጨባጭ ማስረጃዎችን ያቀርባል። በጣም አስፈላጊው ግኝቱ የስራ ክፍፍል ነው፡ ስርዓቱ በቴክኒካል አፈፃፀም ላይ ጠንካራ ነበር፣ የሰው ተመራማሪዎች ደግሞ አጀንዳ የማውጣት፣ የማመዛዘን እና የመጨረሻውን የማጣራት ሃላፊነት ቀጥለዋል።

የረጅም-አድማስ ምርምር ለ AI ስርዓት አስቸጋሪ ነው, ምክንያቱም ያልተሳኩ አቀራረቦች ሲከማቹ አላማው ሊለወጥ ይችላል. አንድ ጠቃሚ ተባባሪ የተሞከረውን ማቆየት አለበት, የሞተውን መጨረሻ ካልተፈታ ሀሳብ መለየት እና አዲስ ጥያቄ ከሌላ አካባቢያዊ ማመቻቸት የበለጠ ዋጋ ያለው መቼ እንደሆነ መወሰን አለበት. የደራሲዎቹ ፋይል ላይ የተመሰረተ የማስታወስ ችሎታ እና የይገባኛል ጥያቄ መለያዎች ያን የምርምር ሁኔታ የሚታይ እና ሊመረመር የሚችል ለማድረግ የተደረገ ሙከራ ለሂደቱ አቀላጥፎ ምላሽ እንዲሰጥ ከመፍቀድ ይልቅ።

የታችኛው ወሰን ግኝቱ ወኪሉ ሒሳብን ማከናወን በሚችልበት ጊዜም የሰው ፍርድ ለምን አስፈላጊ እንደሆነ ያሳያል። ኦፕሬተሮቹ ብዙ የተሞከረ ግንባታዎች በተመሳሳይ መንገድ ሲወድቁ አስተውለዋል እና የፅንሰ-ሃሳቡን ምሰሶ አቅርበዋል፡ ተደጋጋሚ እንቅፋቱን እራሱ ያረጋግጡ። ከዚያም ስርዓቱ መደበኛ እና ክርክሩን ለማረጋገጥ ረድቷል. ይህ ቅደም ተከተል ከገለልተኛ ማሽን የሂሳብ ሊቅ ይልቅ ክትትል የሚደረግበት አሰሳ ቅርብ ነው፣ እና ልዩነቱ ማስረጃው የሚደግፈውን ሲገልጽ አስፈላጊ ነው።

ገለልተኛ ማረጋገጫ ለውጤቱ የመልቀቂያ በር ነው። የጉዳይ ጥናቱ የታችኛው ወሰን በጸሐፊዎቹ የተፈተሸ እና የተሟላ ማስረጃዎች በተጓዳኝ ወረቀት ላይ እንደሚገኙ ይናገራል። በሩጫው ወቅት የሚመረተው እያንዳንዱ ቁጥር ትክክል ነው አይልም. በንድፈ ሃሳብ ደረጃ የይገባኛል ጥያቄዎችን፣ በማሽን የተፈተኑ እጩዎችን እና መላምቶችን ለየብቻ ማቆየት የ AI ስርዓት ውስጣዊ መተማመንን እንደ የሂሳብ ማረጋገጫ ሳይቀበሉ ለአንባቢዎች አስተዋፅዖውን እንዲገመግሙ መንገድ ይሰጣል።

ለምርምር ድርጅቶች, ተግባራዊ ትምህርቱ ተግባራዊ ነው. የ AI ስርዓት ስነ-ጽሁፍን መፈለግ፣ ኮድ መጻፍ፣ ሙከራዎችን ማካሄድ፣ ያልተሳኩ ሙከራዎችን መጠበቅ እና ለውጦችን ማቅረብ ይችላል፣ ነገር ግን በዙሪያው ያለው የስራ ሂደት ተጨባጭ፣ ሊባዙ የሚችሉ ስሌቶች፣ ግልጽ የሰዎች የፍተሻ ቦታዎች እና ቡድኑ ለምን አቅጣጫ እንደለወጠ መልሶ ለመገንባት የሚያስችል መንገድ ይፈልጋል። ሪፖርት የተደረገው ወጪ እና ስሌት ደግሞ የረጅም አድማስ አቅም የሞዴል ብልህነት ጥያቄ ብቻ እንዳልሆነ ግልጽ ያደርገዋል። እሱ በማስተካከል ፣ በጊዜ እና በቋሚ ቁጥጥር ላይ የተመሠረተ ነው።

Interactive Mechanism

በይነተገናኝ ሜካኒዝም፡ በትክክል እንዴት እንደሚሰራ

ከዚህ ልማት በስተጀርባ ያለውን ቴክኖሎጂ በይነተገናኝ ያስሱ።

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
በይነተገናኝ ጽንሰ-ሐሳብ ቼክ+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

ቀጥሎ ምን እንደሚታይ

የሚቀጥለው ጥያቄ ይህ የትብብር ዘይቤ ከአንድ ችግር እና ቡድን በላይ አጠቃላይ ነው ወይ እና ነፃ ተመራማሪዎች የእያንዳንዱን ሰው እና AI አስተዋፅዖ ዋጋ እና አስተማማኝነት እየለኩ የተረጋገጠውን ውጤት እንደገና ማባዛት ይችሉ እንደሆነ ነው።

ማባዛት ሌሎች የሂሳብ ጎራዎችን, የችግር ዓይነቶችን እና የምርምር ስርዓቶችን በተለያዩ ማህደረ ትውስታ እና የመሳሪያ ንድፎች መሞከር አለበት. የግሮቴንዲክ ችግር አስቀድሞ በሰው-የተገነባ ማዕቀፍ፣ የተጠራቀሙ ማስታወሻዎች፣ የማረጋገጫ ማሽኖች እና የእጩ አቅጣጫዎች ይዞ መጥቷል። ያ የቀደመ አወቃቀሩ ሩጫውን ረድቷል፣ስለዚህ ወደፊት የሚደረጉ ጥናቶች ምን ያህል የምርምር ሁኔታ አስቀድሞ እንደቀረበ እና ስርዓቱ ችግሩን በራሱ መወሰን ሲገባው ውጤቶቹ እንዴት እንደሚለወጡ ሪፖርት ማድረግ አለባቸው።

ተመራማሪዎች ቴክኒካል አፈፃፀምን ከምርምር ፍርድ ጋር ማወዳደር አለባቸው። ጠቃሚ ልኬቶች የተመረጡ አቅጣጫዎችን ጥራት፣ ያልተሳካለትን መንገድ ለመተው ጊዜ፣ ያልተደገፉ የይገባኛል ጥያቄዎች መጠን፣ የሰዎች ጣልቃገብነት ብዛት እና ከገለልተኛ ፍተሻ የሚተርፉ የውጤቶች ክፍልፋይን ሊያካትቱ ይችላሉ። የተጣራ የጉዳይ ጥናት ምን እንደተፈጠረ ሊያሳይ ይችላል፣ ነገር ግን የኤአይአይ ተባባሪው ሌላ የግምገማ ንብርብር ከመጨመር ይልቅ ሂደቱን ሲያሻሽል ለመገመት ቁጥጥር የሚደረግበት ንፅፅር ያስፈልጋል።

በማሽን ማረጋገጫ እና በሰው ማረጋገጫ መካከል ያለው ድንበር ቀጣይ ትኩረት ሊሰጠው ይገባል. የጊዜ ክፍተት አርቲሜቲክ፣ የማረጋገጫ ረዳቶች፣ ሙከራዎች እና የተቃራኒ ኦዲቶች ብዙ ስህተቶችን ሊይዙ ይችላሉ፣ ነገር ግን ሰርተፍኬት አሁንም የተሳሳተ ኢላማውን መደበቅ ወይም በፍፁም ያልተቃወሙ ግምቶች ላይ ሊመሰረት ይችላል። የክትትል ስራዎች ሙሉ ቅርሶችን ማተም፣ በጣም ጠንካራውን ያልተረጋገጡ ወሰኖች እንደገና ማካሄድ እና ያልተሳኩ ወይም የተወገዱ ውጤቶችን እንደ ስኬታማ እንዲታዩ ማድረግ አለበት።

በመጨረሻም፣ የሞዴል ስሪቶች፣ መጠየቂያዎች፣ መሪ መመሪያዎች፣ ኮድ፣ ስሌት እና ግልባጮች ፈቃድ እና ግላዊነት በሚፈቅዱበት ቦታ መቀመጥ አለባቸው። የአሁኑ ወረቀት በከፊል ዋጋ ያለው ነው ምክንያቱም እነዚያን ሁኔታዎች የሚዘግብ እና የስርዓቱን ድክመቶች የሚገልጽ፣ ደካማ የምርምር-ግዛት ውክልና እና ውሱን ራስን በራስ የማስተዳደርን ጨምሮ። ሌሎች ቡድኖች ስርዓተ-ጥለት እስኪባዙ ድረስ፣ ይህ በ AI የታገዘ የሂሳብ ግስጋሴ ጠንካራ ማስረጃ ነው እንጂ የኤአይኢ ሲስተሞች በተናጥል ክፍት የሆነ ጥናት ማካሄድ እንደሚችሉ ማረጋገጫ አይደለም።

ተዛማጅ መመሪያዎች እና ጥያቄዎች

AI ወኪሎችAI ሞዴሎች ተብራርተዋልAI ስልጠናLLM ግምገማዎችየሚያውቁትን ይሞክሩ - ነፃ የ AI ጥያቄዎችን ይሞክሩበእኛ የቃላት መፍቻ ውስጥ የ AI ቃልን ይፈልጉየ AI ሞዴል መልቀቂያ መከታተያ ይከተሉ
ይህ ጠቃሚ ሆኖ ተገኝቷል?