समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

एआई-सहायता प्राप्त गणित अध्ययन लंबे समय से चले आ रहे स्थिरांक को मजबूत करता है

एक केस स्टडी की रिपोर्ट है कि एआई अनुसंधान प्रणाली ने ग्रोथेंडिक स्थिरांक पर सीमाओं को बेहतर बनाने में मदद की, जबकि लेखक इस बात पर जोर देते हैं कि मानव शोधकर्ताओं ने मुख्य धुरी को चुना और स्वतंत्र रूप से केवल प्रमेय-स्तर के परिणाम को सत्यापित किया।

6 min readRead the primary source
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
Long-horizon AI mathematics case study on arXiv
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.11195
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

एपीआई (एप्लिकेशन प्रोग्रामिंग इंटरफ़ेस)
एक सॉफ्टवेयर सिस्टम के लिए दूसरे सिस्टम को अनुरोध भेजने और उससे प्रतिक्रिया प्राप्त करने का एक संरचित तरीका।
मेमोरी (एजेंट मेमोरी)
संग्रहीत संदर्भ एक एआई एजेंट निरंतरता में सुधार के लिए चरणों या सत्रों में उपयोग करता है।
बेंचमार्क
मॉडल प्रदर्शन को मापने और तुलना करने के लिए उपयोग किया जाने वाला एक मानकीकृत परीक्षण या डेटासेट।
स्वयं की जांच करोएआई एजेंट प्रश्नोत्तरी

क्या हुआ?

एक नया arXiv केस अध्ययन बताता है कि कैसे एक एआई अनुसंधान प्रणाली ने गणितज्ञों को ग्रोथेंडिक स्थिरांक पर ज्ञात सीमा को बेहतर बनाने में मदद की, जो कि 1953 की एक खुली समस्या थी। पेपर गणितीय परिणाम और एक विस्तृत रिकॉर्ड प्रस्तुत करता है कि सिस्टम कहां अच्छी तरह से क्रियान्वित हुआ, कहां लोगों को इसे चलाना था, और कौन से दावे मानव-सत्यापित के बजाय मशीन-सत्यापित रहते हैं।

ग्रोथेंडिक स्थिरांक एक कठिन संयोजन अनुकूलन समस्या और अधिक सुव्यवस्थित अर्धनिश्चित विश्राम के बीच के अंतर को मापता है। लेखक 6पीआई/11 की निचली सीमा, लगभग 1.7135, और लगभग 1.7818 की ऊपरी सीमा के साथ एक नए अंतराल की रिपोर्ट करते हैं। साथी गणित का पेपर प्रमाण प्रदान करता है। निचली सीमा का परिणाम उल्लेखनीय है क्योंकि यह एक कठिन उदाहरण का निर्माण नहीं करता है; इसके बजाय यह एक रुकावट उत्पन्न करता है जो संबंधित राउंडिंग योजनाओं पर लागू होता है।

अनुसंधान प्रणाली ने एक तर्क मॉडल को एक कोडिंग एजेंट के साथ जोड़ा। पेपर में कहा गया है कि रन में तर्क के लिए GPT-5.5-Pro ​​और बाद में GPT-5.6-Sol, निष्पादन के लिए Opus के साथ Claude Code और बाद में Fable 5 और संख्यात्मक खोजों के लिए चार-GPU नोड का उपयोग किया गया। सत्रों में फाइलों, प्रतिलेखों, प्रयोग लॉग और एक सारांश के माध्यम से निरंतरता बनी रही, जिसमें एक निर्बाध संदर्भ पर भरोसा करने के बजाय दावों को सिद्ध, संख्यात्मक रूप से समर्थित, अनुमानित या अनुमानी के रूप में दर्ज किया गया।

इस दौड़ में 16 जून से 24 जुलाई तक लगभग 240 अनुसंधान सत्र शामिल थे, जिसमें 2,091 रीज़निंग-मॉडल कॉल और अनुमानित $5,400 एपीआई लागत पर 152 मिलियन टोकन शामिल थे। लगभग 40 दिनांकित मानवीय निर्देशों ने कार्य को संचालित किया। जब एक ऊपरी-सीमा वाली खोज स्थिर हो गई, तो ऑपरेटरों ने माना कि बार-बार विफलताएं एक सामान्य बाधा का संकेत दे सकती हैं और सिस्टम को निचली-सीमा वाले तर्क की ओर पुनर्निर्देशित किया जा सकता है। पेपर में शोध की दिशा में बदलाव को मानवीय हस्तक्षेप बताया गया है, स्वायत्त निर्णय नहीं।

सिस्टम ने 6pi/11 निचली सीमा के लिए एक केंद्रीय रीफ्रेम और एक पूर्ण प्रमाण तैयार किया, जिसे लेखकों ने फिर संशोधित किया और स्वतंत्र रूप से सत्यापित किया। इसने मजबूत संख्यात्मक ऊपरी और निचले उम्मीदवारों को भी उत्पन्न किया जो आंतरिक जांच प्रोटोकॉल में उत्तीर्ण हुए, लेकिन लेखकों ने उन प्रमाणपत्रों को स्वतंत्र रूप से सत्यापित नहीं किया है और उन्हें प्रमेय के रूप में नहीं बताया है। इसलिए पेपर सत्यापित गणितीय परिणाम को सिस्टम के अधिक सट्टा या मशीन-परीक्षणित आउटपुट से अलग करता है।

स्रोत विवरण: Long-horizon AI mathematics case study on arXiv ↗

यह क्यों मायने रखता है?

अध्ययन एकल बेंचमार्क कार्य के बजाय एक शोध कार्यक्रम में उपयोग किए जाने वाले एआई के बारे में असामान्य रूप से ठोस सबूत पेश करता है। इसकी सबसे महत्वपूर्ण खोज श्रम का विभाजन है: प्रणाली तकनीकी निष्पादन में मजबूत थी, जबकि मानव शोधकर्ता एजेंडा-सेटिंग, निर्णय और अंतिम सत्यापन के लिए जिम्मेदार रहे।

एआई प्रणाली के लिए दीर्घकालिक अनुसंधान कठिन है क्योंकि असफल दृष्टिकोण जमा होने पर उद्देश्य बदल सकता है। एक उपयोगी सहयोगी को जो प्रयास किया गया था उसे बनाए रखना चाहिए, एक अनसुलझे विचार से एक मृत अंत को अलग करना चाहिए, और यह तय करना चाहिए कि एक नया प्रश्न किसी अन्य स्थानीय अनुकूलन से अधिक मूल्यवान है। लेखकों की फ़ाइल-आधारित मेमोरी और दावा लेबल प्रगति के लिए धाराप्रवाह प्रतिक्रिया की अनुमति देने के बजाय उस शोध स्थिति को दृश्यमान और श्रव्य बनाने का एक प्रयास है।

निचली सीमा की खोज से पता चलता है कि जब कोई एजेंट गणित निष्पादित कर सकता है तब भी मानव निर्णय क्यों मायने रखता है। ऑपरेटरों ने देखा कि कई प्रयास किए गए निर्माण उसी तरह विफल हो रहे थे और उन्होंने वैचारिक धुरी प्रदान की: बार-बार होने वाली रुकावट को स्वयं साबित करें। तब सिस्टम ने तर्क को औपचारिक बनाने और प्रमाणित करने में मदद की। वह क्रम एक स्वतंत्र मशीन गणितज्ञ की तुलना में पर्यवेक्षित अन्वेषण के अधिक करीब है, और साक्ष्य क्या समर्थन करता है इसका वर्णन करते समय अंतर मायने रखता है।

स्वतंत्र सत्यापन ही परिणाम जारी करने का द्वार है। केस स्टडी में कहा गया है कि निचली सीमा की जाँच लेखकों द्वारा की गई थी और संपूर्ण प्रमाण एक सहयोगी पेपर में दिखाई देते हैं। यह नहीं कहता कि रन के दौरान उत्पन्न प्रत्येक संख्या सही है। प्रमेय-स्तरीय दावों, मशीन-परीक्षणित उम्मीदवारों और परिकल्पनाओं को अलग रखने से पाठकों को एआई प्रणाली के आंतरिक आत्मविश्वास को गणितीय प्रमाण के रूप में स्वीकार किए बिना योगदान का मूल्यांकन करने का एक तरीका मिलता है।

अनुसंधान संगठनों के लिए, व्यावहारिक पाठ चालू है। एक एआई सिस्टम साहित्य खोज सकता है, कोड लिख सकता है, प्रयोग चला सकता है, असफल प्रयासों को संरक्षित कर सकता है और परिवर्तनों का प्रस्ताव दे सकता है, लेकिन आसपास के वर्कफ़्लो को उत्पत्ति, प्रतिलिपि प्रस्तुत करने योग्य गणना, स्पष्ट मानव चौकियों और टीम ने दिशा क्यों बदली, इसका पुनर्निर्माण करने का एक तरीका चाहिए। रिपोर्ट की गई लागत और गणना यह भी स्पष्ट करती है कि लंबी-क्षितिज क्षमता केवल मॉडल इंटेलिजेंस का सवाल नहीं है; यह मचान, समय और निरंतर निरीक्षण पर निर्भर करता है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

आगे क्या देखना है

अगला सवाल यह है कि क्या यह सहयोग पैटर्न एक समस्या और टीम से परे सामान्यीकृत है, और क्या स्वतंत्र शोधकर्ता प्रत्येक मानव और एआई योगदान की लागत और विश्वसनीयता को मापते समय सत्यापित परिणाम को पुन: पेश कर सकते हैं।

प्रतिकृति को विभिन्न मेमोरी और टूल डिज़ाइन के साथ अन्य गणितीय डोमेन, समस्या प्रकार और अनुसंधान प्रणालियों का परीक्षण करना चाहिए। ग्रोथेंडिक समस्या पहले से ही एक महत्वपूर्ण मानव-निर्मित ढांचे, संचित नोट्स, प्रमाणन मशीनरी और उम्मीदवार निर्देशों के साथ आई थी। उस पूर्व संरचना ने चलाने में मदद की, इसलिए भविष्य के अध्ययनों में यह रिपोर्ट दी जानी चाहिए कि अनुसंधान की कितनी स्थिति पहले से ही आपूर्ति की गई थी और जब सिस्टम को समस्या को स्वयं परिभाषित करना होगा तो परिणाम कैसे बदलते हैं।

शोधकर्ताओं को संभावित उपायों का उपयोग करके अनुसंधान निर्णय के साथ तकनीकी निष्पादन की तुलना भी करनी चाहिए। उपयोगी मेट्रिक्स में चुने गए निर्देशों की गुणवत्ता, असफल पथ को छोड़ने का समय, असमर्थित दावों की दर, मानव हस्तक्षेप की संख्या और स्वतंत्र जांच से बचने वाले आउटपुट का अंश शामिल हो सकता है। एक परिष्कृत केस अध्ययन दिखा सकता है कि क्या हुआ, लेकिन यह अनुमान लगाने के लिए नियंत्रित तुलना की आवश्यकता है कि एआई सहयोगी केवल समीक्षा की एक और परत जोड़ने के बजाय प्रक्रिया में सुधार करता है या नहीं।

मशीन सत्यापन और मानव सत्यापन के बीच की सीमा पर निरंतर ध्यान देने योग्य है। अंतराल अंकगणित, प्रमाण सहायक, परीक्षण और प्रतिकूल ऑडिट कई त्रुटियों को पकड़ सकते हैं, फिर भी एक प्रमाणपत्र अभी भी गलत लक्ष्य को एन्कोड कर सकता है या उन मान्यताओं पर निर्भर हो सकता है जिन्हें कभी चुनौती नहीं दी गई थी। अनुवर्ती कार्य में पूर्ण कलाकृतियों को प्रकाशित करना चाहिए, सबसे मजबूत असत्यापित सीमाओं को फिर से चलाना चाहिए, और असफल या वापस लिए गए परिणामों को सफल परिणामों के रूप में दृश्यमान बनाना चाहिए।

अंत में, मॉडल संस्करण, संकेत, स्टीयरिंग निर्देश, कोड, कंप्यूट और ट्रांसक्रिप्ट को वहां संरक्षित किया जाना चाहिए जहां लाइसेंसिंग और गोपनीयता अनुमति देती है। वर्तमान पेपर आंशिक रूप से मूल्यवान है क्योंकि यह उन स्थितियों की रिपोर्ट करता है और सिस्टम की कमजोरियों का वर्णन करता है, जिसमें नाजुक अनुसंधान-राज्य प्रतिनिधित्व और निर्णय में सीमित स्वायत्तता शामिल है। जब तक अन्य टीमें पैटर्न को पुन: पेश नहीं करतीं, यह एआई-सहायता प्राप्त गणितीय प्रगति का मजबूत सबूत है, यह सबूत नहीं है कि एआई सिस्टम स्वतंत्र रूप से ओपन-एंडेड शोध कर सकते हैं।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई एजेंटएआई मॉडल की व्याख्याएआई प्रशिक्षणएलएलएम मूल्यांकनआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?