क्या हुआ?
एक नया arXiv केस अध्ययन बताता है कि कैसे एक एआई अनुसंधान प्रणाली ने गणितज्ञों को ग्रोथेंडिक स्थिरांक पर ज्ञात सीमा को बेहतर बनाने में मदद की, जो कि 1953 की एक खुली समस्या थी। पेपर गणितीय परिणाम और एक विस्तृत रिकॉर्ड प्रस्तुत करता है कि सिस्टम कहां अच्छी तरह से क्रियान्वित हुआ, कहां लोगों को इसे चलाना था, और कौन से दावे मानव-सत्यापित के बजाय मशीन-सत्यापित रहते हैं।
ग्रोथेंडिक स्थिरांक एक कठिन संयोजन अनुकूलन समस्या और अधिक सुव्यवस्थित अर्धनिश्चित विश्राम के बीच के अंतर को मापता है। लेखक 6पीआई/11 की निचली सीमा, लगभग 1.7135, और लगभग 1.7818 की ऊपरी सीमा के साथ एक नए अंतराल की रिपोर्ट करते हैं। साथी गणित का पेपर प्रमाण प्रदान करता है। निचली सीमा का परिणाम उल्लेखनीय है क्योंकि यह एक कठिन उदाहरण का निर्माण नहीं करता है; इसके बजाय यह एक रुकावट उत्पन्न करता है जो संबंधित राउंडिंग योजनाओं पर लागू होता है।
अनुसंधान प्रणाली ने एक तर्क मॉडल को एक कोडिंग एजेंट के साथ जोड़ा। पेपर में कहा गया है कि रन में तर्क के लिए GPT-5.5-Pro और बाद में GPT-5.6-Sol, निष्पादन के लिए Opus के साथ Claude Code और बाद में Fable 5 और संख्यात्मक खोजों के लिए चार-GPU नोड का उपयोग किया गया। सत्रों में फाइलों, प्रतिलेखों, प्रयोग लॉग और एक सारांश के माध्यम से निरंतरता बनी रही, जिसमें एक निर्बाध संदर्भ पर भरोसा करने के बजाय दावों को सिद्ध, संख्यात्मक रूप से समर्थित, अनुमानित या अनुमानी के रूप में दर्ज किया गया।
इस दौड़ में 16 जून से 24 जुलाई तक लगभग 240 अनुसंधान सत्र शामिल थे, जिसमें 2,091 रीज़निंग-मॉडल कॉल और अनुमानित $5,400 एपीआई लागत पर 152 मिलियन टोकन शामिल थे। लगभग 40 दिनांकित मानवीय निर्देशों ने कार्य को संचालित किया। जब एक ऊपरी-सीमा वाली खोज स्थिर हो गई, तो ऑपरेटरों ने माना कि बार-बार विफलताएं एक सामान्य बाधा का संकेत दे सकती हैं और सिस्टम को निचली-सीमा वाले तर्क की ओर पुनर्निर्देशित किया जा सकता है। पेपर में शोध की दिशा में बदलाव को मानवीय हस्तक्षेप बताया गया है, स्वायत्त निर्णय नहीं।
सिस्टम ने 6pi/11 निचली सीमा के लिए एक केंद्रीय रीफ्रेम और एक पूर्ण प्रमाण तैयार किया, जिसे लेखकों ने फिर संशोधित किया और स्वतंत्र रूप से सत्यापित किया। इसने मजबूत संख्यात्मक ऊपरी और निचले उम्मीदवारों को भी उत्पन्न किया जो आंतरिक जांच प्रोटोकॉल में उत्तीर्ण हुए, लेकिन लेखकों ने उन प्रमाणपत्रों को स्वतंत्र रूप से सत्यापित नहीं किया है और उन्हें प्रमेय के रूप में नहीं बताया है। इसलिए पेपर सत्यापित गणितीय परिणाम को सिस्टम के अधिक सट्टा या मशीन-परीक्षणित आउटपुट से अलग करता है।
स्रोत विवरण: Long-horizon AI mathematics case study on arXiv ↗
यह क्यों मायने रखता है?
अध्ययन एकल बेंचमार्क कार्य के बजाय एक शोध कार्यक्रम में उपयोग किए जाने वाले एआई के बारे में असामान्य रूप से ठोस सबूत पेश करता है। इसकी सबसे महत्वपूर्ण खोज श्रम का विभाजन है: प्रणाली तकनीकी निष्पादन में मजबूत थी, जबकि मानव शोधकर्ता एजेंडा-सेटिंग, निर्णय और अंतिम सत्यापन के लिए जिम्मेदार रहे।
एआई प्रणाली के लिए दीर्घकालिक अनुसंधान कठिन है क्योंकि असफल दृष्टिकोण जमा होने पर उद्देश्य बदल सकता है। एक उपयोगी सहयोगी को जो प्रयास किया गया था उसे बनाए रखना चाहिए, एक अनसुलझे विचार से एक मृत अंत को अलग करना चाहिए, और यह तय करना चाहिए कि एक नया प्रश्न किसी अन्य स्थानीय अनुकूलन से अधिक मूल्यवान है। लेखकों की फ़ाइल-आधारित मेमोरी और दावा लेबल प्रगति के लिए धाराप्रवाह प्रतिक्रिया की अनुमति देने के बजाय उस शोध स्थिति को दृश्यमान और श्रव्य बनाने का एक प्रयास है।
निचली सीमा की खोज से पता चलता है कि जब कोई एजेंट गणित निष्पादित कर सकता है तब भी मानव निर्णय क्यों मायने रखता है। ऑपरेटरों ने देखा कि कई प्रयास किए गए निर्माण उसी तरह विफल हो रहे थे और उन्होंने वैचारिक धुरी प्रदान की: बार-बार होने वाली रुकावट को स्वयं साबित करें। तब सिस्टम ने तर्क को औपचारिक बनाने और प्रमाणित करने में मदद की। वह क्रम एक स्वतंत्र मशीन गणितज्ञ की तुलना में पर्यवेक्षित अन्वेषण के अधिक करीब है, और साक्ष्य क्या समर्थन करता है इसका वर्णन करते समय अंतर मायने रखता है।
स्वतंत्र सत्यापन ही परिणाम जारी करने का द्वार है। केस स्टडी में कहा गया है कि निचली सीमा की जाँच लेखकों द्वारा की गई थी और संपूर्ण प्रमाण एक सहयोगी पेपर में दिखाई देते हैं। यह नहीं कहता कि रन के दौरान उत्पन्न प्रत्येक संख्या सही है। प्रमेय-स्तरीय दावों, मशीन-परीक्षणित उम्मीदवारों और परिकल्पनाओं को अलग रखने से पाठकों को एआई प्रणाली के आंतरिक आत्मविश्वास को गणितीय प्रमाण के रूप में स्वीकार किए बिना योगदान का मूल्यांकन करने का एक तरीका मिलता है।
अनुसंधान संगठनों के लिए, व्यावहारिक पाठ चालू है। एक एआई सिस्टम साहित्य खोज सकता है, कोड लिख सकता है, प्रयोग चला सकता है, असफल प्रयासों को संरक्षित कर सकता है और परिवर्तनों का प्रस्ताव दे सकता है, लेकिन आसपास के वर्कफ़्लो को उत्पत्ति, प्रतिलिपि प्रस्तुत करने योग्य गणना, स्पष्ट मानव चौकियों और टीम ने दिशा क्यों बदली, इसका पुनर्निर्माण करने का एक तरीका चाहिए। रिपोर्ट की गई लागत और गणना यह भी स्पष्ट करती है कि लंबी-क्षितिज क्षमता केवल मॉडल इंटेलिजेंस का सवाल नहीं है; यह मचान, समय और निरंतर निरीक्षण पर निर्भर करता है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
What most distinguishes an AI agent from a basic chatbot?
आगे क्या देखना है
अगला सवाल यह है कि क्या यह सहयोग पैटर्न एक समस्या और टीम से परे सामान्यीकृत है, और क्या स्वतंत्र शोधकर्ता प्रत्येक मानव और एआई योगदान की लागत और विश्वसनीयता को मापते समय सत्यापित परिणाम को पुन: पेश कर सकते हैं।
प्रतिकृति को विभिन्न मेमोरी और टूल डिज़ाइन के साथ अन्य गणितीय डोमेन, समस्या प्रकार और अनुसंधान प्रणालियों का परीक्षण करना चाहिए। ग्रोथेंडिक समस्या पहले से ही एक महत्वपूर्ण मानव-निर्मित ढांचे, संचित नोट्स, प्रमाणन मशीनरी और उम्मीदवार निर्देशों के साथ आई थी। उस पूर्व संरचना ने चलाने में मदद की, इसलिए भविष्य के अध्ययनों में यह रिपोर्ट दी जानी चाहिए कि अनुसंधान की कितनी स्थिति पहले से ही आपूर्ति की गई थी और जब सिस्टम को समस्या को स्वयं परिभाषित करना होगा तो परिणाम कैसे बदलते हैं।
शोधकर्ताओं को संभावित उपायों का उपयोग करके अनुसंधान निर्णय के साथ तकनीकी निष्पादन की तुलना भी करनी चाहिए। उपयोगी मेट्रिक्स में चुने गए निर्देशों की गुणवत्ता, असफल पथ को छोड़ने का समय, असमर्थित दावों की दर, मानव हस्तक्षेप की संख्या और स्वतंत्र जांच से बचने वाले आउटपुट का अंश शामिल हो सकता है। एक परिष्कृत केस अध्ययन दिखा सकता है कि क्या हुआ, लेकिन यह अनुमान लगाने के लिए नियंत्रित तुलना की आवश्यकता है कि एआई सहयोगी केवल समीक्षा की एक और परत जोड़ने के बजाय प्रक्रिया में सुधार करता है या नहीं।
मशीन सत्यापन और मानव सत्यापन के बीच की सीमा पर निरंतर ध्यान देने योग्य है। अंतराल अंकगणित, प्रमाण सहायक, परीक्षण और प्रतिकूल ऑडिट कई त्रुटियों को पकड़ सकते हैं, फिर भी एक प्रमाणपत्र अभी भी गलत लक्ष्य को एन्कोड कर सकता है या उन मान्यताओं पर निर्भर हो सकता है जिन्हें कभी चुनौती नहीं दी गई थी। अनुवर्ती कार्य में पूर्ण कलाकृतियों को प्रकाशित करना चाहिए, सबसे मजबूत असत्यापित सीमाओं को फिर से चलाना चाहिए, और असफल या वापस लिए गए परिणामों को सफल परिणामों के रूप में दृश्यमान बनाना चाहिए।
अंत में, मॉडल संस्करण, संकेत, स्टीयरिंग निर्देश, कोड, कंप्यूट और ट्रांसक्रिप्ट को वहां संरक्षित किया जाना चाहिए जहां लाइसेंसिंग और गोपनीयता अनुमति देती है। वर्तमान पेपर आंशिक रूप से मूल्यवान है क्योंकि यह उन स्थितियों की रिपोर्ट करता है और सिस्टम की कमजोरियों का वर्णन करता है, जिसमें नाजुक अनुसंधान-राज्य प्रतिनिधित्व और निर्णय में सीमित स्वायत्तता शामिल है। जब तक अन्य टीमें पैटर्न को पुन: पेश नहीं करतीं, यह एआई-सहायता प्राप्त गणितीय प्रगति का मजबूत सबूत है, यह सबूत नहीं है कि एआई सिस्टम स्वतंत्र रूप से ओपन-एंडेड शोध कर सकते हैं।