क्या हुआ?
मार्कटेकपोस्ट की रिपोर्ट है कि Meta FAIR, ऑक्सफोर्ड विश्वविद्यालय और यूनिवर्सिटी कॉलेज लंदन के शोधकर्ताओं ने AI रिसर्च एजेंट को कौन से प्रयोग चलाने चाहिए, इसका चयन करने के लिए AI रिसर्च प्रेफरेंस मॉडल या RPM पेश किए। रिपोर्ट किए गए एआईआरएस-बेंच मूल्यांकन पर, आरपीएम ने औसत सामान्यीकृत स्कोर में सुधार किया और 24 के बजाय लगभग 15 घंटों में यादृच्छिक-चयन बेसलाइन तक पहुंच गया।
मार्कटेकपोस्ट की रिपोर्ट है कि आरपीएम उनके पूर्ण स्कोर की भविष्यवाणी करने के बजाय अप्रयुक्त उम्मीदवार प्रयोगों को रैंक करते हैं। रिपोर्ट की गई प्रणाली AIRA-dojo नामक एक विकासवादी वृक्ष-खोज मचान का उपयोग करती है। एक एजेंट समानांतर में 15 उम्मीदवार बच्चों को तैयार करता है, नॉकआउट टूर्नामेंट में उनकी जोड़ीवार तुलना करता है, और केवल विजेता को निष्पादित करता है। तुलनाएं पहले से खोजे गए संदर्भ नोड्स और उनके सत्यापन स्कोर का उपयोग करती हैं।
लेख दो प्रकारों का वर्णन करता है। केवल-अनुमान आरपीएम एक जमे हुए पूर्व-प्रशिक्षित भाषा मॉडल के साथ उम्मीदवार की योजनाओं, कोड और खोज इतिहास का आकलन करता है। एजेंटिक RPM अतिरिक्त रूप से Python, बैश और एक सबमिशन टूल का उपयोग करके एक H200 GPU वाले क्लोन वातावरण में छोटे पायलट प्रयोग चलाता है। मार्कटेकपोस्ट की रिपोर्ट है कि एजेंट चयनकर्ता का उपयोग केवल ड्राफ्ट और सुधार चरणों के लिए किया गया था, जबकि डीबग चयन यादृच्छिक पर वापस आ गया क्योंकि पायलटों ने एजेंट के समय बजट का उपभोग किया था।
एआईआरएस-बेंच पर, जिसे मार्कटेकपोस्ट 20 सार्वजनिक पाठ और सारणीबद्ध कार्यों के रूप में वर्णित करता है, रिपोर्ट किए गए औसत सामान्यीकृत स्कोर यादृच्छिक चयन के लिए 0.684, केवल-अनुमान आरपीएम के लिए 0.711 और एजेंटिक आरपीएम के लिए 0.729 थे। कथित तौर पर सेटअप ने प्रयोग ऑपरेटरों और आरपीएम दोनों के लिए Qwen3.6-27B का उपयोग किया, जिसमें प्रति कार्य एक H200 पर 10 बीज और 24 घंटे थे।
मार्कटेकपोस्ट की रिपोर्ट है कि दोनों आरपीएम वेरिएंट लगभग 15 घंटों में यादृच्छिक-चयन बेसलाइन तक पहुंच गए: केवल अनुमान के लिए 14.88 घंटे और एजेंटिक चयन के लिए 15.50 घंटे। लेख विनोग्रांडे पर 94.1% और एसवीएएमपी पर 95.7% के परिणामों की भी रिपोर्ट करता है, उन्हें नए अत्याधुनिक परिणाम के रूप में वर्णित करता है। ये आंकड़े और तुलनाएं आपूर्ति की गई रिपोर्ट के दावे हैं, स्वतंत्र रूप से पुष्टि किए गए परिणाम नहीं।
लेख में कहा गया है कि AIRA-डोजो स्कैफोल्ड और AIRS-बेंच ओपन सोर्स हैं और Qwen3.6-27B ओपन वेट के रूप में उपलब्ध है। यह सीधी पहुंच लिंक, लाइसेंसिंग शर्तें, होस्ट की गई सेवा, वाणिज्यिक समर्थन विवरण या मूल्य निर्धारण प्रदान नहीं करता है। आपूर्ति की गई सामग्री यह भी स्थापित नहीं करती है कि सिस्टम सामान्य उत्पादन उपयोग के लिए तैयार है।
स्रोत विवरण: marktechpost.com ↗
यह क्यों मायने रखता है?
यदि रिपोर्ट किए गए परिणाम सही रहते हैं, तो निष्पादन से पहले प्रयोगों का चयन एआई-सहायता प्राप्त अनुसंधान को अधिक गणना-कुशल बना सकता है। दृष्टिकोण एक व्यावहारिक बाधा को संबोधित करता है: अनुसंधान एजेंट कई उम्मीदवार प्रयोग उत्पन्न कर सकते हैं, लेकिन प्रत्येक का परीक्षण करना महंगा है। साक्ष्य रिपोर्ट किए गए बेंचमार्क तक ही सीमित है और आपूर्ति की गई सामग्री में इसकी स्वतंत्र रूप से पुष्टि नहीं की गई है।
रिपोर्ट किया गया कार्य केवल मॉडल के बेंचमार्क स्कोर में सुधार के बजाय एआई अनुसंधान में संसाधन-आवंटन समस्या को लक्षित करता है। एक एजेंट जो एक टीम की तुलना में अधिक विचार उत्पन्न कर सकता है, उसे परीक्षण करने के लिए एक विश्वसनीय तरीके की आवश्यकता होती है ताकि यह तय किया जा सके कि कौन से प्रयोग गणना के लायक हैं। इसलिए एक चयन परत अनुसंधान थ्रूपुट को प्रभावित कर सकती है, खासकर जहां प्रशिक्षण या मूल्यांकन चलने में घंटों या दिन लगते हैं।
रिपोर्ट की गई तुलना से पता चलता है कि उम्मीदवारों के बीच चयन करने से कुछ लाभ हुआ, क्योंकि प्रयोग ऑपरेटरों और आरपीएम के लिए समान Qwen3.6-27B बैकबोन का उपयोग किया गया था। मार्कटेकपोस्ट केवल अनुमान चयन के लिए 0.684 से 0.711 तक 6.0% की सापेक्ष वृद्धि और एजेंटिक चयन के लिए 6.6% की वृद्धि से 0.729 की रिपोर्ट करता है, लेकिन आपूर्ति किया गया लेख इसके घोषित आत्मविश्वास अंतराल से परे सांख्यिकीय मजबूती का आकलन करने के लिए पर्याप्त पद्धतिगत विवरण प्रदान नहीं करता है।
सार्थक सीमाएँ हैं. एआईआरएस-बेंच में 20 सार्वजनिक पाठ और सारणीबद्ध कार्य शामिल हैं, और प्रयोगों में एकल एच200 सेटअप का उपयोग किया गया है, इसलिए निष्कर्ष बड़े शोध कार्यक्रमों, अन्य हार्डवेयर या वैज्ञानिक डोमेन में स्थानांतरित नहीं हो सकते हैं। रिपोर्ट कोई स्वतंत्र प्रतिकृति, परिनियोजन मामले का अध्ययन या सबूत नहीं देती है कि दृष्टिकोण बेंचमार्क परिणामों के बजाय वास्तविक दुनिया की खोजों में सुधार करता है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
आगे क्या देखना है
अंतर्निहित कागज़, कोड और बेंचमार्क कलाकृतियों पर नज़र रखें; अतिरिक्त कार्यों पर प्रतिकृति; और इस बारे में साक्ष्य कि क्या लाभ विभिन्न मॉडलों, ऑपरेटरों, हार्डवेयर और अनुसंधान डोमेन के साथ बना रहता है। रिपोर्ट किए गए ओपन-सोर्स घटकों तक पहुंच का वर्णन किया गया है, लेकिन मूल्य निर्धारण, होस्ट की गई उपलब्धता और उत्पादन समर्थन का दस्तावेजीकरण नहीं किया गया है।
सबसे उपयोगी अगली जांच यह है कि क्या शोधकर्ता अंतर्निहित पेपर, कार्यान्वयन और मूल्यांकन लॉग प्रकाशित करते हैं, और क्या बाहरी टीमें रिपोर्ट किए गए स्कोर और समय की बचत को पुन: पेश करती हैं। आपूर्ति की गई रिपोर्ट ओपन-सोर्स घटकों की ओर इशारा करती है लेकिन उनकी उपलब्धता या उपयोगिता को स्वतंत्र रूप से सत्यापित नहीं करती है।
भविष्य के मूल्यांकन में विभिन्न रीढ़ मॉडल, उम्मीदवार-पीढ़ी के तरीकों, कार्य परिवारों और गणना बजट का परीक्षण करना चाहिए। रिपोर्ट किए गए एजेंटिक डिज़ाइन में छोटे पायलट प्रयोगों और जानबूझकर अतिरंजित शेष बजट का भी उपयोग किया जाता है, ऐसे विकल्प जो परिणामों को प्रभावित कर सकते हैं और सामान्य संसाधन लेखांकन के तहत परीक्षण के लायक हैं।
संभावित उपयोगकर्ताओं को रिपोर्ट किए गए टूल को अनुसंधान घटकों के रूप में मानना चाहिए, न कि एक दस्तावेज़ीकृत वाणिज्यिक उत्पाद के रूप में। स्रोत कोई कीमत, सेवा-स्तर की शर्तें, स्थापना आवश्यकताएँ या सामान्य-उपलब्धता विवरण नहीं देता है। यह यह भी नहीं दिखाता है कि क्या आरपीएम उन प्रयोगों को सुरक्षित रूप से संभाल सकता है जिनकी विफलताएं महंगी हैं या जिनकी सत्यापन मीट्रिक अविश्वसनीय हैं।
रिपोर्ट किए गए WinoGrande और SVAMP परिणाम उद्धृत पूर्व बेसलाइन के विरुद्ध सत्यापन की गारंटी देते हैं। लेख यह निर्धारित करने के लिए स्वतंत्र परीक्षण, विस्तृत सांख्यिकीय विवरण या पर्याप्त जानकारी प्रदान नहीं करता है कि वे लाभ कितने व्यापक रूप से सामान्य हैं।