क्या हुआ?
मार्टिन सिड मैगज़ीन की रिपोर्ट है कि OpenAI और Nvidia के सीईओ जेन्सेन हुआंग ने सार्वजनिक रूप से OpenAI के एस्ट्रा मॉडल को सबूत के तौर पर पेश किया कि कृत्रिम सामान्य बुद्धिमत्ता आ गई है। आउटलेट का कहना है कि OpenAI ने ARC-AGI-3 पर 99.9% स्कोर दर्ज किया, जबकि बेंचमार्क संगठन के संदर्भ हार्नेस ने उसी मॉडल के लिए 62.7% का उत्पादन किया। स्रोत किसी भी परिणाम या एस्ट्रा की उपलब्धता की स्वतंत्र पुष्टि प्रदान नहीं करता है।
मार्टिन सिड मैगज़ीन की रिपोर्ट है कि जेन्सेन हुआंग ने 6 सितंबर को पोस्ट किया था कि ChatGPT से o1 से एस्ट्रा तक प्रगति के बाद "एजीआई आ गया है"। आउटलेट का कहना है कि OpenAI के अध्यक्ष ग्रेग ब्रॉकमैन ने तीन दिन पहले इसी तरह की "एजीआई युग" भाषा का इस्तेमाल किया था। ये विवरण नामित आउटलेट के खाते से संबंधित हैं; आपूर्ति की गई सामग्री स्वतंत्र रूप से पोस्ट को सत्यापित नहीं करती है या प्राथमिक बयानों के लिंक प्रदान नहीं करती है।
केंद्रीय रिपोर्ट में विसंगति ARC-AGI-3 से संबंधित है। मार्टिन सिड मैगज़ीन के अनुसार, OpenAI ने कहा कि एस्ट्रा ने बेंचमार्क पर 99.9% स्कोर किया, साथ ही फ्रंटियरमैथ टियर 4 पर 98% स्कोर दर्ज किया। आउटलेट का कहना है कि ARC-AGI-3 संगठन के मानक मूल्यांकन हार्नेस ने इसके बजाय 62.7% स्कोर उत्पन्न किया। मार्टिन सिड इस अंतर का श्रेय अलग-अलग मूल्यांकन प्रोटोकॉल को देते हैं और कहते हैं कि बेंचमार्क निर्माता अपनी संदर्भ स्थिति को तुलना के लिए वैध आधार मानते हैं। आपूर्ति किया गया स्रोत स्वतंत्र रूप से स्कोर, परीक्षण स्थितियों या कार्यप्रणाली की पुष्टि नहीं करता है।
लेख का तर्क है कि 62.7% अभी भी एक मजबूत परिणाम का प्रतिनिधित्व करेगा, लेकिन कहता है कि उच्च बेंचमार्क स्कोर से "एजीआई आ गया है" घोषणा की ओर बढ़ने के लिए एजीआई की एक सहमत परिभाषा की आवश्यकता है। यह रिपोर्ट करता है कि प्रकाशन के समय तक एस्ट्रा आर्टिफिशियल एनालिसिस के इंटेलिजेंस इंडेक्स या Arena.ai रैंकिंग में दिखाई नहीं दे रहा था, जबकि यह ध्यान दिया गया कि उन प्रणालियों की अनुपस्थिति खराब प्रदर्शन का प्रमाण नहीं है। ये आउटलेट की रिपोर्ट की गई टिप्पणियां और व्याख्याएं हैं, आपूर्ति की गई सामग्री में स्वतंत्र रूप से स्थापित निष्कर्ष नहीं हैं।
यह क्यों मायने रखता है?
रिपोर्ट किया गया अंतर बताता है कि बेंचमार्क परिणामों को मूल्यांकन प्रोटोकॉल से अलग क्यों नहीं किया जा सकता है, और कंपनी की एजीआई की परिभाषा को कंपनी के बाहर क्यों स्वीकार नहीं किया जा सकता है। आंतरिक मूल्यांकन के आधार पर व्यापक रूप से प्रसारित एजीआई घोषणा बाहरी सत्यापन अधूरा होने पर भी निवेश, बुनियादी ढांचे के खर्च, नीतिगत बहस और सार्वजनिक अपेक्षाओं को प्रभावित कर सकती है। स्रोत ने हुआंग के बयान को Nvidia द्वारा एस्ट्रा को प्रशिक्षित करने के लिए उपयोग किए जाने वाले चिप्स की आपूर्ति के व्यावसायिक संदर्भ में भी रखा है, जबकि गलत काम का कोई सबूत नहीं दिया है।
एक बेंचमार्क स्कोर केवल परीक्षण संस्करण, हार्नेस, पहुंच की स्थिति और इसे तैयार करने के लिए उपयोग किए जाने वाले स्कोरिंग नियमों के संबंध में सार्थक है। OpenAI के परिणाम और बेंचमार्क संगठन के संदर्भ परिणाम के बीच रिपोर्ट किया गया 37.2-प्रतिशत-बिंदु अंतर इस बात से स्वतंत्र रूप से मायने रखता है कि दोनों में से किसी भी संख्या को अंततः संशोधित किया गया है या नहीं। पाठकों को तुलनीय बाहरी परीक्षण के बिना उच्च आंकड़े को क्षेत्र-व्यापी माप के रूप में नहीं मानना चाहिए।
रिपोर्ट एक परिभाषात्मक समस्या को भी उजागर करती है। एजीआई एक सार्वभौमिक रूप से स्वीकृत सीमा द्वारा शासित नहीं है, इसलिए एक कंपनी यह स्थापित किए बिना एक आंतरिक मील के पत्थर तक पहुंच सकती है कि व्यापक अनुसंधान समुदाय उसी मील के पत्थर को पहचान लेगा। मार्टिन सिड घोषणाओं को संभावित परिणामी बाजार संदेश के रूप में प्रस्तुत करता है, खासकर क्योंकि यह रिपोर्ट करता है कि एस्ट्रा को Nvidia हार्डवेयर पर प्रशिक्षित किया गया था और हुआंग ने सार्वजनिक रूप से OpenAI को बधाई दी थी। स्रोत इस बात का कोई सबूत नहीं देता कि बयान जानबूझकर गुमराह करने वाले थे।
यदि खाता सटीक है, तो व्यावहारिक निहितार्थ यह है कि ग्राहकों, निवेशकों और नीति निर्माताओं को उत्पाद क्षमता के दावों को स्वतंत्र रूप से प्रतिलिपि प्रस्तुत करने योग्य साक्ष्य से अलग करना चाहिए। आपूर्ति किया गया स्रोत एजीआई द्वारा निहित कार्यों की विस्तृत श्रृंखला में एस्ट्रा की वास्तविक दुनिया की विश्वसनीयता, सामान्य उपलब्धता, मूल्य निर्धारण, सुरक्षा प्रदर्शन या उपयोगिता स्थापित नहीं करता है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
आगे क्या देखना है
ARC-AGI-3 रचनाकारों द्वारा पुनरुत्पादित संदर्भ-हार्नेस परिणाम को प्रकाशित या पुष्टि करने के लिए, OpenAI के लिए अपनी मूल्यांकन पद्धति का खुलासा करने के लिए, और एस्ट्रा के स्वतंत्र मूल्यांकन के प्रकट होने के लिए प्रतीक्षा करें। आपूर्ति किया गया स्रोत यह स्थापित नहीं करता है कि एस्ट्रा आम तौर पर उपलब्ध है, चयनित ग्राहकों तक ही सीमित है, या किसी विशेष कीमत पर पेश की जाती है। यह एजीआई की क्षेत्र-व्यापी परिभाषा भी स्थापित नहीं करता है।
सबसे महत्वपूर्ण अगला साक्ष्य बेंचमार्क क्रिएटर्स रेफरेंस हार्नेस के तहत एक सार्वजनिक एआरसी-एजीआई-3 मूल्यांकन होगा, जिसमें स्वतंत्र पुनरुत्पादन के लिए पर्याप्त पद्धतिगत विवरण होगा। OpenAI की ओर से एक प्रतिक्रिया यह बताती है कि इसके आंतरिक दोहन ने भौतिक रूप से भिन्न परिणाम क्यों उत्पन्न किया, यह भी स्पष्ट करेगा कि क्या अंतर संकेत, उपकरण पहुंच, कार्य चयन, स्कोरिंग या किसी अन्य प्रोटोकॉल अंतर को दर्शाता है।
स्वतंत्र रैंकिंग और परीक्षण प्रणालियाँ एस्ट्रा की क्षमताओं के बारे में अतिरिक्त सबूत प्रदान कर सकती हैं, लेकिन लेख की प्रकाशन तिथि पर उनकी अनुपस्थिति को नकारात्मक परिणाम नहीं माना जाना चाहिए। स्रोत यह नहीं बताता है कि वे सिस्टम एस्ट्रा का मूल्यांकन कब कर सकते हैं या क्या उनके पास मॉडल तक पहुंच है।
स्रोत किसी पुष्ट पहुंच मार्ग या कीमत की पहचान नहीं करता है। यह यह भी स्थापित नहीं करता है कि क्या OpenAI ने AGI भाषा के आधार पर औपचारिक रूप से अपने उत्पाद की स्थिति, दस्तावेज़ीकरण या नीति को बदल दिया है। वे व्यावहारिक विवरण अज्ञात हैं और आम सहमति से एस्ट्रा को आम तौर पर उपलब्ध या एजीआई के रूप में वर्णित करने से पहले सत्यापित किया जाना चाहिए।