समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

मार्टिन सिड ने OpenAI के एस्ट्रा के लिए एक विवादित एजीआई दावे की रिपोर्ट दी

मार्टिन सिड मैगज़ीन की रिपोर्ट है कि OpenAI ने एस्ट्रा को AGI के रूप में तैयार किया है, जबकि बेंचमार्क के संदर्भ मूल्यांकन ने इसे 62.7% स्कोर दिया है, जो OpenAI के रिपोर्ट किए गए 99.9% परिणाम से काफी कम है। आपूर्ति किए गए स्रोत से खाते की स्वतंत्र रूप से पुष्टि नहीं की गई है।

4 min readRead the linked source
Source-provided image accompanying Martin Cid reports a disputed AGI claim for OpenAI’s Astra
स्रोत संदर्भस्रोत रिकार्ड किया गया
प्रकाशक
martincid.com
स्रोत लिंक
martincid.comhttps://www.martincid.com/technology-sv/jensen-huang-agi-claim-benchmark-gap/
स्रोत प्रकार
लिंक्ड स्रोत - प्राथमिक-स्रोत स्थिति स्थापित नहीं की गई है।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

एजीआई (आर्टिफिशियल जनरल इंटेलिजेंस)
एक काल्पनिक एआई प्रणाली जो कई डोमेन में मानवीय स्तर पर अधिकांश बौद्धिक कार्य कर सकती है।
बेंचमार्क
मॉडल प्रदर्शन को मापने और तुलना करने के लिए उपयोग किया जाने वाला एक मानकीकृत परीक्षण या डेटासेट।
स्वयं की जांच करोएआई क्या है? प्रश्नोत्तरी

क्या हुआ?

मार्टिन सिड मैगज़ीन की रिपोर्ट है कि OpenAI और Nvidia के सीईओ जेन्सेन हुआंग ने सार्वजनिक रूप से OpenAI के एस्ट्रा मॉडल को सबूत के तौर पर पेश किया कि कृत्रिम सामान्य बुद्धिमत्ता आ गई है। आउटलेट का कहना है कि OpenAI ने ARC-AGI-3 पर 99.9% स्कोर दर्ज किया, जबकि बेंचमार्क संगठन के संदर्भ हार्नेस ने उसी मॉडल के लिए 62.7% का उत्पादन किया। स्रोत किसी भी परिणाम या एस्ट्रा की उपलब्धता की स्वतंत्र पुष्टि प्रदान नहीं करता है।

मार्टिन सिड मैगज़ीन की रिपोर्ट है कि जेन्सेन हुआंग ने 6 सितंबर को पोस्ट किया था कि ChatGPT से o1 से एस्ट्रा तक प्रगति के बाद "एजीआई आ गया है"। आउटलेट का कहना है कि OpenAI के अध्यक्ष ग्रेग ब्रॉकमैन ने तीन दिन पहले इसी तरह की "एजीआई युग" भाषा का इस्तेमाल किया था। ये विवरण नामित आउटलेट के खाते से संबंधित हैं; आपूर्ति की गई सामग्री स्वतंत्र रूप से पोस्ट को सत्यापित नहीं करती है या प्राथमिक बयानों के लिंक प्रदान नहीं करती है।

केंद्रीय रिपोर्ट में विसंगति ARC-AGI-3 से संबंधित है। मार्टिन सिड मैगज़ीन के अनुसार, OpenAI ने कहा कि एस्ट्रा ने बेंचमार्क पर 99.9% स्कोर किया, साथ ही फ्रंटियरमैथ टियर 4 पर 98% स्कोर दर्ज किया। आउटलेट का कहना है कि ARC-AGI-3 संगठन के मानक मूल्यांकन हार्नेस ने इसके बजाय 62.7% स्कोर उत्पन्न किया। मार्टिन सिड इस अंतर का श्रेय अलग-अलग मूल्यांकन प्रोटोकॉल को देते हैं और कहते हैं कि बेंचमार्क निर्माता अपनी संदर्भ स्थिति को तुलना के लिए वैध आधार मानते हैं। आपूर्ति किया गया स्रोत स्वतंत्र रूप से स्कोर, परीक्षण स्थितियों या कार्यप्रणाली की पुष्टि नहीं करता है।

लेख का तर्क है कि 62.7% अभी भी एक मजबूत परिणाम का प्रतिनिधित्व करेगा, लेकिन कहता है कि उच्च बेंचमार्क स्कोर से "एजीआई आ गया है" घोषणा की ओर बढ़ने के लिए एजीआई की एक सहमत परिभाषा की आवश्यकता है। यह रिपोर्ट करता है कि प्रकाशन के समय तक एस्ट्रा आर्टिफिशियल एनालिसिस के इंटेलिजेंस इंडेक्स या Arena.ai रैंकिंग में दिखाई नहीं दे रहा था, जबकि यह ध्यान दिया गया कि उन प्रणालियों की अनुपस्थिति खराब प्रदर्शन का प्रमाण नहीं है। ये आउटलेट की रिपोर्ट की गई टिप्पणियां और व्याख्याएं हैं, आपूर्ति की गई सामग्री में स्वतंत्र रूप से स्थापित निष्कर्ष नहीं हैं।

स्रोत विवरण: martincid.com ↗

यह क्यों मायने रखता है?

रिपोर्ट किया गया अंतर बताता है कि बेंचमार्क परिणामों को मूल्यांकन प्रोटोकॉल से अलग क्यों नहीं किया जा सकता है, और कंपनी की एजीआई की परिभाषा को कंपनी के बाहर क्यों स्वीकार नहीं किया जा सकता है। आंतरिक मूल्यांकन के आधार पर व्यापक रूप से प्रसारित एजीआई घोषणा बाहरी सत्यापन अधूरा होने पर भी निवेश, बुनियादी ढांचे के खर्च, नीतिगत बहस और सार्वजनिक अपेक्षाओं को प्रभावित कर सकती है। स्रोत ने हुआंग के बयान को Nvidia द्वारा एस्ट्रा को प्रशिक्षित करने के लिए उपयोग किए जाने वाले चिप्स की आपूर्ति के व्यावसायिक संदर्भ में भी रखा है, जबकि गलत काम का कोई सबूत नहीं दिया है।

एक बेंचमार्क स्कोर केवल परीक्षण संस्करण, हार्नेस, पहुंच की स्थिति और इसे तैयार करने के लिए उपयोग किए जाने वाले स्कोरिंग नियमों के संबंध में सार्थक है। OpenAI के परिणाम और बेंचमार्क संगठन के संदर्भ परिणाम के बीच रिपोर्ट किया गया 37.2-प्रतिशत-बिंदु अंतर इस बात से स्वतंत्र रूप से मायने रखता है कि दोनों में से किसी भी संख्या को अंततः संशोधित किया गया है या नहीं। पाठकों को तुलनीय बाहरी परीक्षण के बिना उच्च आंकड़े को क्षेत्र-व्यापी माप के रूप में नहीं मानना ​​चाहिए।

रिपोर्ट एक परिभाषात्मक समस्या को भी उजागर करती है। एजीआई एक सार्वभौमिक रूप से स्वीकृत सीमा द्वारा शासित नहीं है, इसलिए एक कंपनी यह स्थापित किए बिना एक आंतरिक मील के पत्थर तक पहुंच सकती है कि व्यापक अनुसंधान समुदाय उसी मील के पत्थर को पहचान लेगा। मार्टिन सिड घोषणाओं को संभावित परिणामी बाजार संदेश के रूप में प्रस्तुत करता है, खासकर क्योंकि यह रिपोर्ट करता है कि एस्ट्रा को Nvidia हार्डवेयर पर प्रशिक्षित किया गया था और हुआंग ने सार्वजनिक रूप से OpenAI को बधाई दी थी। स्रोत इस बात का कोई सबूत नहीं देता कि बयान जानबूझकर गुमराह करने वाले थे।

यदि खाता सटीक है, तो व्यावहारिक निहितार्थ यह है कि ग्राहकों, निवेशकों और नीति निर्माताओं को उत्पाद क्षमता के दावों को स्वतंत्र रूप से प्रतिलिपि प्रस्तुत करने योग्य साक्ष्य से अलग करना चाहिए। आपूर्ति किया गया स्रोत एजीआई द्वारा निहित कार्यों की विस्तृत श्रृंखला में एस्ट्रा की वास्तविक दुनिया की विश्वसनीयता, सामान्य उपलब्धता, मूल्य निर्धारण, सुरक्षा प्रदर्शन या उपयोगिता स्थापित नहीं करता है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
What is AI? Quiz

A route planner searches possible journeys using explicit rules. What does this illustrate about AI?

आगे क्या देखना है

ARC-AGI-3 रचनाकारों द्वारा पुनरुत्पादित संदर्भ-हार्नेस परिणाम को प्रकाशित या पुष्टि करने के लिए, OpenAI के लिए अपनी मूल्यांकन पद्धति का खुलासा करने के लिए, और एस्ट्रा के स्वतंत्र मूल्यांकन के प्रकट होने के लिए प्रतीक्षा करें। आपूर्ति किया गया स्रोत यह स्थापित नहीं करता है कि एस्ट्रा आम तौर पर उपलब्ध है, चयनित ग्राहकों तक ही सीमित है, या किसी विशेष कीमत पर पेश की जाती है। यह एजीआई की क्षेत्र-व्यापी परिभाषा भी स्थापित नहीं करता है।

सबसे महत्वपूर्ण अगला साक्ष्य बेंचमार्क क्रिएटर्स रेफरेंस हार्नेस के तहत एक सार्वजनिक एआरसी-एजीआई-3 मूल्यांकन होगा, जिसमें स्वतंत्र पुनरुत्पादन के लिए पर्याप्त पद्धतिगत विवरण होगा। OpenAI की ओर से एक प्रतिक्रिया यह बताती है कि इसके आंतरिक दोहन ने भौतिक रूप से भिन्न परिणाम क्यों उत्पन्न किया, यह भी स्पष्ट करेगा कि क्या अंतर संकेत, उपकरण पहुंच, कार्य चयन, स्कोरिंग या किसी अन्य प्रोटोकॉल अंतर को दर्शाता है।

स्वतंत्र रैंकिंग और परीक्षण प्रणालियाँ एस्ट्रा की क्षमताओं के बारे में अतिरिक्त सबूत प्रदान कर सकती हैं, लेकिन लेख की प्रकाशन तिथि पर उनकी अनुपस्थिति को नकारात्मक परिणाम नहीं माना जाना चाहिए। स्रोत यह नहीं बताता है कि वे सिस्टम एस्ट्रा का मूल्यांकन कब कर सकते हैं या क्या उनके पास मॉडल तक पहुंच है।

स्रोत किसी पुष्ट पहुंच मार्ग या कीमत की पहचान नहीं करता है। यह यह भी स्थापित नहीं करता है कि क्या OpenAI ने AGI भाषा के आधार पर औपचारिक रूप से अपने उत्पाद की स्थिति, दस्तावेज़ीकरण या नीति को बदल दिया है। वे व्यावहारिक विवरण अज्ञात हैं और आम सहमति से एस्ट्रा को आम तौर पर उपलब्ध या एजीआई के रूप में वर्णित करने से पहले सत्यापित किया जाना चाहिए।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई क्या है?एआई मॉडल की व्याख्याट्रांसफार्मरआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?