क्या हुआ?
स्पेसएक्सएआई ने कोडिंग, एजेंटिक कार्यों और ज्ञान कार्य के उद्देश्य से फ्रंटियर मॉडल के रूप में 12 अगस्त को ग्रोक 4.6 जारी किया। कंपनी का कहना है कि मॉडल को लंबे, बहु-चरणीय कार्यों में प्रभावी बने रहने के लिए डिज़ाइन किया गया है: किसी अपरिचित विषय पर शोध करना, जानकारी का विश्लेषण करना, कोडबेस बदलना, और एक विचार को एक कार्यशील एप्लिकेशन या अन्य पॉलिश आर्टिफैक्ट में बदलना। रिलीज़ एक्सएआई एपीआई, ग्रोक बिल्ड, कर्सर और ओपनराउटर, वर्सेल और क्लाउडफ्लेयर सहित मॉडल गेटवे के माध्यम से उपलब्ध है। यह एक रोडमैप घोषणा के बजाय एक शिप किया गया उत्पाद है, हालांकि अब तक प्रकाशित अधिकांश प्रदर्शन साक्ष्य स्पेसएक्सएआई से ही आते हैं।
आधिकारिक एपीआई दस्तावेज़ मॉडल को `ग्रोक-4.6` के रूप में पहचानता है और इसे 500,000-टोकन संदर्भ विंडो देता है। यह टेक्स्ट और छवि इनपुट स्वीकार करता है और टेक्स्ट आउटपुट उत्पन्न करता है, बिना किसी निर्दिष्ट टेक्स्ट-आउटपुट सीमा के। डेवलपर्स निम्न, मध्यम, उच्च या xउच्च तर्क प्रयास का चयन कर सकते हैं। स्पेसएक्सएआई ने 200,000 प्रॉम्प्ट टोकन से नीचे $2 प्रति मिलियन इनपुट टोकन, $0.50 प्रति मिलियन कैश्ड इनपुट टोकन, और $6 प्रति मिलियन आउटपुट टोकन पर आधार मूल्य सूचीबद्ध किया है; उस सीमा से ऊपर के संकेतों की कीमत क्रमशः $4, $1, और $12 है। एक तेज़ संस्करण की कीमत आधार दरों से दोगुनी है। ये लॉन्च कीमतें और उत्पाद विनिर्देश हैं, विलंबता, उपलब्धता या कुल कार्यभार लागत की गारंटी नहीं।
स्पेसएक्सएआई का कहना है कि ग्रोक 4.6 को ग्रोक 4.5 की तुलना में लंबा पूरक प्रशिक्षण प्राप्त हुआ। कंपनी तर्क और उन्नत तकनीकी अवधारणाओं, उच्च गुणवत्ता वाले इंजीनियरिंग डेटा और ऑप्टिमाइज़र और प्रशिक्षण नुस्खा में बदलाव के लिए क्यूरेटेड मॉडल-जनरेटेड सामग्री का वर्णन करती है। इसके बाद इसने समस्याग्रस्त निशानों को फ़िल्टर करने वाले मॉडल-आधारित चेक के साथ तर्क सेटिंग्स, एजेंट हार्नेस, एसटीईएम, सॉफ्टवेयर इंजीनियरिंग और ज्ञान कार्य में पर्यवेक्षित फाइन-ट्यूनिंग प्रक्षेप पथ को पुनर्जीवित करने के लिए ग्रोक 4.5 का उपयोग किया। सुदृढीकरण-सीखने के वातावरण में कथित तौर पर सामान्य कोडिंग, ज्ञान कार्य, कर्नेल अनुकूलन, वेब विकास और कंप्यूटर-एडेड डिज़ाइन शामिल हैं। घोषणा में प्रशिक्षण प्रक्रिया को पुन: पेश करने के लिए किसी बाहरी समूह के लिए पैरामीटर गणना, प्रशिक्षण गणना, पूर्ण डेटा उद्गम, या पर्याप्त कार्यान्वयन विवरण का खुलासा नहीं किया गया है।
लॉन्च एक पृथक कोडिंग उत्तर के बजाय निरंतर कार्य और उत्पाद निर्माण पर जोर देता है। स्पेसएक्सएआई का कहना है कि आंतरिक परियोजनाओं ने ग्रोक 4.5 की तुलना में दृश्य और इंटरैक्टिव अनुप्रयोगों पर पहले मजबूत प्रदर्शन दिखाया, इसके बाद पुनरावृत्तीय शोधन और लंबे प्रक्षेप पथ पर अधिक आत्म-परीक्षण किया गया। यह इच्छित व्यवहार का एक उपयोगी विवरण है, लेकिन सार्वजनिक उदाहरण चयनित प्रदर्शन हैं। वे यह स्थापित नहीं करते हैं कि मॉडल कितनी बार अपनी त्रुटियों का पता लगाता है, क्या सत्यापन सूक्ष्म प्रतिगमन पकड़ता है, या जब किसी एजेंट के पास प्रतिबंधित उपकरण, अपूर्ण संदर्भ, एक बड़ी विरासत भंडार, या घंटों तक चलने वाला कार्य होता है तो प्रदर्शन कैसे बदलता है।
कंपनी 61 के आर्टिफिशियल एनालिसिस इंटेलिजेंस इंडेक्स स्कोर की रिपोर्ट करती है, जो जीपीटी-5.6 सोल के लिए सूचीबद्ध स्कोर से मेल खाता है और फैबल 5 मैक्स से एक अंक पीछे है। इसकी तालिका कर्सरबेंच 3.2 पर 69.9%, डीपएसडब्ल्यूई 1.1 पर 65.9%, फ्रंटियरकोड 1.1 एक्सटेंडेड पर 61.3%, एपेक्स-एजेंट्स पर 57.5% और टर्मिनल-बेंच 3.0 पर 26% की रिपोर्ट करती है। परिणाम सार्वभौमिक लीड के बजाय मिश्रित हैं: तालिका कई कोडिंग और टर्मिनल परीक्षणों पर अन्य मॉडलों को आगे रखती है। स्पेसएक्सएआई का कहना है कि तीसरे पक्ष के आंकड़े सर्वोत्तम स्व-रिपोर्ट किए गए या सार्वजनिक रूप से उपलब्ध परिणामों का उपयोग करते हैं, इसलिए हार्नेस, तर्क बजट और परीक्षण सेटिंग्स में अंतर महत्वपूर्ण सीमाएं बनी हुई हैं।
स्रोत विवरण: SpaceXAI's August 12 Grok 4.6 announcement and API documentation ↗
यह क्यों मायने रखता है?
ग्रोक 4.6 उन एजेंटों के इर्द-गिर्द तेजी से संगठित एक मॉडल दौड़ में शामिल हो गया है जो केवल एक संकेत का उत्तर देने के बजाय एक परियोजना को आगे बढ़ा सकता है। एक बड़ी संदर्भ विंडो, समायोज्य तर्क, उपकरण का उपयोग, और लंबे प्रक्षेप पथ पर प्रशिक्षण एक डेवलपर या छोटी टीम के लिए अनुसंधान, कोडिंग, परीक्षण और संशोधन के एक सीमित टुकड़े को सौंपना आसान बना सकता है। व्यावहारिक मूल्य एक लीडरबोर्ड स्थिति पर कम निर्भर करेगा, न कि इस बात पर कि क्या मॉडल आवश्यकताओं को संरक्षित कर सकता है, उपकरणों का सुरक्षित रूप से उपयोग कर सकता है, और ऐसे काम का उत्पादन कर सकता है जिसे कोई व्यक्ति निरीक्षण और सही कर सकता है।
सॉफ़्टवेयर टीमों के लिए, निरंतरता केंद्रीय उत्पाद दावा है। लंबे समय से चल रहे एजेंटों को वास्तु संबंधी बाधाओं को याद रखना चाहिए, एक सत्र में पहले किए गए परिवर्तनों को समझना चाहिए, सही काम को पूर्ववत करने से बचना चाहिए और यह सत्यापित करना चाहिए कि एक फिक्स सिस्टम के दूसरे हिस्से को नहीं तोड़ता है। 500,000-टोकन विंडो मॉडल को अधिक रिपॉजिटरी संदर्भ और टूल इतिहास के लिए जगह देती है, लेकिन संदर्भ क्षमता भरोसेमंद रिकॉल या तर्क के समान नहीं है। बड़े संकेतों में अप्रासंगिक या विरोधाभासी सामग्री शामिल हो सकती है, xAI की 200,000-टोकन मूल्य निर्धारण सीमा से अधिक लागत हो सकती है, और अभी भी एक फ़ाइल या आवश्यकता शामिल नहीं हो सकती है जो सही उत्तर निर्धारित करती है।
प्रशिक्षण विवरण से यह भी पता चलता है कि सीमांत प्रयोगशालाएँ बाद के मॉडलों के निर्माण और फ़िल्टर प्रक्षेपवक्र के लिए पहले के मॉडल का उपयोग कैसे कर रही हैं। कई तर्क प्रयासों और एजेंट हार्नेस में पर्यवेक्षित उदाहरणों को पुनर्जीवित करने से मॉडल और उस वातावरण के बीच स्थिरता में सुधार हो सकता है जिसमें यह काम करेगा। यह त्रुटि वंशानुक्रम और मूल्यांकन स्वतंत्रता के बारे में अनुत्तरित प्रश्न भी उठाता है। यदि एक मॉडल प्रशिक्षण निशान बनाता है और मॉडल-आधारित जांच यह तय करती है कि कौन से निशान जीवित रहते हैं, तो डेवलपर्स को सबूत की आवश्यकता होती है कि परिणामी प्रणाली उन्हीं स्वचालित न्यायाधीशों को संतुष्ट करने में बेहतर नहीं हो रही है, जबकि उन अंधा स्थानों को बरकरार रखा जा रहा है जो न्यायाधीश चूक गए हैं।
एपीआई, कर्सर, ग्रोक बिल्ड और गेटवे पर उपलब्धता मौजूदा वर्कफ़्लो में रिलीज़ के परीक्षण के घर्षण को कम करती है। एक सप्ताह के लिए कर्सर और ग्रोक बिल्ड में शामिल उपयोग के दोगुने की प्रारंभिक पेशकश वास्तविक दुनिया के परीक्षणों में तेजी ला सकती है। टीमों को अभी भी केवल टोकन कीमतों के बजाय कुल कार्य लागत, पूरा होने का समय, सुधार प्रयास और विफलता पुनर्प्राप्ति की तुलना करनी चाहिए। तेज़ संस्करण इंटरैक्टिव कार्य में मदद कर सकता है, लेकिन प्रति-टोकन मूल्य को दोगुना करने से एक समझौता होता है जिसे केवल कार्य-स्तरीय परीक्षण ही हल कर सकता है। एक धीमा मॉडल जो पहले प्रयास में सही ढंग से पूरा होता है वह तेज़ मॉडल की तुलना में सस्ता हो सकता है जिसे बार-बार मरम्मत की आवश्यकता होती है।
सार्वजनिक हित की सीमा कोडिंग प्रदर्शन जितनी ही महत्वपूर्ण है। फ़ाइलों, ब्राउज़रों, टर्मिनलों या व्यावसायिक प्रणालियों पर काम करने वाला एक एजेंट पारंपरिक चैटबॉट उत्तर की तुलना में गलत धारणा को आगे बढ़ा सकता है। स्पेसएक्सएआई का कहना है कि ग्रोक 4.6 को अपना सबसे व्यापक पूर्व-तैनाती परीक्षण सूट और विस्तारित पोस्ट-तैनाती और तृतीय-पक्ष परीक्षण प्राप्त हुआ, लेकिन घोषणा केवल उच्च-स्तरीय सुरक्षा विवरण प्रदान करती है। यह प्रत्येक डोमेन के लिए एक विस्तृत सिस्टम कार्ड, अलग-अलग इनकार और दुरुपयोग के परिणाम, घटना सीमा या साक्ष्य प्रकाशित नहीं करता है, जिसमें कंपनी कहती है कि सुरक्षा उपायों को कैलिब्रेट किया गया था। उपयोगकर्ताओं को पूर्ण दस्तावेज़ीकरण और स्वतंत्र परीक्षण के लंबित रहने तक सुरक्षा भाषा को विक्रेता के दावे के रूप में मानना चाहिए।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
What most distinguishes an AI agent from a basic chatbot?
आगे क्या देखना है
निर्णायक साक्ष्य प्रक्षेपण के बाद पुनरुत्पादित परीक्षणों और सामान्य परियोजनाओं से आएंगे। देखें कि क्या ग्रोक 4.6 लंबे कार्यों को बिना रुके पूरा कर सकता है, क्या इसका स्व-परीक्षण वास्तविक दोष पकड़ता है, बड़े संदर्भों और पुनः प्रयास के साथ इसकी लागत कैसे बदलती है, और क्या स्पेसएक्सएआई दावों का निरीक्षण करने के लिए बाहरी लोगों के लिए पर्याप्त सुरक्षा और मूल्यांकन विवरण प्रकाशित करता है। शीघ्र उपलब्धता सार्थक है; भरोसेमंद स्वायत्तता एक अनुभवजन्य प्रश्न बनी हुई है।
सबसे पहले, मेल खाती परिस्थितियों में मॉडल की तुलना करें। स्वतंत्र मूल्यांकनकर्ताओं को ग्रोक 4.6 की तुलना ग्रोक 4.5 और प्रतिस्पर्धी प्रणालियों से करते समय एजेंट हार्नेस, टूल्स, रिपॉजिटरी स्नैपशॉट, समय सीमा, टोकन बजट और तर्क प्रयास को स्थिर रखना चाहिए। एक उपयोगी रिपोर्ट में पूर्ण किए गए कार्य, आंशिक सफलताएं, प्रतिगमन, अमान्य टूल कॉल, मानवीय हस्तक्षेप, दीवार-घड़ी का समय और कुल लागत शामिल होनी चाहिए। एक एकल बेंचमार्क प्रतिशत यह नहीं दिखा सकता है कि क्या विफलताओं को सुधारना आसान है या क्या कोई एजेंट उत्तीर्ण परीक्षा परिणाम प्राप्त करते समय चुपचाप असंबंधित फ़ाइलों को बदल देता है।
दूसरा, सिस्टम प्रश्न के रूप में लंबे-संदर्भ दावे का परीक्षण करें। डेवलपर्स को रिपॉजिटरी आकार और संदर्भ गुणवत्ता को अलग-अलग करना चाहिए, फिर मापना चाहिए कि क्या मॉडल सही बाधाओं को पुनः प्राप्त करता है, संघनन के माध्यम से एक योजना बनाए रखता है, और प्रक्षेपवक्र में पहले पेश किए गए विरोधाभासों को नोटिस करता है। दस्तावेज़ एक त्वरित कैश कुंजी की अनुशंसा करता है ताकि अनुरोध लगातार रूट हो और कैश हिट विश्वसनीय रहे, और यह संदर्भ संघनन की ओर लंबे लूप को इंगित करता है। वे सुविधाएँ अर्थशास्त्र और निरंतरता में सुधार कर सकती हैं, लेकिन टीमों को इस बात पर नज़र रखने की ज़रूरत है कि संघनन क्या हटाता है और क्या कैश्ड वार्तालाप अंतर्निहित परियोजना में बदलाव के बाद अप्रचलित धारणाओं को संरक्षित करता है।
तीसरा, पूर्ण सुरक्षा प्रकटीकरण की तलाश करें। स्पेसएक्सएआई का कहना है कि इसके सुरक्षा उपाय व्यापक पूर्व-तैनाती, पोस्ट-तैनाती और तीसरे पक्ष के परीक्षण के साथ वैध भेद्यता पैचिंग, इंजीनियरिंग डिजाइन और एआई अनुसंधान को कवर करते हैं। अगला उपयोगी प्रकाशन खतरे के मॉडल, मूल्यांकन सेट, पास सीमा, उच्च जोखिम क्षमता, ज्ञात विफलता मोड और मॉडल और उत्पाद दोनों स्तरों पर शमन की पहचान करेगा। इसे इस बात में अंतर करना चाहिए कि बेस मॉडल ने ग्रोक बिल्ड, कर्सर, एक एपीआई गेटवे, या ग्राहक के स्वयं के सैंडबॉक्स से क्या सीखा है। उस पृथक्करण के बिना, उपयोगकर्ता यह नहीं बता सकते कि कौन सी सुरक्षा संपत्ति मॉडल के साथ यात्रा करती है और कौन सी आसपास के एप्लिकेशन पर निर्भर करती है।
अंत में, लॉन्च-सप्ताह के प्रोत्साहनों से परे अपनाए जाने पर नज़र रखें। कर्सर और ग्रोक बिल्ड उपयोगकर्ता ग्रोक 4.6 का तुरंत परीक्षण कर सकते हैं, जबकि एपीआई ग्राहक सामान्य या तेज़ अनुमान चुन सकते हैं। निरंतर उपयोग, सार्वजनिक पोस्टमॉर्टम और कार्य-स्तरीय तुलनाएं दिखाएंगी कि मॉडल के मजबूत इंटरैक्टिव फर्स्ट पास रखरखाव योग्य सॉफ़्टवेयर और उपयोगी शोध कलाकृतियों में तब्दील होते हैं या नहीं। स्पेसएक्सएआई ने ठोस विशिष्टताओं के साथ एक नया सामग्री विकल्प भेजा है। जो अज्ञात है वह यह है कि यह गन्दे उत्पादन वातावरण में स्वायत्त कार्य को कितनी मज़बूती से बनाए रखता है, जहाँ अनुमतियाँ, अधूरी आवश्यकताएँ, बदलती फ़ाइलें और मानव समीक्षा उतनी ही मायने रखती है जितनी कि कच्ची बेंचमार्क क्षमता।