کیا ہوا؟
SpaceXAI نے Grok 4.6 کو 12 اگست کو ایک فرنٹیئر ماڈل کے طور پر جاری کیا جس کا مقصد کوڈنگ، ایجنٹی کاموں، اور علمی کام ہے۔ کمپنی کا کہنا ہے کہ ماڈل کو طویل عرصے تک، ملٹی سٹیپ ملازمتوں میں موثر رہنے کے لیے ڈیزائن کیا گیا ہے: کسی ناواقف موضوع پر تحقیق کرنا، معلومات کا تجزیہ کرنا، کوڈ بیس کو تبدیل کرنا، اور آئیڈیا کو ورکنگ ایپلی کیشن یا دیگر پالش آرٹفیکٹ میں تبدیل کرنا۔ ریلیز xAI API، Grok Build، Cursor، اور ماڈل گیٹ ویز بشمول OpenRouter، Vercel، اور Cloudflare کے ذریعے دستیاب ہے۔ یہ روڈ میپ کے اعلان کے بجائے ایک بھیجی گئی پروڈکٹ ہے، حالانکہ اب تک شائع ہونے والے زیادہ تر کارکردگی کے ثبوت خود SpaceXAI سے آتے ہیں۔
سرکاری API دستاویزات ماڈل کی شناخت `grok-4.6` کے طور پر کرتی ہے اور اسے 500,000 ٹوکن سیاق و سباق کی ونڈو دیتی ہے۔ یہ ٹیکسٹ اور امیج ان پٹ کو قبول کرتا ہے اور ٹیکسٹ آؤٹ پٹ تیار کرتا ہے، جس میں ٹیکسٹ آؤٹ پٹ کی کوئی حد نہیں بتائی گئی ہے۔ ڈویلپر کم، درمیانے، اعلی، یا اعلیٰ استدلال کی کوشش کو منتخب کر سکتے ہیں۔ SpaceXAI 200,000 سے کم پرامپٹ ٹوکنز کی بنیاد پر $2 فی ملین ان پٹ ٹوکن، $0.50 فی ملین کیشڈ ان پٹ ٹوکنز، اور $6 فی ملین آؤٹ پٹ ٹوکنز کی فہرست دیتا ہے۔ اس حد سے اوپر کے اشارے کی قیمت بالترتیب $4، $1، اور $12 ہے۔ تیز رفتار قسم کی قیمت بنیادی شرحوں سے دوگنا ہے۔ یہ لانچ کی قیمتیں اور مصنوعات کی وضاحتیں ہیں، تاخیر، دستیابی، یا کام کے بوجھ کی کل لاگت کی ضمانت نہیں۔
SpaceXAI کا کہنا ہے کہ Grok 4.6 نے Grok 4.5 کے مقابلے میں طویل اضافی تربیت حاصل کی۔ کمپنی استدلال اور جدید تکنیکی تصورات، اعلیٰ معیار کے انجینئرنگ ڈیٹا، اور اصلاح کار اور تربیتی ترکیب میں تبدیلیوں کے لیے تیار کردہ ماڈل سے تیار کردہ مواد کی وضاحت کرتی ہے۔ اس کے بعد اس نے Grok 4.5 کا استعمال ریجنریٹنگ سیٹنگز، ایجنٹ ہارنیسز، STEM، سافٹ ویئر انجینئرنگ، اور نالج ورک میں نگرانی شدہ فائن ٹیوننگ ٹریجیکٹریز کو دوبارہ تخلیق کرنے کے لیے کیا، جس میں ماڈل پر مبنی چیکس فلٹرنگ مشکل نشانات کے ساتھ۔ کمک سیکھنے کے ماحول میں مبینہ طور پر عام کوڈنگ، نالج ورک، کرنل آپٹیمائزیشن، ویب ڈویلپمنٹ، اور کمپیوٹر ایڈیڈ ڈیزائن شامل ہیں۔ اعلان پیرامیٹر کی گنتی، ٹریننگ کمپیوٹ، مکمل ڈیٹا پرووینس، یا تربیتی عمل کو دوبارہ پیش کرنے کے لیے کسی بیرونی گروپ کے لیے عمل درآمد کی کافی تفصیلات کا انکشاف نہیں کرتا ہے۔
لانچ ایک الگ تھلگ کوڈنگ جواب کے بجائے مستقل کام اور مصنوعات کی تخلیق پر زور دیتا ہے۔ SpaceXAI کا کہنا ہے کہ اندرونی منصوبوں نے Grok 4.5 کے مقابلے بصری اور انٹرایکٹو ایپلی کیشنز پر پہلے زیادہ مضبوط پاس دکھائے، اس کے بعد تکراری تطہیر اور لمبے راستے پر زیادہ خود جانچ۔ یہ مطلوبہ رویے کی ایک مفید وضاحت ہے، لیکن عوامی مثالیں منتخب مظاہرے ہیں۔ وہ اس بات کا تعین نہیں کرتے ہیں کہ ماڈل کتنی بار اپنی غلطیوں کا پتہ لگاتا ہے، آیا توثیق ٹھیک ٹھیک ریگریشنز کو پکڑتی ہے، یا جب کسی ایجنٹ کے پاس محدود ٹولز، نامکمل سیاق و سباق، ایک بڑا میراثی ذخیرہ، یا کوئی کام جو گھنٹوں تک چلتا ہے تو کارکردگی کیسے بدلتی ہے۔
کمپنی نے 61 کا مصنوعی تجزیہ انٹیلی جنس انڈیکس اسکور رپورٹ کیا، جو اس نے GPT-5.6 Sol کے لیے درج کردہ اسکور سے مماثل ہے اور Fable 5 Max سے ایک پوائنٹ پیچھے ہے۔ اس کا ٹیبل بھی کرسر بینچ 3.2 پر 69.9%، DeepSWE 1.1 پر 65.9%، FrontierCode 1.1 Extended پر 61.3%، APEX-Agents پر 57.5%، اور Terminal-Bench 3.0 پر 26% رپورٹ کرتا ہے۔ نتائج عالمگیر لیڈ کے بجائے مخلوط ہوتے ہیں: ٹیبل کئی کوڈنگ اور ٹرمینل ٹیسٹوں پر دوسرے ماڈلز کو آگے رکھتا ہے۔ SpaceXAI کا کہنا ہے کہ فریق ثالث کے اعداد و شمار بہترین خود رپورٹ شدہ یا عوامی طور پر دستیاب نتائج کا استعمال کرتے ہیں، اس لیے استعمال، استدلال کے بجٹ، اور ٹیسٹ کی ترتیبات میں فرق اہم حدود ہیں۔
ماخذ کی تفصیلات: SpaceXAI's August 12 Grok 4.6 announcement and API documentation ↗
یہ کیوں اہمیت رکھتا ہے۔
Grok 4.6 ایک ماڈل ریس میں شامل ہوتا ہے جو تیزی سے ایسے ایجنٹوں کے ارد گرد منظم ہوتا ہے جو محض ایک پرامپٹ کا جواب دینے کے بجائے ایک پروجیکٹ لے سکتا ہے۔ ایک بڑی سیاق و سباق کی کھڑکی، قابل استدلال استدلال، آلے کا استعمال، اور طویل رفتار پر تربیت ایک ڈویلپر یا چھوٹی ٹیم کے لیے تحقیق، کوڈنگ، ٹیسٹنگ اور نظرثانی کے پابند حصے کو سونپنا آسان بنا سکتی ہے۔ عملی قدر کا انحصار لیڈر بورڈ کی ایک پوزیشن پر اس سے کم ہوگا کہ آیا ماڈل ضروریات کو محفوظ رکھ سکتا ہے، ٹولز کو محفوظ طریقے سے استعمال کر سکتا ہے، اور ایسا کام تیار کر سکتا ہے جس کا ایک شخص معائنہ کر کے درست کر سکے۔
سافٹ ویئر ٹیموں کے لیے، تسلسل مرکزی مصنوعات کا دعویٰ ہے۔ طویل عرصے سے کام کرنے والے ایجنٹوں کو تعمیراتی رکاوٹوں کو یاد رکھنا چاہیے، سیشن میں پہلے کی گئی تبدیلیوں کو سمجھنا چاہیے، درست کام کو کالعدم کرنے سے گریز کرنا چاہیے، اور اس بات کی تصدیق کرنی چاہیے کہ درستگی نظام کے کسی دوسرے حصے کو نہیں توڑتی ہے۔ ایک 500,000 ٹوکن ونڈو ماڈل روم کو مزید ریپوزٹری سیاق و سباق اور ٹول ہسٹری کے لیے فراہم کرتی ہے، لیکن سیاق و سباق کی گنجائش قابل اعتماد یاد یا استدلال جیسی نہیں ہے۔ بڑے اشارے میں غیر متعلقہ یا متصادم مواد شامل ہوسکتا ہے، اس کی قیمت xAI کی 200,000 ٹوکن قیمتوں کی حد سے زیادہ ہے، اور پھر بھی صحیح جواب کا تعین کرنے والی ایک فائل یا ضرورت کو شامل کرنے میں ناکام رہتے ہیں۔
تربیت کی تفصیل یہ بھی ظاہر کرتی ہے کہ فرنٹیئر لیبز کس طرح پہلے کے ماڈلز کو بعد کے ماڈلز کی تیاری اور فلٹر کرنے کے لیے استعمال کر رہی ہیں۔ متعدد استدلال کی کوششوں اور ایجنٹ کے استعمال میں زیر نگرانی مثالوں کو دوبارہ تخلیق کرنے سے ماڈل اور ماحول کے درمیان مستقل مزاجی بہتر ہو سکتی ہے جس میں یہ کام کرے گا۔ یہ غلطی کی وراثت اور تشخیص کی آزادی کے بارے میں جواب طلب سوالات بھی اٹھاتا ہے۔ اگر ایک ماڈل تربیتی نشانات بناتا ہے اور ماڈل پر مبنی چیک یہ فیصلہ کرتے ہیں کہ کون سے نشانات زندہ رہتے ہیں، تو ڈویلپرز کو اس بات کے ثبوت کی ضرورت ہوتی ہے کہ نتیجہ میں آنے والا نظام صرف انہی خودکار ججوں کو مطمئن کرنے کے لیے بہتر نہیں ہو رہا ہے جبکہ ان اندھی جگہوں کو برقرار رکھتے ہوئے جو ان ججوں کی کمی محسوس کرتے ہیں۔
API، کرسر، گروک بلڈ، اور گیٹ ویز پر دستیابی موجودہ ورک فلو میں ریلیز کی جانچ کے رگڑ کو کم کرتی ہے۔ کرسر اور گروک بلڈ میں ایک ہفتے کے لیے دو بار شامل استعمال کی تعارفی پیشکش حقیقی دنیا کی آزمائشوں کو تیز کر سکتی ہے۔ ٹیموں کو اب بھی صرف ٹوکن کی قیمتوں کے بجائے کل کام کی لاگت، تکمیل کے وقت، اصلاح کی کوشش، اور ناکامی کی بازیابی کا موازنہ کرنا چاہیے۔ فاسٹ ویرینٹ انٹرایکٹو کام میں مدد کر سکتا ہے، لیکن فی ٹوکن قیمت کو دوگنا کرنے سے ایک تجارت پیدا ہوتی ہے جسے صرف ٹاسک لیول ٹیسٹنگ ہی حل کر سکتی ہے۔ ایک سست ماڈل جو پہلی کوشش میں درست طریقے سے مکمل ہو جاتا ہے وہ تیز رفتار ماڈل سے سستا ہو سکتا ہے جس کی بار بار مرمت کی ضرورت ہوتی ہے۔
عوامی مفاد کی حد اتنی ہی اہم ہے جتنی کوڈنگ کی کارکردگی۔ فائلوں، براؤزرز، ٹرمینلز، یا کاروباری نظاموں پر کام کرنے والا ایجنٹ روایتی چیٹ بوٹ جواب سے کہیں زیادہ غلط مفروضے کا پرچار کر سکتا ہے۔ SpaceXAI کا کہنا ہے کہ Grok 4.6 نے اپنا سب سے وسیع پری تعیناتی ٹیسٹنگ سویٹ اور توسیع کے بعد کی تعیناتی اور تیسرے فریق کی جانچ حاصل کی، لیکن اعلان صرف ایک اعلیٰ سطحی حفاظت کی وضاحت فراہم کرتا ہے۔ یہ ایک تفصیلی سسٹم کارڈ، الگ الگ انکار اور غلط استعمال کے نتائج، واقعہ کی حد، یا ہر اس ڈومین کے ثبوت کو شائع نہیں کرتا ہے جس میں کمپنی کہتی ہے کہ حفاظتی اقدامات کیلیبریٹ کیے گئے تھے۔ صارفین کو حفاظتی زبان کو وینڈر کے دعوے کے طور پر پیش کرنا چاہیے جو مکمل دستاویزات اور آزاد جانچ کے زیر التواء ہے۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
What most distinguishes an AI agent from a basic chatbot?
آگے کیا دیکھنا ہے۔
فیصلہ کن ثبوت دوبارہ پیدا ہونے والے ٹیسٹوں اور لانچ کے بعد عام منصوبوں سے حاصل ہوں گے۔ دیکھیں کہ آیا Grok 4.6 لمبے کاموں کو بہتے بغیر ختم کر سکتا ہے، آیا اس کی خود جانچ حقیقی نقائص کو پکڑتی ہے، اس کی لاگت بڑے سیاق و سباق اور دوبارہ کوششوں کے ساتھ کیسے بدلتی ہے، اور کیا SpaceXAI باہر کے لوگوں کے دعووں کا معائنہ کرنے کے لیے کافی حفاظت اور تشخیص کی تفصیل شائع کرتا ہے۔ جلد دستیابی معنی خیز ہے؛ قابل اعتماد خود مختاری ایک تجرباتی سوال بنی ہوئی ہے۔
سب سے پہلے، مماثل حالات کے تحت ماڈل کا موازنہ کریں۔ Grok 4.5 اور مسابقتی نظاموں کے ساتھ Grok 4.6 کا موازنہ کرتے وقت آزاد تشخیص کاروں کو ایجنٹ کے استعمال، ٹولز، ریپوزٹری سنیپ شاٹ، وقت کی حد، ٹوکن بجٹ، اور استدلال کی کوشش کو مستقل رکھنا چاہیے۔ ایک مفید رپورٹ میں مکمل کام، جزوی کامیابیاں، رجعت، غلط ٹول کالز، انسانی مداخلتیں، دیوار گھڑی کا وقت، اور کل لاگت شامل ہونی چاہیے۔ ایک بینچ مارک فیصد یہ نہیں دکھا سکتا کہ آیا ناکامیوں کی مرمت کرنا آسان ہے یا کوئی ایجنٹ خاموشی سے غیر متعلقہ فائلوں کو تبدیل کرتا ہے جب کہ امتحان پاس کرنے کا نتیجہ حاصل ہوتا ہے۔
دوسرا، نظام کے سوال کے طور پر طویل سیاق و سباق کے دعوے کی جانچ کریں۔ ڈویلپرز کو ریپوزٹری کے سائز اور سیاق و سباق کے معیار میں فرق کرنا چاہیے، پھر پیمائش کریں کہ آیا ماڈل صحیح رکاوٹوں کو بازیافت کرتا ہے، کمپیکشن کے ذریعے ایک پلان کو برقرار رکھتا ہے، اور رفتار میں پہلے متعارف کرائے گئے تضادات کو نوٹ کرتا ہے۔ دستاویزات میں فوری کیش کلید کی سفارش کی گئی ہے تاکہ روٹ کی مسلسل درخواست کی جائے اور کیش ہٹس قابل اعتماد رہیں، اور یہ سیاق و سباق کو کم کرنے کی طرف لمبے لمبے ڈھیروں کی نشاندہی کرتی ہے۔ وہ خصوصیات معاشیات اور تسلسل کو بہتر بنا سکتی ہیں، لیکن ٹیموں کو یہ مانیٹر کرنے کی ضرورت ہے کہ کیا کمپیکشن کو ہٹاتا ہے اور کیا کیش شدہ گفتگو بنیادی پروجیکٹ کی تبدیلیوں کے بعد متروک مفروضوں کو محفوظ رکھتی ہے۔
تیسرا، مکمل حفاظتی انکشاف کی تلاش کریں۔ SpaceXAI کا کہنا ہے کہ اس کے تحفظات میں جائز خطرے کی پیچیدگی، انجینئرنگ ڈیزائن، اور AI تحقیق کا احاطہ کیا گیا ہے، جس میں وسیع تر پہلے سے تعیناتی، پوسٹ تعیناتی، اور تھرڈ پارٹی ٹیسٹنگ شامل ہیں۔ اگلی کارآمد اشاعت خطرے کے ماڈلز، تشخیص کے سیٹ، پاس کی حد، اعلی خطرے کی صلاحیتوں، معلوم ناکامی کے طریقوں، اور ماڈل اور مصنوعات کی دونوں تہوں پر تخفیف کی نشاندہی کرے گی۔ اسے یہ فرق کرنا چاہیے کہ بیس ماڈل نے اس سے کیا سیکھا جو گروک بلڈ، کرسر، API گیٹ وے، یا گاہک کا اپنا سینڈ باکس نافذ کرتا ہے۔ اس علیحدگی کے بغیر، صارفین یہ نہیں بتا سکتے کہ کون سی حفاظتی جائیداد ماڈل کے ساتھ سفر کرتی ہے اور کون سا آس پاس کی درخواست پر منحصر ہے۔
آخر میں، لانچ ہفتہ کی ترغیبات سے آگے اپنانے کو دیکھیں۔ کرسر اور گروک بلڈ کے صارفین فوری طور پر Grok 4.6 کی جانچ کر سکتے ہیں، جبکہ API کے صارفین عام یا تیز تر اندازہ کا انتخاب کر سکتے ہیں۔ مسلسل استعمال، عوامی پوسٹ مارٹم، اور ٹاسک لیول کا موازنہ یہ ظاہر کرے گا کہ آیا ماڈل کے مضبوط انٹرایکٹو فرسٹ پاسز قابل برقرار سافٹ ویئر اور مفید تحقیقی نمونے میں ترجمہ کرتے ہیں۔ SpaceXAI نے ٹھوس تصریحات کے ساتھ ایک نیا مواد بھیج دیا ہے۔ جو چیز نامعلوم رہتی ہے وہ یہ ہے کہ یہ گندے پروڈکشن ماحول میں خود مختار کام کو کس حد تک قابل اعتماد طریقے سے برقرار رکھتا ہے، جہاں اجازت، نامکمل تقاضے، فائلوں کو تبدیل کرنا، اور انسانی جائزہ اتنا ہی اہم ہے جتنا خام بینچ مارک کی صلاحیت۔