کیا ہوا؟
محققین نے τ^τ-Bench متعارف کرایا، جو ایک بینچ مارک ہے جو AI کوڈنگ سسٹمز کے لیے اینڈ ٹو اینڈ ایجنٹ کی تعمیر کا کام بناتا ہے۔ بینچ مارک ایک ڈویلپر ایجنٹ کے کاروباری ریکارڈز، کلائنٹ کی ضروریات، ایک پروڈکشن API، ایک موجودہ کوڈ بیس، اور ماڈلز اور سرونگ کے اخراجات کی حدود دیتا ہے، پھر مصنوعی صارفین کے خلاف نتیجے میں کسٹمر سروس ایجنٹ کا جائزہ لیتا ہے۔
arXiv ذریعہ، 4 ستمبر 2026 کو جمع کرایا گیا، τ^τ-Bench کو AI سسٹمز کا جائزہ لینے کے لیے ایک ماحول کے طور پر بیان کرتا ہے جو صرف بینچ مارک پرامپٹس کا جواب دینے کے بجائے ایجنٹس بناتے ہیں۔ ایک ڈویلپر ایجنٹ وہ ریکارڈز وصول کرتا ہے جو کاروبار دراصل رکھتا ہے، کلائنٹ کی ضروریات، ایک پروڈکشن API جس کے ذریعے آپریشنز چلنا چاہیے، وراثت میں ملنے والا کوڈ بیس، اور سرونگ لاگت اور ماڈل کے انتخاب میں رکاوٹیں ہیں۔ اسے ایک مکمل کسٹمر سروس ایجنٹ کی فراہمی کے لیے ان مواد کا استعمال کرنا چاہیے۔
نتیجے میں آنے والے ایجنٹ کا اندازہ اسے ہولڈ آؤٹ نقلی صارفین کے خلاف تعینات کرکے کیا جاتا ہے۔ چار ڈومینز میں 53 کاموں میں، پیپر رپورٹ کرتا ہے کہ اس کی سب سے مضبوط کنفیگریشن — Claude Opus 5 Claude Code کے ذریعے استعمال کی گئی — 23.9% تشخیصی سمیلیشنز کو پاس کر چکی ہے۔ ایک ماہر تصنیف کے حوالہ کی حد نے 82.2% اسکور کیا۔ یہ کاغذ کے ذریعہ رپورٹ کردہ نتائج ہیں؛ ذریعہ arXiv لینڈنگ پیج پر آزاد توثیق فراہم نہیں کرتا ہے۔
مصنفین ناکامی کے نمونوں کی نشاندہی کرتے ہیں جن کے بارے میں وہ کہتے ہیں کہ انسانی ایجنٹ ڈویلپرز کو درپیش مسائل سے مشابہت ہے: کاروباری ریکارڈز کی گہری سمجھ کے بجائے اتلی سوالات، مؤکل کے ساتھ بہت کم بات چیت، اور ایجنٹ کے فن تعمیر یا سرونگ اخراجات کے ساتھ ناکافی تجربہ۔ وہ کوآپریٹو ایجنٹ کو کوڈنگ ایجنٹوں کے لیے قابل پیمائش ہدف بنانے کی کوشش کے طور پر بینچ مارک کو نمایاں کرتے ہیں۔
یہ کیوں اہمیت رکھتا ہے۔
بینچ مارک موجودہ تشخیص میں فرق کو نشانہ بناتا ہے: آیا ایک AI سسٹم ایک حقیقی کلائنٹ کی مصروفیت کی گندی رکاوٹوں کے اندر قابل استعمال ایجنٹ فراہم کر سکتا ہے۔ مضبوط ترین جانچ شدہ ترتیب اور ماہر کے حوالہ کے درمیان رپورٹ کردہ کارکردگی کا فرق بتاتا ہے کہ اکیلے کوڈنگ کی اہلیت کاروباری ڈیٹا کو سمجھنے، گاہکوں کے ساتھ بات چیت کرنے، تعمیراتی انتخاب کرنے، یا آپریٹنگ اخراجات کے انتظام میں اہلیت قائم نہیں کرتی ہے۔
بہت سے تجزیے ماڈل کی کوڈ تیار کرنے یا کسی مخصوص کام کو مکمل کرنے کی صلاحیت کو الگ کر دیتے ہیں۔ τ^τ-بینچ اس کے بجائے فیصلوں کی ایک زنجیر کی جانچ کرتا ہے جو اس بات کا تعین کرتا ہے کہ آیا کوئی ایجنٹ آپریشنل ترتیب میں کام کر سکتا ہے: نامکمل تنظیمی ڈیٹا کی ترجمانی کرنا، کلائنٹ کی ضروریات کو رویے میں ترجمہ کرنا، موجودہ نظام کے ساتھ ضم کرنا، ماڈلز کا انتخاب کرنا، اور قیمت کے خلاف معیار کو متوازن کرنا۔ اس سے اطلاع دی گئی خلا کو ٹیموں کے لیے ممکنہ طور پر کارآمد بناتا ہے جو یہ فیصلہ کرتی ہے کہ انسانی انجینئرنگ اور جائزہ لینے والے ایجنٹ کی تعمیر کے ورک فلو کو ابھی بھی کتنی ضرورت ہے۔
نتائج ان دعووں کی جانچ کرنے کا ایک زیادہ ٹھوس طریقہ بھی فراہم کرتے ہیں کہ کوڈنگ ایجنٹ AI سسٹمز کے ارد گرد سافٹ ویئر ڈویلپمنٹ کے کام کو تبدیل یا کافی حد تک خودکار کر سکتے ہیں۔ ماخذ کے مطابق، آزمائشی نظاموں نے اکثر ایسی چیز تیار کی جو چلتی ہے لیکن مصروفیت کی گہری ضروریات کو پورا کرنے میں ناکام رہتی ہے۔ لہذا بینچ مارک صرف کوڈ جنریشن سے متعین نظام کے معیار اور صارفین کے ساتھ اس کے تعامل کی طرف توجہ مبذول کرتا ہے۔
نتیجہ پابند رہتا ہے۔ لینڈنگ پیج بینچ مارک کے کام کی تعمیر، سمیلیٹر ڈیزائن، اسکورنگ کے طریقہ کار، بیس لائن کے انتخاب، یا شماریاتی غیر یقینی صورتحال کے بارے میں کوئی تفصیلات نہیں دیتا ہے۔ یہ یہ بھی ظاہر نہیں کرتا ہے کہ 23.9% سکور پیداوار کے نتائج کی پیش گوئی کرتا ہے۔ یہ مقالہ ایک arXiv پری پرنٹ ہے، اس لیے اس کے دعوؤں کو تحقیقی نتائج کے طور پر سمجھا جانا چاہیے جو مزید جانچ پڑتال اور نقل کے لیے زیر التواء ہے۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
آگے کیا دیکھنا ہے۔
مقالے میں یہ نہیں بتایا گیا کہ τ^τ-Bench کا موازنہ دوسرے معیارات سے کیسے ہوتا ہے، آیا اس کے مصنوعی صارفین حقیقی صارفین کے ساتھ کارکردگی کی پیشین گوئی کرتے ہیں، یا آیا نتائج 53 رپورٹ شدہ کاموں اور چار ڈومینز سے آگے عمومی ہوتے ہیں۔ ماخذ عوامی بینچ مارک تک رسائی، نفاذ کی ضروریات، قیمتوں کا تعین، یا آزاد نقل کی دستاویز بھی نہیں کرتا ہے۔
آیا مصنفین بینچ مارک جاری کرتے ہیں، ٹاسک کی وضاحتیں، تشخیص کا استعمال، اور حوالہ پر عمل درآمد تولیدی صلاحیت کے لیے اہم ہے۔ ماخذ صفحہ کاغذ کی تصدیق کرتا ہے اور پی ڈی ایف اور ایچ ٹی ایم ایل ورژن سے لنک کرتا ہے، لیکن یہ یہ نہیں بتاتا کہ بینچ مارک خود عوامی طور پر قابل رسائی ہے یا کسی بھی رسائی کی شرائط یا قیمت کی نشاندہی کرتا ہے۔
مستقبل کے جائزوں میں مزید ماڈلز، کوڈنگ ایجنٹ سسٹمز، ڈومینز، اور ٹاسک کی قسموں کی جانچ کرنی چاہیے، جبکہ یہ واضح کرتے ہوئے کہ نقلی صارفین حقیقی کسٹمر کے رویے کی نمائندگی کیسے کرتے ہیں۔ موجودہ ایجنٹ، کوڈنگ، اور سافٹ ویئر انجینئرنگ بینچ مارکس کے ساتھ موازنہ کرنے سے یہ معلوم کرنے میں مدد ملے گی کہ τ^τ-بینچ کی اضافی صلاحیت کیا ہے۔
رپورٹ کردہ حدود عملی جائزے کے تقاضوں کی طرف اشارہ کرتی ہیں: معائنہ کریں کہ ایجنٹ کس طرح تنظیمی ریکارڈ سے استفسار کرتے ہیں، کلائنٹ کے واضح مواصلت کی ضرورت ہوتی ہے، متبادل آرکیٹیکچرز کا جائزہ لیتے ہیں، اور تعیناتی سے پہلے سرونگ کے اخراجات کی نگرانی کرتے ہیں۔ ماخذ حقیقی دنیا کی تعیناتیوں، گاہک کے نتائج، یا حفاظتی واقعات کی اطلاع نہیں دیتا، اس لیے وہ نتائج نامعلوم ہی رہتے ہیں۔