خبروں پر واپس جائیں۔
اختراعAI Understanding بریفنگ

بینچ مارک کو پتہ چلتا ہے کہ کوڈنگ ایجنٹ حقیقی دنیا کے سروس ایجنٹس بنانے کے لیے جدوجہد کرتے ہیں۔

ایک نیا بینچ مارک اس بات کا جائزہ لیتا ہے کہ آیا کوڈنگ ایجنٹ حقیقت پسندانہ کاروباری رکاوٹوں کے تحت مکمل کسٹمر سروس ایجنٹس بنا سکتے ہیں۔ مقالے میں بتایا گیا ہے کہ سب سے مضبوط آزمائشی ترتیب نے 23.9% تخروپن کو پاس کیا، اس کے مقابلے میں 82.2% ماہر تصنیف کے حوالے سے۔

4 min readRead the primary source
Source-provided image accompanying Benchmark finds coding agents struggle to build real-world service agents
بنیادی ماخذ دستاویزماخذ ریکارڈ شدہ
پبلشر
arxiv.org
ماخذ لنک
arxiv.orghttps://arxiv.org/abs/2609.04611
ماخذ کی قسم
بنیادی دستاویز — ایک سرکاری اعلان، کاغذ، فائلنگ، یا فریق اول کا صفحہ جسے ہم براہ راست پڑھتے ہیں۔
سیاق و سباقاسے 60 سیکنڈ میں سمجھیں۔

یہاں سے شروع کریں۔

کلیدی شرائط

بینچ مارک
ایک معیاری ٹیسٹ یا ڈیٹا سیٹ جو ماڈل کی کارکردگی کی پیمائش اور موازنہ کرنے کے لیے استعمال ہوتا ہے۔
API (ایپلی کیشن پروگرامنگ انٹرفیس)
ایک سافٹ ویئر سسٹم کے لیے دوسرے سسٹم کو درخواستیں بھیجنے اور اس سے جواب موصول کرنے کا ایک منظم طریقہ۔
اپنے آپ کو جانچیں۔اے آئی ایجنٹس کوئز

کیا ہوا؟

محققین نے τ^τ-Bench متعارف کرایا، جو ایک بینچ مارک ہے جو AI کوڈنگ سسٹمز کے لیے اینڈ ٹو اینڈ ایجنٹ کی تعمیر کا کام بناتا ہے۔ بینچ مارک ایک ڈویلپر ایجنٹ کے کاروباری ریکارڈز، کلائنٹ کی ضروریات، ایک پروڈکشن API، ایک موجودہ کوڈ بیس، اور ماڈلز اور سرونگ کے اخراجات کی حدود دیتا ہے، پھر مصنوعی صارفین کے خلاف نتیجے میں کسٹمر سروس ایجنٹ کا جائزہ لیتا ہے۔

arXiv ذریعہ، 4 ستمبر 2026 کو جمع کرایا گیا، τ^τ-Bench کو AI سسٹمز کا جائزہ لینے کے لیے ایک ماحول کے طور پر بیان کرتا ہے جو صرف بینچ مارک پرامپٹس کا جواب دینے کے بجائے ایجنٹس بناتے ہیں۔ ایک ڈویلپر ایجنٹ وہ ریکارڈز وصول کرتا ہے جو کاروبار دراصل رکھتا ہے، کلائنٹ کی ضروریات، ایک پروڈکشن API جس کے ذریعے آپریشنز چلنا چاہیے، وراثت میں ملنے والا کوڈ بیس، اور سرونگ لاگت اور ماڈل کے انتخاب میں رکاوٹیں ہیں۔ اسے ایک مکمل کسٹمر سروس ایجنٹ کی فراہمی کے لیے ان مواد کا استعمال کرنا چاہیے۔

نتیجے میں آنے والے ایجنٹ کا اندازہ اسے ہولڈ آؤٹ نقلی صارفین کے خلاف تعینات کرکے کیا جاتا ہے۔ چار ڈومینز میں 53 کاموں میں، پیپر رپورٹ کرتا ہے کہ اس کی سب سے مضبوط کنفیگریشن — Claude Opus 5 Claude Code کے ذریعے استعمال کی گئی — 23.9% تشخیصی سمیلیشنز کو پاس کر چکی ہے۔ ایک ماہر تصنیف کے حوالہ کی حد نے 82.2% اسکور کیا۔ یہ کاغذ کے ذریعہ رپورٹ کردہ نتائج ہیں؛ ذریعہ arXiv لینڈنگ پیج پر آزاد توثیق فراہم نہیں کرتا ہے۔

مصنفین ناکامی کے نمونوں کی نشاندہی کرتے ہیں جن کے بارے میں وہ کہتے ہیں کہ انسانی ایجنٹ ڈویلپرز کو درپیش مسائل سے مشابہت ہے: کاروباری ریکارڈز کی گہری سمجھ کے بجائے اتلی سوالات، مؤکل کے ساتھ بہت کم بات چیت، اور ایجنٹ کے فن تعمیر یا سرونگ اخراجات کے ساتھ ناکافی تجربہ۔ وہ کوآپریٹو ایجنٹ کو کوڈنگ ایجنٹوں کے لیے قابل پیمائش ہدف بنانے کی کوشش کے طور پر بینچ مارک کو نمایاں کرتے ہیں۔

ماخذ کی تفصیلات: arxiv.org ↗

یہ کیوں اہمیت رکھتا ہے۔

بینچ مارک موجودہ تشخیص میں فرق کو نشانہ بناتا ہے: آیا ایک AI سسٹم ایک حقیقی کلائنٹ کی مصروفیت کی گندی رکاوٹوں کے اندر قابل استعمال ایجنٹ فراہم کر سکتا ہے۔ مضبوط ترین جانچ شدہ ترتیب اور ماہر کے حوالہ کے درمیان رپورٹ کردہ کارکردگی کا فرق بتاتا ہے کہ اکیلے کوڈنگ کی اہلیت کاروباری ڈیٹا کو سمجھنے، گاہکوں کے ساتھ بات چیت کرنے، تعمیراتی انتخاب کرنے، یا آپریٹنگ اخراجات کے انتظام میں اہلیت قائم نہیں کرتی ہے۔

بہت سے تجزیے ماڈل کی کوڈ تیار کرنے یا کسی مخصوص کام کو مکمل کرنے کی صلاحیت کو الگ کر دیتے ہیں۔ τ^τ-بینچ اس کے بجائے فیصلوں کی ایک زنجیر کی جانچ کرتا ہے جو اس بات کا تعین کرتا ہے کہ آیا کوئی ایجنٹ آپریشنل ترتیب میں کام کر سکتا ہے: نامکمل تنظیمی ڈیٹا کی ترجمانی کرنا، کلائنٹ کی ضروریات کو رویے میں ترجمہ کرنا، موجودہ نظام کے ساتھ ضم کرنا، ماڈلز کا انتخاب کرنا، اور قیمت کے خلاف معیار کو متوازن کرنا۔ اس سے اطلاع دی گئی خلا کو ٹیموں کے لیے ممکنہ طور پر کارآمد بناتا ہے جو یہ فیصلہ کرتی ہے کہ انسانی انجینئرنگ اور جائزہ لینے والے ایجنٹ کی تعمیر کے ورک فلو کو ابھی بھی کتنی ضرورت ہے۔

نتائج ان دعووں کی جانچ کرنے کا ایک زیادہ ٹھوس طریقہ بھی فراہم کرتے ہیں کہ کوڈنگ ایجنٹ AI سسٹمز کے ارد گرد سافٹ ویئر ڈویلپمنٹ کے کام کو تبدیل یا کافی حد تک خودکار کر سکتے ہیں۔ ماخذ کے مطابق، آزمائشی نظاموں نے اکثر ایسی چیز تیار کی جو چلتی ہے لیکن مصروفیت کی گہری ضروریات کو پورا کرنے میں ناکام رہتی ہے۔ لہذا بینچ مارک صرف کوڈ جنریشن سے متعین نظام کے معیار اور صارفین کے ساتھ اس کے تعامل کی طرف توجہ مبذول کرتا ہے۔

نتیجہ پابند رہتا ہے۔ لینڈنگ پیج بینچ مارک کے کام کی تعمیر، سمیلیٹر ڈیزائن، اسکورنگ کے طریقہ کار، بیس لائن کے انتخاب، یا شماریاتی غیر یقینی صورتحال کے بارے میں کوئی تفصیلات نہیں دیتا ہے۔ یہ یہ بھی ظاہر نہیں کرتا ہے کہ 23.9% سکور پیداوار کے نتائج کی پیش گوئی کرتا ہے۔ یہ مقالہ ایک arXiv پری پرنٹ ہے، اس لیے اس کے دعوؤں کو تحقیقی نتائج کے طور پر سمجھا جانا چاہیے جو مزید جانچ پڑتال اور نقل کے لیے زیر التواء ہے۔

Interactive Mechanism

انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔

اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
انٹرایکٹو تصور چیک+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

آگے کیا دیکھنا ہے۔

مقالے میں یہ نہیں بتایا گیا کہ τ^τ-Bench کا موازنہ دوسرے معیارات سے کیسے ہوتا ہے، آیا اس کے مصنوعی صارفین حقیقی صارفین کے ساتھ کارکردگی کی پیشین گوئی کرتے ہیں، یا آیا نتائج 53 رپورٹ شدہ کاموں اور چار ڈومینز سے آگے عمومی ہوتے ہیں۔ ماخذ عوامی بینچ مارک تک رسائی، نفاذ کی ضروریات، قیمتوں کا تعین، یا آزاد نقل کی دستاویز بھی نہیں کرتا ہے۔

آیا مصنفین بینچ مارک جاری کرتے ہیں، ٹاسک کی وضاحتیں، تشخیص کا استعمال، اور حوالہ پر عمل درآمد تولیدی صلاحیت کے لیے اہم ہے۔ ماخذ صفحہ کاغذ کی تصدیق کرتا ہے اور پی ڈی ایف اور ایچ ٹی ایم ایل ورژن سے لنک کرتا ہے، لیکن یہ یہ نہیں بتاتا کہ بینچ مارک خود عوامی طور پر قابل رسائی ہے یا کسی بھی رسائی کی شرائط یا قیمت کی نشاندہی کرتا ہے۔

مستقبل کے جائزوں میں مزید ماڈلز، کوڈنگ ایجنٹ سسٹمز، ڈومینز، اور ٹاسک کی قسموں کی جانچ کرنی چاہیے، جبکہ یہ واضح کرتے ہوئے کہ نقلی صارفین حقیقی کسٹمر کے رویے کی نمائندگی کیسے کرتے ہیں۔ موجودہ ایجنٹ، کوڈنگ، اور سافٹ ویئر انجینئرنگ بینچ مارکس کے ساتھ موازنہ کرنے سے یہ معلوم کرنے میں مدد ملے گی کہ τ^τ-بینچ کی اضافی صلاحیت کیا ہے۔

رپورٹ کردہ حدود عملی جائزے کے تقاضوں کی طرف اشارہ کرتی ہیں: معائنہ کریں کہ ایجنٹ کس طرح تنظیمی ریکارڈ سے استفسار کرتے ہیں، کلائنٹ کے واضح مواصلت کی ضرورت ہوتی ہے، متبادل آرکیٹیکچرز کا جائزہ لیتے ہیں، اور تعیناتی سے پہلے سرونگ کے اخراجات کی نگرانی کرتے ہیں۔ ماخذ حقیقی دنیا کی تعیناتیوں، گاہک کے نتائج، یا حفاظتی واقعات کی اطلاع نہیں دیتا، اس لیے وہ نتائج نامعلوم ہی رہتے ہیں۔

متعلقہ گائیڈز اور کوئزز

اے آئی ایجنٹسAI ماڈلز کی وضاحتاے آئی ٹریننگآپ جو جانتے ہیں اس کی جانچ کریں - ایک مفت AI کوئز آزمائیں۔ہماری لغت میں AI کی اصطلاح دیکھیںاے آئی ماڈل ریلیز ٹریکر پر عمل کریں۔
یہ مفید پایا؟