خبروں پر واپس جائیں۔
انٹرپرائزAI Understanding بریفنگ

بینچ مارک پیپر نے LLMs کے ساتھ انٹرپرائز ڈیٹا کو استفسار کرنے کے چار طریقے ڈھونڈے ہیں تمام اسکور 26% سے کم

ایک نیا arXiv پری پرنٹ ایک مصنوعی دو لسانی بینچ مارک پر ایک دوسرے کے خلاف انٹرپرائز ڈیٹا بیس کی قدرتی زبان میں استفسار کے لیے چار فن تعمیرات کو کھڑا کرتا ہے۔ کسی نے بھی تقریباً ایک چوتھائی سے زیادہ کیسز کا صحیح جواب نہیں دیا، اور جس ڈیزائن نے سب سے زیادہ اسکور کیا وہ سب سے محفوظ یا سستا نہیں تھا۔

6 min readRead the primary source
Source-page capture accompanying Benchmark Paper Finds Four Ways to Query Enterprise Data With LLMs All Score Under 26%
بنیادی ماخذ دستاویزماخذ ریکارڈ شدہ
پبلشر
arxiv.org
ماخذ لنک
arxiv.orghttps://arxiv.org/abs/2608.13612
ماخذ کی قسم
بنیادی دستاویز — ایک سرکاری اعلان، کاغذ، فائلنگ، یا فریق اول کا صفحہ جسے ہم براہ راست پڑھتے ہیں۔
سیاق و سباقاسے 60 سیکنڈ میں سمجھیں۔

یہاں سے شروع کریں۔

کلیدی شرائط

بینچ مارک
ایک معیاری ٹیسٹ یا ڈیٹا سیٹ جو ماڈل کی کارکردگی کی پیمائش اور موازنہ کرنے کے لیے استعمال ہوتا ہے۔
API (ایپلی کیشن پروگرامنگ انٹرفیس)
ایک سافٹ ویئر سسٹم کے لیے دوسرے سسٹم کو درخواستیں بھیجنے اور اس سے جواب موصول کرنے کا ایک منظم طریقہ۔
مشین لرننگ (ML)
ایسے طریقے جو سسٹمز کو ڈیٹا سے پیٹرن سیکھنے اور وقت کے ساتھ ساتھ بہتر کرنے کی اجازت دیتے ہیں۔
اپنے آپ کو جانچیں۔اے آئی ایجنٹس کوئز

کیا ہوا؟

12 اگست 2026 کو arXiv پر پوسٹ کیا گیا ایک واحد مصنف کا پری پرنٹ SemPlan بینچ مارک متعارف کرایا گیا ہے، جو 1,800 انگریزی اور برازیلی پرتگالی کیسوں کا ایک تعیناتی مصنوعی ٹیسٹ سیٹ ہے، اور قدرتی زبان کی درخواستوں کو حکومتی ڈیٹا بیس کے سوالات میں تبدیل کرنے کے لیے چار فن تعمیر کا موازنہ کرتا ہے۔ جواب کی درستگی 22.25% سے لے کر 25.67% تک تھی، جس میں مختلف فن تعمیرات حفاظت، لاگت اور انکار کے رویے پر برتری رکھتے ہیں۔

شناخت کنندہ 2608.13612 کے تحت 12 اگست 2026 کو arXiv پر پوسٹ کیا گیا ایک پری پرنٹ، جسے برونو سانتوس ٹیکسیرا نے تصنیف کیا ہے، SemPlan نامی ایک بینچ مارک کی وضاحت کرتا ہے جس کا مقصد ایک تنگ لیکن تجارتی طور پر عام مسئلہ ہے: کس طرح ایک نظام کو ایک غیر متعین قدرتی زبان میں ڈیٹا کی درخواست کے بغیر داخلے کے نتائج میں تبدیل کرنا چاہیے۔ رسائی کی پالیسی کی خلاف ورزی کرنا، لاگت کو بڑھانا، یا ہر بار پوچھے جانے پر مختلف جوابات واپس کرنا۔ خلاصہ کام کو کسی خاص ماڈل کی بجائے آرکیٹیکچرل ڈیزائن کی جگہ کی تشخیص کے طور پر بناتا ہے۔

بینچ مارک کو تعییناتی، مصنوعی اور دو لسانی کے طور پر بیان کیا گیا ہے، جس میں انگریزی اور برازیلی پرتگالی میں 1,800 مقدمات ہیں، جن میں سے 1,200 ایسے ہیں جسے مصنف نے منجمد سائنسی تشخیص کا ذیلی سیٹ کہا ہے۔ چار آرکیٹیکچرز کا موازنہ اس کے تحت کیا گیا ہے جسے خلاصہ ایک ہی ماڈل کنفیگریشن کے طور پر بیان کرتا ہے: ڈائریکٹ ایس کیو ایل جنریشن (لیبل لگا ہوا A1)؛ ایک پابند ٹول ایجنٹ بیس لائن (A2)؛ سٹرکچرڈ سیمنٹک ریکوئسٹ جنریشن جس کے بعد ڈیٹرمنسٹک پلاننگ اور ایگزیکیوشن (A3)؛ اور ایک وضاحت پر مبنی، ریاستی سیمنٹک پلان ویرینٹ (A4)۔

خلاصہ 4,800 پرائمری ریکارڈز کو کہتا ہے، ہر ڈیزائن کے لیے مطلق شرائط میں جواب کی درستگی کم تھی: A1 کے لیے 22.25%، A2 کے لیے 22.58%، A3 کے لیے 25.67% اور A4 کے لیے 24.25%۔ ریکارڈ کی گنتی 1,200-کیس کے منجمد سب سیٹ کو چاروں آرکیٹیکچرز کے ذریعے چلانے کے ساتھ مطابقت رکھتی ہے، حالانکہ خلاصہ اس نقشہ سازی کو واضح طور پر بیان نہیں کرتا ہے۔ A3 میں سب سے زیادہ مشاہدہ کی گئی درستگی تھی اور، خلاصہ کے مطابق، پہلے سے متعین جوڑے کی درستگی کے تجزیے میں A1، A2 اور A4 سے نمایاں طور پر تجاوز کر گیا — ایک ڈیزائن کا انتخاب جس کا مطلب ہے کہ مقابلے کا منصوبہ بعد میں منتخب کرنے کے بجائے نتائج کو دیکھنے سے پہلے بنایا گیا تھا۔

دوسرے رپورٹ کردہ میٹرکس ایک ہی فاتح کے پیچھے نہیں ہیں۔ A1، ایس کیو ایل کو براہ راست بنانے کا آسان ترین طریقہ، سب سے زیادہ پالیسی-درست شرح اور سب سے کم غیر محفوظ-یا-غلط شرح کو برقرار رکھتا ہے۔ A4، وضاحت اور ریاست سے باخبر رہنے کی قسم، میں سب سے کم اوسط API لاگت اور سب سے کم جھوٹے انکار کی شرح تھی - یعنی، اس نے کم از کم اکثر اس درخواست کو مسترد کر دیا جس کا اسے جواب دینا چاہیے تھا۔ پہلے سے منتخب کردہ 150 کیس کے استحکام کے ذیلی سیٹ پر، جواب کی درست تکرار کی صلاحیت 92.00% سے لے کر 98.67% تک ہوتی ہے، جس سے یہ ظاہر ہوتا ہے کہ ایک ہی کیس کو دہرائے جانے پر بھی کسی بھی فن تعمیر نے مکمل طور پر تعییناتی جوابات تیار نہیں کیے ہیں۔

کئی چیزیں جو خلاصہ قائم نہیں کرتی ہیں وہ واضح طور پر بیان کرنے کے قابل ہیں۔ یہ استعمال شدہ زبان کے ماڈل کا نام نہیں دیتا، ڈیٹا بیس اسکیموں یا نافذ کیے جانے والے پالیسی قواعد کی وضاحت کرتا ہے، اس بات کی وضاحت کرتا ہے کہ پالیسی-صحیح، غیر محفوظ-یا-غلط اور غلط-انکار کو کس طرح اسکور کیا گیا، لاگت کے موازنہ کے پیچھے اصل لاگت کے اعداد و شمار فراہم کریں، یا دو لسانی ڈیزائن کے باوجود زبان کے لحاظ سے درستی کو توڑ دیں۔ فہرست کا صفحہ اس بات کی نشاندہی نہیں کرتا ہے کہ کوڈ یا ڈیٹا جاری کیا گیا ہے۔ کاغذ 11 صفحات پر مشتمل پری پرنٹ ہے جس میں ایک مصنف کے تین اعداد اور نو ٹیبل ہیں۔ خلاصہ کہتا ہے کہ اسے مشین لرننگ ریسرچ پر ٹرانزیکشنز میں جمع کرایا گیا ہے، جس کا مطلب ہے کہ اس نے ہم مرتبہ جائزہ مکمل نہیں کیا ہے۔

ماخذ کی تفصیلات: arxiv.org

یہ کیوں اہمیت رکھتا ہے۔

کمپنی کے ڈیٹا کے لیے قدرتی زبان کے انٹرفیس سب سے زیادہ فروخت ہونے والی انٹرپرائز AI خصوصیات میں سے ایک ہیں، اور کاغذ کا مرکزی دعویٰ یہ ہے کہ ڈھانچے اور منصوبہ بندی کی تہوں کو شامل کرنے سے وہ تبدیلیاں آتی ہیں جو ان کو ختم کرنے کے بجائے ناکامیاں ہوتی ہیں۔ مطلق اسکور مصنف کی اپنی تعمیر کے مصنوعی معیار سے آتے ہیں، لہذا وہ پیداوار کی درستگی کی پیمائش نہیں ہیں۔

اندرونی ڈیٹا بیس تک چیٹ طرز کی رسائی سب سے زیادہ مارکیٹ کی جانے والی انٹرپرائز AI صلاحیتوں میں سے ہے، اور دکاندار عموماً فن تعمیر پر فرق کرتے ہیں: چاہے ماڈل SQL کو براہ راست لکھتا ہے، ٹولز کے ایک محدود سیٹ کو کال کرتا ہے، ایک منظم انٹرمیڈیٹ نمائندگی کا اخراج کرتا ہے جسے ایک متعین منصوبہ ساز انجام دیتا ہے، یا صارف سے سوالات پوچھتا ہے۔ یہ کاغذ مارکیٹنگ کے اس امتیاز کو لیتا ہے اور اسے مقررہ حالات میں جانچتا ہے۔ اس کی سرخی کی تلاش یہ ہے کہ فن تعمیر کا انتخاب قابل اعتماد طریقے سے درستگی کو طے کیے بغیر ناکامی کے پروفائل کو دوبارہ شکل دیتا ہے۔

مکمل درستگی کے نمبرز دیکھ بھال کے مستحق ہیں۔ یہ ایک مصنوعی بینچ مارک سے آتے ہیں جس کی مشکل اس کے اپنے مصنف نے ترتیب دی تھی، اس لیے کم بیس کی دہائی میں اسکور اس ٹیسٹ سیٹ کی خاصیت ہے، اس بات کا اندازہ نہیں کہ ایک تعینات کردہ نظام کتنی بار حقیقی کاروباری سوال کا صحیح جواب دیتا ہے۔ جس چیز کو ڈیزائن زیادہ مضبوطی سے سپورٹ کرتا ہے وہ نسبتاً موازنہ ہے: کیونکہ چاروں فن تعمیر ایک ہی منجمد کیسز پر ایک ہی ماڈل کنفیگریشن کے تحت چلتے ہیں، ان کے درمیان ترتیب خام فیصد سے زیادہ معلوماتی ہے۔

ٹریڈ آف پیٹرن ان سسٹمز کا جائزہ لینے والے ہر فرد کے لیے عملی طور پر مفید حصہ ہے۔ وہ ڈیزائن جس نے زیادہ تر سوالات کے صحیح جوابات دیے وہ وہ نہیں تھا جس میں سب سے زیادہ قابل احترام پالیسی تھی، اور جو سب سے سستا تھا اور درست کام سے انکار کرنے کا امکان کم سے کم تھا وہ نہ تو سب سے زیادہ درست تھا اور نہ ہی سب سے محفوظ۔ ایک خریدار جو ایک درستگی کے اعداد و شمار پر منتخب کرتا ہے، اس ثبوت پر، حکمرانی اور لاگت کے نتائج کو دیکھے بغیر انتخاب کرے گا۔ کاغذ کی تشکیل - عالمی درجہ بندی کے بجائے تجارت سے متعلق تشریح - ان دعووں کے خلاف ایک احتیاط ہے کہ کوئی ایک فن تعمیر مسئلہ کو حل کرتا ہے۔

ریپیٹ ایبلٹی کا نتیجہ ایک الگ آپریشنل تشویش کی بات کرتا ہے۔ 150-کیس سب سیٹ پر 92.00% اور 98.67% کے درمیان جواب کی درست تکرار کا مطلب ہے کہ ایک ہی سوال کو دہرانے سے بعض اوقات یہ بدل جاتا ہے کہ آیا جواب درست تھا۔ رپورٹنگ، آڈیٹنگ یا تعمیل کے کام کے بہاؤ کے لیے، جہاں ایک ہی سوال سے ایک ہی اعداد و شمار کی توقع کی جاتی ہے، وہ تغیر اوسط درستگی سے ایک الگ خطرہ ہے اور وینڈر مواد میں شاذ و نادر ہی رپورٹ کیا جاتا ہے۔

دو لسانی تعمیر، انگریزی اور برازیلی پرتگالی کا احاطہ کرتی ہے، بینچ مارکس میں فرق کو دور کرتی ہے جو صرف انگریزی کی جانچ کرتا ہے۔ آیا دونوں زبانوں نے تقابلی طور پر کارکردگی کا مظاہرہ کیا ہے اس کا خلاصہ میں بیان نہیں کیا گیا ہے، لہذا یہاں ڈیزائن کی قدر فی الحال ظاہر کرنے کی بجائے ممکنہ ہے۔ مزید وسیع طور پر، مطالعہ کا وزن ایک غیر منقولہ ماڈل کنفیگریشن کے ساتھ مصنوعی ڈیٹا پر ایک واحد مصنف پری پرنٹ ہونے کی وجہ سے محدود ہے۔ یہ آرکیٹیکچر ٹریڈ آف کے بارے میں ایک منظم مفروضہ ہے، کوئی طے شدہ نتیجہ نہیں۔

Interactive Mechanism

انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔

اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
انٹرایکٹو تصور چیک+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

آگے کیا دیکھنا ہے۔

آیا ماڈل کے استعمال کردہ مکمل کاغذ کے نام، زبان کے لحاظ سے نتائج کو توڑتا ہے، اور اس کی حفاظتی پیمائش کی وضاحت کرتا ہے؛ چاہے بینچ مارک کوڈ اور ڈیٹا جاری کیا جائے تاکہ دوسرے گروپ اسے مختلف ماڈلز پر دوبارہ چلا سکیں۔ اور آیا یہ کاغذ TMLR میں ہم مرتبہ کے جائزے کو صاف کرتا ہے، جہاں خلاصہ کہتا ہے کہ اسے جمع کرایا گیا ہے۔

سب سے فوری سوال یہ ہے کہ پورے پیپر میں کیا ہے۔ کون سا ماڈل استعمال کیا گیا تھا، پالیسی اور حفاظتی میٹرکس کی وضاحت اور اسکور کیسے کیا گیا تھا، اصل میں لاگت کے اعداد و شمار کیا تھے، اور کیا نتائج انگریزی اور برازیلین پرتگالی کے درمیان مختلف تھے، یہ سب صرف خلاصہ سے حل نہیں ہیں۔ کاغذ کی رپورٹ کے مطابق نو میزیں ان میں سے کئی کا جواب دے سکتی ہیں۔ خلاصہ یہ فیصلہ کرنے کے لئے کافی نہیں ہے کہ آیا حفاظت اور انکار کے دعووں کو آرکیٹیکچرز میں مستقل طور پر ماپا جاتا ہے۔

آیا بینچ مارک خود جاری کیا گیا ہے مخصوص فیصد سے زیادہ اہمیت رکھتا ہے۔ منجمد 1,200-کیس سب سیٹ دوبارہ استعمال کے لیے ڈیزائن کیا گیا ہے، اور اس کی قیمت دوسرے گروپس پر منحصر ہے کہ وہ اسے ان ماڈلز کے خلاف چلانے کے قابل ہیں جن کی مصنف نے جانچ نہیں کی۔ اگر کوڈ اور ڈیٹا کو شائع کیا جاتا ہے اور تجارتی بند پیٹرن کئی فرنٹیئر ماڈلز میں دوبارہ پیدا ہوتا ہے، تو تلاش کو مسترد کرنا کافی مشکل ہو جاتا ہے۔ اگر یہ دوبارہ پیدا نہیں ہوتا ہے، یا اگر نتائج ایک ماڈل کے رویے پر منحصر ہوتے ہیں، تو آرکیٹیکچرل دعوی تیزی سے کم ہو جاتا ہے۔

ہم مرتبہ کا جائزہ ایک ٹھوس قریب المدت چیک پوائنٹ ہے۔ خلاصہ یہ بتاتا ہے کہ کاغذ مشین لرننگ ریسرچ پر ٹرانزیکشنز میں جمع کرایا گیا ہے۔ قبولیت، مسترد یا نظرثانی شدہ ورژن سبھی معلوماتی ہوں گے، خاص طور پر اس بات پر کہ آیا پہلے سے متعین جوڑا تجزیہ جائزہ لینے والے کی جانچ پڑتال کے تحت رہتا ہے، یہ دیکھتے ہوئے کہ درستی کے اعداد و شمار ایک دوسرے کے کتنے قریب ہیں۔

طویل مدتی، مفید ترقی اس شکل کے بینچ مارکس ہوں گے جو حقیقی انٹرپرائز اسکیموں اور حقیقی رسائی کنٹرول پالیسیوں پر بنائے گئے ہیں نہ کہ مصنوعی پالیسیوں، اور وینڈرز جو پالیسی کی درستگی، غلط انکار کی شرح اور درستگی کے ساتھ ساتھ اعادہ کی اطلاع دیتے ہیں۔ جب تک ایسا نہیں ہوتا، قدرتی زبان کے ڈیٹا انٹرفیس کا جائزہ لینے والے خریداروں کے پاس پروڈکٹس کا موازنہ کرنے کے لیے محدود عوامی ثبوت ہوتے ہیں، اور اس پیپر کو ایک ٹیمپلیٹ کے طور پر بہترین طور پر پڑھا جاتا ہے کہ کسی وینڈر سے کیا پوچھنا ہے بجائے اس کے کہ مارکیٹ میں موجود کسی پروڈکٹ کے بارے میں فیصلے کے طور پر۔

متعلقہ گائیڈز اور کوئزز

اے آئی ایجنٹسAI ماڈلز کی وضاحتChatGPT اور ایل ایل ایمآپ جو جانتے ہیں اس کی جانچ کریں - ایک مفت AI کوئز آزمائیں۔ہماری لغت میں AI کی اصطلاح دیکھیں
یہ مفید پایا؟