کیا ہوا؟
arXiv پر پوسٹ کیا گیا پری پرنٹ CacheScout کی وضاحت کرتا ہے، سرورز کے لیے ایک رن ٹائم پرت جو ملٹی ایجنٹ لینگویج ماڈل سسٹم کی میزبانی کرتا ہے۔ کم از کم حال ہی میں استعمال شدہ بنیادوں پر کیشڈ کمپیوٹیشن کو ضائع کرنے کے بجائے، یہ آن لائن سیکھتا ہے کہ کون سا ایجنٹ کس کی پیروی کرتا ہے، پھر ان پیشین گوئیوں کا استعمال یہ فیصلہ کرنے کے لیے کرتا ہے کہ کیا رکھنا ہے اور کیا لوڈ کرنا ہے۔ vLLM پر بنایا گیا، یہ کیش ہٹ ریٹ میں 10 سے 18 فیصد پوائنٹس تک اضافہ کرنے کی اطلاع ہے اور وقت سے پہلے ٹوکن میں 18 سے 45 فیصد تک کمی کر دی گئی ہے۔
arXiv:2608.14624 کے بطور درج ایک پری پرنٹ، 16 جولائی 2026 کو جمع کرایا گیا اور مصنوعی ذہانت (cs.AI) کے تحت درج کیا گیا، CacheScout نامی نظام کی وضاحت کرتا ہے۔ نو مصنفین درج ہیں: Rui Zhang، Chaeeun Kim، Shaoting Feng، Kuntai Du، Yuhan Liu، Yi Zhong، Cheng-Wei Ching، Junchen Jiang، اور Liting Hu۔ فہرست سازی کا صفحہ جو اس مضمون کی بنیاد ہے ان کی ادارہ جاتی وابستگیوں کو بیان نہیں کرتا ہے، اور اس مقالے میں ایک واحد ورژن ہے جس میں ہم مرتبہ جائزہ لینے یا کسی کانفرنس یا جریدے میں اشاعت کا کوئی اشارہ نہیں ہے۔
مصنفین نے جو مسئلہ بیان کیا ہے وہ اس کے لیے مخصوص ہے کہ ملٹی ایجنٹ سسٹم کیسے بنائے جاتے ہیں۔ صارف کی درخواست کو خصوصی ایجنٹوں کی ترتیب میں توڑ دیا جاتا ہے، اور ان میں سے ہر ایک ایجنٹ سیاق و سباق کے ایک مقررہ بلاک کے خلاف چلتا ہے: ایک سسٹم پرامپٹ، ٹول کی تعریفوں کا ایک سیٹ، اور چند شاٹ مثالیں۔ جب ایک زبان کا ماڈل ٹیکسٹ پر کارروائی کرتا ہے، تو یہ درمیانی توجہ کی حالت پیدا کرتا ہے، جسے عام طور پر کلیدی قدر کیش یا KV کیش کہا جاتا ہے، جسے سرونگ سسٹم اسٹور اور دوبارہ استعمال کر سکتا ہے تاکہ اسی معروف متن کو دوبارہ پروسیس نہ کرنا پڑے۔ چونکہ ایجنٹ کے سیاق و سباق کو دہرایا جاتا ہے، مصنفین کا کہنا ہے کہ اصولی طور پر دوبارہ استعمال کی ایک بڑی مقدار دستیاب ہے۔
ان کا دعویٰ یہ ہے کہ موجودہ سرور اسے حاصل کرنے میں ناکام رہتے ہیں۔ خلاصہ کہتا ہے کہ موجودہ سسٹمز، KV کیشے کو رد عمل سے منظم کرتے ہیں، سابقہ کیشنگ کو رجعت پر مبنی متبادل کے ساتھ مل کر استعمال کرتے ہیں - جو کچھ حال ہی میں استعمال کیا گیا تھا اسے برقرار رکھتے ہوئے اور باقی کو بے دخل کرتے ہیں۔ ایجنٹ کی پائپ لائن میں، ایک ایجنٹ کا سیاق و سباق غیر استعمال شدہ بیٹھ سکتا ہے جب کہ دوسرے ایجنٹ چلتے ہیں، لہذا اس ایجنٹ کو دوبارہ طلب کرنے سے کچھ دیر پہلے اسے بے دخل کر دیا جاتا ہے، اور کام دوبارہ کیا جاتا ہے۔ CacheScout کی بیان کردہ بصیرت یہ ہے کہ مستقبل کے دوبارہ استعمال پر اکیلے تجدید کے بجائے ایجنٹ کے عمل کے سیمنٹکس کے ذریعے کنٹرول کیا جاتا ہے۔
طریقہ کار، جیسا کہ بیان کیا گیا ہے، نظام کے چلنے کے دوران ایجنٹ کے عمل درآمد کی منتقلی کو سیکھنا ہے — کون سا ایجنٹ کس کی پیروی کرتا ہے — بغیر پہلے سے طے شدہ ورک فلو گراف کے اور بغیر آف لائن ٹریننگ کے، پھر اس سیکھے ہوئے ماڈل کو استعمال کریں تاکہ کیشے کے اندراجات کی بے دخلی اور پریکٹیو پری فیچنگ دونوں کی رہنمائی ہو۔ مصنفین کا کہنا ہے کہ پیش کرنے والے اہم راستے میں کوئی تبدیلی نہیں کی گئی ہے، یعنی پیشن گوئی کی مشینری کا مقصد اس کے اندر کی بجائے درخواست کی ہینڈلنگ کے ساتھ بیٹھنا ہے۔ عمل درآمد vLLM کے اوپر بنایا گیا ہے، ایک وسیع پیمانے پر استعمال شدہ اوپن سورس انفرنس سرور۔
رپورٹ شدہ نتائج، جنہیں آزادانہ طور پر قائم کردہ حقائق کے بجائے مصنفین کے دعووں کے طور پر پڑھنا چاہیے، یہ ہیں: خلاصہ جس چیز کو نمائندہ حقیقی دنیا کے ملٹی ایجنٹ ورک بوجھ کہتا ہے، کیش ہٹ ریٹ 10 سے 18 فیصد پوائنٹس تک بہتر ہوتا ہے، یعنی ٹائم ٹو فرسٹ ٹوکن گرتا ہے 18 سے 45 فیصد، یعنی فی ٹرن 3 فیصد بڑھتا ہے اور 29 فیصد اضافہ ہوتا ہے۔ 57 فیصد تک. خلاصہ مزید کہتا ہے کہ فوائد بڑے ماڈلز کے لیے عام ہوتے ہیں، جس میں ٹائم ٹو فرسٹ ٹوکن 54 فیصد اور تھرو پٹ 37 فیصد زیادہ ہوتا ہے۔ اس میں کام کے بوجھ، ماڈلز، GPUs، کیشے کے سائز، یا بیس لائن کنفیگریشن کو بیان کردہ سابقہ-کیچنگ-پلس-رینسی رویے سے آگے کا نام نہیں دیا گیا ہے، اور یہ کسی مطلق تاخیر کے اعداد و شمار کی اطلاع نہیں دیتا ہے۔
یہ کیوں اہمیت رکھتا ہے۔
ایجنٹ پروڈکٹس فی ٹاسک کئی ماڈل کالز کرتے ہیں، اور ہر کال عام طور پر ایک ہی سسٹم پرامپٹ، ٹول کی تعریفیں اور مثالیں دوبارہ بھیجتی ہے۔ اس مشترکہ سابقے کی دوبارہ گنتی کرنا بل کا ایک بڑا حصہ ہے اور اس انتظار کا جو صارف محسوس کرتا ہے۔ کیشے کو کام کے بہاؤ کے ڈھانچے سے قابل قیاس کچھ سمجھنا، بجائے اس کے کہ وہ اہداف جو ماڈل آؤٹ پٹس کو تبدیل کیے بغیر ضائع کرتے ہیں۔
ایجنٹ مصنوعات کی معاشیات بار بار سیاق و سباق پر منحصر ہے۔ ایک کوڈنگ اسسٹنٹ، کسٹمر سپورٹ ورک فلو، یا ایک ریسرچ ایجنٹ ایک کام کو ختم کرنے کے لیے درجنوں ماڈل کالز کر سکتا ہے، اور ہر کال عام طور پر ہدایات اور ٹول اسکیموں کی ایک لمبی، قریب قریب ایک جیسی تمہید کو دوبارہ بھیجتی ہے۔ اس تمہید کی پروسیسنگ کی لاگت — پری فل اسٹیج — ہر کال پر دوبارہ ادا کی جاتی ہے جب تک کہ سرور کیش شدہ حالت کو دوبارہ استعمال نہ کر سکے۔ جیسے جیسے ٹول انوینٹری بڑھتی ہیں، وہ مقررہ بلاک ان کے ساتھ بڑھتا ہے، اس لیے ایک ہی متن کو دوبارہ پڑھنے میں خرچ ہونے والے کمپیوٹ کا حصہ سکڑنے کے بجائے بڑھتا جاتا ہے۔
دو میٹرکس پر کاغذ براہ راست نقشہ پر زور دیتا ہے جو لوگ دیکھتے ہیں۔ ٹائم ٹو فرسٹ ٹوکن کسی بھی چیز کے ظاہر ہونے سے پہلے توقف ہے۔ فی موڑ میں تاخیر ایک قدم کے ختم ہونے کا انتظار ہے۔ ایک چیٹ بوٹ کے تبادلے میں، چند سو ملی سیکنڈز ایک معمولی جلن ہے؛ ایک ایجنٹ لوپ میں جو کئی مراحل کو زنجیروں میں جکڑتا ہے، اسی فی کال کی تاخیر کو کئی گنا بڑھا دیا جاتا ہے، اور یہ ایک عام وجہ ہے کہ ایجنٹ کی خصوصیات اس وقت بھی سست محسوس ہوتی ہیں جب بنیادی ماڈل تیز ہو۔ لیجر کے دوسری طرف تھرو پٹ کے معاملات: اعلی چوٹی کے تھرو پٹ کا مطلب ہے کہ ایک ہی ہارڈویئر زیادہ ہم آہنگی صارفین کی خدمت کرتا ہے، جو کہ GPUs کی ادائیگی کرنے والے ہر فرد کے لیے لاگت کا سوال ہے۔
تصوراتی اقدام اس خاص عمل کو ختم کرنے کا سب سے زیادہ امکان ہے۔ آپریٹنگ سسٹمز اور ویب سرورز سے مستعار کیشنگ پالیسیاں فرض کرتی ہیں کہ مستقبل ماضی قریب کی طرح لگتا ہے۔ ایجنٹ کے کام کا بوجھ اس مفروضے کی ایک منظم، قابل سیکھنے کے طریقے سے خلاف ورزی کرتا ہے، کیونکہ جس ترتیب میں ایجنٹ چلاتے ہیں وہ بے ترتیب کے بجائے درخواست کی خاصیت ہے۔ خاص طور پر، مصنفین کا کہنا ہے کہ وہ اس ڈھانچے کو آن لائن سیکھتے ہیں بجائے اس کے کہ ڈویلپرز کو ورک فلو گراف کا اعلان کرنے کی ضرورت ہوتی ہے - ایک ڈیزائن کا انتخاب جو اس بات پر فٹ بیٹھتا ہے کہ ایجنٹ کے فریم ورک کو حقیقت میں کیسے لکھا جاتا ہے، جس میں برانچنگ، مشروط روٹنگ، اور آرکیسٹریشن کا فیصلہ رن ٹائم کے وقت ماڈل کے ذریعے کیا جاتا ہے۔
کئی حدود واضح طور پر بیان کرنے کی مستحق ہیں۔ KV کیش کو دوبارہ استعمال کرنا کام کے لیے ایک کمپیوٹیشنل شارٹ کٹ ہے جو کہ ماڈل دوبارہ کرے گا، لہذا اصولی طور پر اسے ماڈل کے آؤٹ پٹس کو تبدیل نہیں کرنا چاہیے۔ خلاصہ آؤٹ پٹ کوالٹی یا درستگی کی جانچ پڑتال کی اطلاع نہیں دیتا ہے، لہذا یہ توقع اس بات کا اندازہ ہے کہ تکنیک کس طرح کام کرتی ہے بجائے اس کے کہ ذریعہ کی تصدیق کی جائے۔ حاصلات کا سائز کام کے بوجھ پر منحصر ہے جو حقیقی طور پر سیاق و سباق کو دہراتے ہیں، سسٹم پر بے دخلی کے فیصلوں کے لیے کافی میموری پریشر میں ہونے کی وجہ سے، اور ہارڈ ویئر پر۔ ایک بیس لائن کنفیگریشن کے مقابلے میں ماپا جانے والی فیصد بہتری بہتر ٹیونڈ کے مقابلے سکڑ سکتی ہے۔ پرایکٹیو پری فیچنگ میموری کی بینڈوتھ اور صلاحیت کو بھی استعمال کرتی ہے، اور خلاصہ یہ نہیں بتاتا کہ غلط پیشین گوئی کی کیا قیمت ہے۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
crm_get_transaction(id='4092').What most distinguishes an AI agent from a basic chatbot?
آگے کیا دیکھنا ہے۔
مکمل کاغذ کے کام کا بوجھ، ماڈلز، ہارڈ ویئر، اور بیس لائن کنفیگریشنز اس بات کا تعین کریں گی کہ رپورٹ شدہ فائدہ کا کتنا حصہ دیگر تعیناتیوں کے ساتھ رابطے میں رہتا ہے۔ یہ بھی دیکھنے کے قابل ہے: آیا کوڈ کو جاری کیا گیا ہے یا vLLM میں اپ اسٹریم کیا گیا ہے، آیا ٹیل لیٹینسیز رپورٹ شدہ اوسط کے ساتھ ساتھ بہتر ہوتی ہیں، اور جب ایجنٹ آرڈر حقیقی طور پر غیر متوقع ہوتا ہے تو سیکھا ہوا ماڈل کیسا برتاؤ کرتا ہے۔
جانچنے کے لیے پہلی چیز خلاصہ کی بجائے مکمل کاغذ ہے: کون سے ملٹی ایجنٹ ورک بوجھ استعمال کیے گئے تھے اور کیا وہ عوامی ہیں، کون سے ماڈلز اور GPUs، کام کرنے والے سیٹ کے مقابلے میں کیش کتنا بڑا تھا، اور بالکل کس طرح بیس لائن کو ترتیب دیا گیا تھا۔ پہلے سے طے شدہ vLLM سیٹ اپ کے خلاف موازنہ دوسرے کیشے سے آگاہ یا ٹائرڈ کیشنگ طریقوں کے مقابلے میں ایک کمزور امتحان ہے۔ ان تفصیلات کے بغیر، رپورٹ شدہ رینجز کو موجودہ سسٹمز کے کام کے خلاف رکھنا مشکل ہے۔
دوسرا، چاہے کوڈ ظاہر ہو۔ CacheScout کو vLLM کے اوپری حصے پر ایک پرت کے طور پر بیان کیا گیا ہے، لہذا عملی سوال یہ ہے کہ آیا اسے جاری کیا گیا ہے، کیا اسے اپ اسٹریمنگ کے لیے تجویز کیا گیا ہے، اور آیا انفرنس فراہم کرنے والے یا سرونگ فریم ورک مینٹینرز اس خیال کو اٹھاتے ہیں۔ اس قسم کے سسٹم پیپرز بنیادی طور پر نفاذ کے ذریعے تعیناتیوں پر اثر انداز ہوتے ہیں، اور ایک ایسی تکنیک جس کے لیے شیڈیولر میں ناگوار تبدیلیوں کی ضرورت ہوتی ہے اس سے زیادہ آہستہ سفر کرتی ہے جو موجودہ ایکسٹینشن پوائنٹ پر فٹ بیٹھتی ہے۔
تیسرا، مضبوطی. سیکھے ہوئے ٹرانزیشن ماڈل کو اس وقت سب سے زیادہ مدد کرنی چاہئے جب ایجنٹ آرڈر مستحکم ہو اور جب روٹنگ انتہائی متحرک یا مخالف ہو تو تنزلی ہو سکتی ہے، اور خلاصہ اس نظام میں رویے کی اطلاع نہیں دیتا ہے، اور نہ ہی بوجھ کے نیچے سیکھنے اور پری فیچنگ کی اوور ہیڈ۔ ملٹی کرایہ داروں کا رویہ ایک اور کھلا سوال ہے جس کا ذریعہ اس پر توجہ نہیں دیتا ہے: آیا ایک کام کا بوجھ دوسرے کو باہر نکالتا ہے، اور کیش شیئرنگ صارفین کے درمیان تنہائی کے ساتھ کس طرح تعامل کرتی ہے، جو عام طور پر سابقہ کے دوبارہ استعمال کے لیے ایک بار بار تشویش کا باعث رہا ہے۔
چوتھا، وہ نمبر جو رپورٹ نہیں کیے گئے۔ خلاصہ وقت سے پہلے ٹوکن اور فی موڑ تاخیر کے ذرائع فراہم کرتا ہے۔ 95 ویں یا 99 ویں پرسنٹائل پر ٹیل لیٹنسیز وہ ہیں جن کے خلاف سروس لیول کے معاہدے لکھے جاتے ہیں، اور ایسی پالیسی جو اوسط کو بہتر بناتی ہے وہ دم کو چھوڑ یا خراب کر سکتی ہے۔ آزاد نقل، ایک ہم مرتبہ جائزہ لینے کا مقام، اور کام کے بوجھ پر پیمائش جو مصنفین نے منتخب نہیں کی تھی ہر ایک کا اعتماد بڑھے گا۔ اس وقت تک یہ خود رپورٹ شدہ نتائج کے ساتھ ایک امید افزا سمت ہے، کوئی طے شدہ نتیجہ نہیں۔