کیا ہوا؟
محققین لیوک وانگ، ژو لی اور گوانگ سو ژو نے VisCache متعارف کرایا، جو وژن لینگویج کے بڑے لینگویج ماڈلز میں طویل سیاق و سباق کے تخمینے کے حساب اور میموری کے اخراجات کو کم کرنے کا ایک فریم ورک ہے۔ یہ مقالہ 25 اگست 2026 کو arXiv کو جمع کرایا گیا تھا، اور اس میں دو مراحل کا طریقہ بیان کیا گیا ہے جو ماڈل کی توجہ کے عمل کے لیے اہم معلومات کو محفوظ رکھنے کی کوشش کرتے ہوئے بے کار بصری معلومات کو ہٹاتا ہے۔
یہ کاغذ وژن لینگویج کے بڑے لینگویج ماڈلز میں ایک مخصوص سسٹم کے مسئلے کو حل کرتا ہے: طویل سیاق و سباق کے تخمینے کے لیے کافی حساب اور میموری کی ضرورت پڑ سکتی ہے کیونکہ ماڈل بصری کلیدی قدر، یا KV، کیچز کو برقرار رکھتا ہے۔ یہ کیچز توجہ کے طریقہ کار کا حصہ ہیں اور ماڈل کے طور پر استعمال ہونے والی معلومات کو بعد میں ٹوکنز پر عمل کرتے ہیں۔ مصنفین کا استدلال ہے کہ کمپریشن کے موجودہ طریقے اکثر بصری ٹوکن اور ماڈل کی تہوں کو یکساں طور پر کاٹ دیتے ہیں، جو معلومات کو غیر مساوی طور پر ضائع کر سکتے ہیں اور کارکردگی کو کم کر سکتے ہیں۔ VisCache کو ایک غیر تربیتی، پلگ اینڈ پلے فریم ورک کے طور پر پیش کیا گیا ہے جس کا مقصد اس کمپریشن کو مزید انتخابی بنانا ہے۔
VisCache کے رپورٹ کردہ دو مراحل ہیں۔ سب سے پہلے، ایک ہلکا پھلکا وژن لینگوئج ماڈل صرف لفظی طور پر معلوماتی کلیدی فریموں کو آگے بڑھا کر وقتی فالتو پن کو فلٹر کرتا ہے۔ اس کا مقصد تسلسل میں بار بار بصری معلومات کو کم کرنا ہے جہاں بہت سے ملحقہ فریم تھوڑا سا نیا مواد فراہم کرتے ہیں۔ دوسرا، کاغذ PruneKV متعارف کرایا ہے، ایک الگورتھم جو بصارت کی زبان کے ماڈلز کے توجہ کے رویے کے ارد گرد ڈیزائن کیا گیا ہے۔ خلاصہ کہتا ہے کہ PruneKV تہوں میں کٹائی کے بجٹ کی ایک پیرابولک مختص اور ایک غیر متناسب اپ ڈیٹ کے طریقہ کار کا استعمال کرتا ہے: یہ اقدار کو فیوز کرتے ہوئے منتخب طور پر کیز کو کاٹتا ہے۔ بیان کردہ مقصد ذخیرہ شدہ کیشے کو سکڑتے ہوئے اہم سیاق و سباق کو محفوظ رکھنا ہے۔
خلاصہ کے ذریعے کیے گئے تجربات میں، مصنفین نے رپورٹ کیا ہے کہ VisCache نے 2.35 گنا انفرنس اسپیڈ اپ حاصل کیا اور KV کیشے کے صرف 19% سے 28% کو برقرار رکھتے ہوئے میموری کا استعمال کم کیا۔ وہ یہ بھی کہتے ہیں کہ اس نے موجودہ بنیادی خطوط کے خلاف مسابقتی کارکردگی کو برقرار رکھا اور ایک سازگار کارکردگی-کارکردگی ٹریڈ آف پیدا کیا۔ ماخذ کام کی شناخت arXiv پری پرنٹ کے ورژن 1 کے طور پر کرتا ہے اور کہتا ہے کہ کوڈ دستیاب ہے، لیکن یہ ٹیسٹ شدہ ماڈل کے نام، ڈیٹا سیٹس، ٹاسک لیول اسکور، ہارڈویئر کنفیگریشن، تاخیر کی پیمائش، غلطی کی شرح یا زیادہ سے زیادہ رفتار کے پیچھے صحیح حالات فراہم نہیں کرتا ہے۔
یہ کیوں اہمیت رکھتا ہے۔
اگر رپورٹ شدہ نتائج مصنفین کے تجربات سے آگے ہیں، تو بصری KV-کیشے کی ضروریات کو کم کرنے سے طویل سیاق و سباق کے وژن لینگویج سسٹم کو کم مہنگا اور میموری کی رکاوٹوں کے تحت چلانے میں آسانی ہو سکتی ہے۔ یہ ان ایپلی کیشنز کے لیے اہمیت رکھتا ہے جو لمبی ویڈیوز، تصویری ترتیب یا دیگر ملٹی موڈل ان پٹس کا تجزیہ کرتی ہیں، حالانکہ ماخذ پیداوار کی تیاری، وسیع ماڈل کی مطابقت یا حقیقی دنیا کی کارکردگی کو قائم نہیں کرتا ہے۔
کام کی عملی اہمیت ماڈل ٹریننگ کے بجائے اندازہ پر توجہ دینے سے ہوتی ہے۔ وژن لینگویج سسٹم جو طویل ویڈیوز یا توسیعی تصویری ترتیبوں پر کارروائی کرتے ہیں وہ ماڈل کے تربیت یافتہ ہونے کے بعد بھی میموری اور بار بار کی گنتی کے ذریعے محدود ہو سکتے ہیں۔ ایک ایسا طریقہ جو زیادہ تر کام کی کارکردگی کو بہت چھوٹے بصری کیش کے ساتھ محفوظ رکھتا ہے، دستیاب ایکسلریٹر میموری میں مزید ان پٹ کو فٹ ہونے، کیشڈ ڈیٹا کی نقل و حرکت کو کم کرنے اور ملٹی موڈل سروسز کی لاگت یا تاخیر کو ممکنہ طور پر کم کرنے کی اجازت دیتا ہے۔ یہ رپورٹ شدہ میکانزم کے مضمرات ہیں، ماخذ کے ذریعہ آزادانہ طور پر قائم کردہ نتائج نہیں۔
مجوزہ نقطہ نظر اس بات پر بھی روشنی ڈالتا ہے کہ کیوں بصری سیاق و سباق کو متن کے سیاق و سباق سے مختلف علاج کی ضرورت ہو سکتی ہے۔ ایک ویڈیو میں بہت سے فریم ہو سکتے ہیں جن میں معمولی سیمینٹک تبدیلی ہو سکتی ہے، جبکہ فریموں کی ایک چھوٹی تعداد میں ایسی معلومات ہو سکتی ہیں جو سوال کا جواب دینے کے لیے ضروری ہے۔ اسی طرح، بصری نمائندگی کی اہمیت ماڈل کی تہوں میں مختلف ہو سکتی ہے۔ کاغذ کی کی فریم فلٹرنگ اور پرت پر منحصر کٹائی ہر جگہ ایک برقرار رکھنے کے اصول کو لاگو کرنے کے بجائے ان اختلافات کے ارد گرد ڈیزائن کی گئی ہے۔ اگر نقطہ نظر مضبوط ہے، تو یہ ڈویلپرز کو ملٹی موڈل ماڈلز کے وسائل کی مانگ کو منظم کرنے کا ایک اور طریقہ دے سکتا ہے بغیر کسی کمپریسڈ نمائندگی کے لیے ہر ماڈل کو دوبارہ تربیت دے۔
دعوے ابتدائی ہیں۔ ماخذ ایک arXiv جمع آوری ہے، ہم مرتبہ کی طرف سے نظرثانی شدہ قبولیت یا آزاد نقل کا ثبوت نہیں۔ "مسابقتی کارکردگی" ایک قطعی ضمانت نہیں ہے، اور خلاصہ یہ نہیں بتاتا ہے کہ آیا یہ طریقہ کاموں، ویڈیو کی لمبائی، تصویر کی اقسام یا ناکامی کے لیے حساس ایپلی کیشنز میں یکساں طور پر درستگی کو محفوظ رکھتا ہے۔ اور نہ ہی یہ اس بات کو قائم کرتا ہے کہ اطلاع دی گئی رفتار براہ راست کم کلاؤڈ بلز یا بہتر صارف کی نظر آنے والی تاخیر میں ترجمہ کرے گی، کیونکہ ان نتائج کا انحصار ہارڈ ویئر، سافٹ ویئر کے نفاذ، بیچنگ اور اضافی فلٹرنگ مرحلے کی لاگت پر ہوتا ہے۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
Which component of an AI application is the machine-learning model itself?
آگے کیا دیکھنا ہے۔
اہم سوالات یہ ہیں کہ کیا VisCache مختلف وژن لینگویج ماڈلز، کاموں، بصری ان پٹ اور ہارڈ ویئر کے ماحول کو عام کرتا ہے، اور مشکل صورتوں میں کتنی درستگی ضائع ہو جاتی ہے۔ آزاد نقل، جاری کردہ کوڈ اور تفصیلی بینچ مارک کے نتائج اس بات کا جائزہ لینے کے لیے اہم ہوں گے کہ آیا رپورٹ کردہ کارکردگی کے فوائد وسیع پیمانے پر مفید نظام کی پیش قدمی کی نمائندگی کرتے ہیں یا نتیجہ کاغذ کے ٹیسٹ کی شرائط تک محدود ہے۔
پہلی ترجیح تولیدی صلاحیت ہے۔ مصنفین کا کہنا ہے کہ کوڈ دستیاب ہے، لہذا باہر کے محققین اور انجینئر یہ جانچ کر سکتے ہیں کہ آیا رپورٹ کردہ 2.35 گنا زیادہ سے زیادہ رفتار اور 19% سے 28% برقرار رکھنے کی حد انہی ترتیبوں پر دوبارہ آتی ہے۔ مفید تصدیق میں مکمل بیس لائن تعریفیں، ماڈل اور ڈیٹاسیٹ کوریج، اینڈ ٹو اینڈ لیٹینسی، چوٹی میموری، توانائی کا استعمال اور ہلکے وزن کے فلٹرنگ ماڈل کے ذریعے متعارف کرایا گیا اوور ہیڈ شامل ہوگا۔ اکیلے زیادہ سے زیادہ نتیجہ کام کے بوجھ میں عام فائدہ نہیں دکھاتا ہے۔
محققین کو کٹائی کی وجہ سے ہونے والی کوالٹی کی ناکامیوں کا بھی جائزہ لینا چاہیے۔ کلیدی فریم کا انتخاب مختصر لیکن اہم واقعات کو ہٹا سکتا ہے، جبکہ جارحانہ کیش کمپریشن اشیاء، اعمال یا تعلقات کو متاثر کر سکتا ہے جو صرف ایک بار ظاہر ہوتے ہیں۔ غیر متناسب کلید کی کٹائی اور ویلیو فیوژن ڈیزائن کچھ معلومات کو یکساں کٹائی سے بہتر طور پر محفوظ رکھ سکتا ہے، لیکن ماخذ اس بات کی نشاندہی نہیں کرتا ہے کہ کون سے کام سب سے زیادہ حساس ہیں یا برقرار رکھنے میں کمی کے ساتھ ہی غلطیاں کیسے بدل جاتی ہیں۔ اس لیے تشخیص کو چھوٹی بصری تفصیلات کی بازیافت، طویل فاصلے تک عارضی استدلال اور مخالفانہ یا مبہم ترتیبوں کی جانچ کرنی چاہیے، نہ صرف مجموعی اسکورز۔
آخر میں، تعیناتی کے دعووں کو تحقیقی دعووں سے الگ کیا جانا چاہیے۔ اس ماخذ سے یہ معلوم نہیں ہے کہ کون سے وژن لینگویج ماڈل VisCache کو بغیر کسی ترمیم کے استعمال کر سکتے ہیں، آیا یہ طریقہ مختلف ایکسلریٹر اقسام میں کام کرتا ہے، یا اس کے فوائد اس وقت باقی رہتے ہیں جب ماڈلز بیک وقت بہت سے صارفین کی خدمت کرتے ہیں۔ کاغذ کے مستقبل کے ورژن، ہم مرتبہ کا جائزہ لیا گیا تجزیہ، وسیع تر بینچ مارکس اور آزاد صارفین کی رپورٹیں ان نکات کو واضح کر سکتی ہیں۔ اس وقت تک، VisCache کو رپورٹ شدہ کارکردگی کے فوائد کے ساتھ ایک امید افزا تحقیقی تجویز کے طور پر سمجھا جاتا ہے، نہ کہ طویل سیاق و سباق کے ملٹی موڈل انفرنس کے لیے ایک ثابت شدہ آفاقی حل کے طور پر۔