ٹیکنیکل گائیڈ

KV کیشے آپٹیمائزیشن

KV کیش ان کنجیوں اور قدروں کو ذخیرہ کرتا ہے جو ایک ٹرانسفارمر نے پہلے ہی شمار کیا ہوا ہے لہذا یہ ہر نئے ٹوکن کے لیے دوبارہ کام نہیں کرتا ہے — لیکن یہ گیگا بائٹس تک غبارہ کر سکتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

KV cache optimization shrinks and manages that memory so models serve longer contexts to more users at once.

گہرا غوطہ

ایک ٹرانسفارمر میں، ہر نیا ٹوکن توجہ کی چابیاں (K) اور اقدار (V) کے ذریعے پچھلے تمام ٹوکنز پر حاضر ہوتا ہے۔ ہر قدم پر پورے تسلسل کے لیے K اور V کی دوبارہ گنتی کرنا چوکور اور فضول ہوگا، اس لیے ماڈلز انہیں کیش کرتے ہیں: KV کیشے۔ منفی پہلو سائز ہے۔ کیشے ترتیب کی لمبائی، بیچ کے سائز، تہوں اور سروں کے ساتھ لکیری طور پر بڑھتا ہے، لہذا طویل سیاق و سباق کی درخواست ماڈل کے وزن سے زیادہ GPU میموری استعمال کر سکتی ہے۔ اصلاح کئی زاویوں سے اس سے نمٹتی ہے: پیجڈ میموری (vLLM's PagedAttention) کیشے کو غیر متصل بلاکس میں ذخیرہ کرتا ہے تاکہ فریگمنٹیشن کو ختم کیا جا سکے اور شیئرنگ کو فعال کیا جا سکے۔ کوانٹائزیشن K اور V کو 8 بٹ یا 4 بٹ میں اسٹور کرتی ہے۔ اور آرکیٹیکچرل تبدیلیاں جیسے گروپڈ-کوئیری اٹینشن (GQA) اور ملٹی-Query Attention (MQA) بہت سے استفسار کے سروں کو کم کلید/ویلیو ہیڈز کا اشتراک کرنے دیتے ہیں، ماخذ پر کیشے کے سائز کو کم کرتے ہیں۔

تکنیکی بصیرت

PagedAttention آپریٹنگ سسٹمز سے ورچوئل میموری پیجنگ لیتا ہے: کیشے ایک لوک اپ ٹیبل کے ذریعے میپ کیے گئے مقررہ سائز کے بلاکس میں رہتا ہے، لہذا درخواستیں صرف ان بلاکس کا استعمال کرتی ہیں جن کی انہیں ضرورت ہوتی ہے اور ایک جیسے سابقے (جیسے مشترکہ سسٹم پرامپٹ) انہی بلاکس کی طرف اشارہ کر سکتے ہیں۔ ملٹی ہیڈ لیٹنٹ اٹینشن (ایم ایل اے)، جو ڈیپ سیک ماڈلز میں استعمال ہوتا ہے، K اور V کو ایک چھوٹے مشترکہ لیٹنٹ ویکٹر میں کمپریس کرتا ہے، درستگی کو برقرار رکھتے ہوئے ڈرامائی طور پر میموری کو کاٹتا ہے۔

اسٹریٹجک اثر

لاگت اور بجٹ

فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔

واضح فیصلے

تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔

کوالٹی کنٹرول

انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔

KV کیشے آپٹیمائزیشن کا مستقبل

جیسا کہ سیاق و سباق کی کھڑکی سیکڑوں ہزاروں یا لاکھوں ٹوکنز تک پھیلی ہوئی ہے، KV کیش سرونگ کی غالب قیمت بن جاتی ہے۔ جارحانہ کیش کمپریشن اور بے دخلی (کم توجہ والے ٹوکنز چھوڑنا)، بطور ڈیفالٹ کراس ریکوئسٹ پریفکس شیئرنگ، CPU یا NVMe پر کولڈ کیش آف لوڈ کرنے، اور ایم ایل اے اور جی کیو اے جیسے فن تعمیر کے معیاری بننے کی توقع کریں۔ کیشے کا انتظام تیزی سے درجات اور سمارٹ پری فیچنگ کے ساتھ مکمل میموری کے درجہ بندی سے مشابہ ہوگا۔

حقیقی دنیا کا نفاذ

vLLM کی پیجڈ توجہ میموری کے ٹکڑے کیے بغیر KV بلاکس کو پیک کرکے بہت سے ہم آہنگی چیٹ سیشنز پیش کرتی ہے۔

لاما ماڈلز میں گروپ شدہ سوال کی توجہ KV کیشے کے سائز کو کم کرتی ہے تاکہ طویل سیاق و سباق GPU میموری میں فٹ ہوجائیں

طویل دستاویز کے خلاصے کے دوران کیش میموری کو تقریباً نصف کرنے کے لیے KV کیشے کو 8-bit (KV8) پر کوانٹائز کرنا

پریفکس کیشنگ جو ہزاروں API درخواستوں میں مشترکہ سسٹم پرامپٹ کے KV بلاکس کو دوبارہ استعمال کرتی ہے۔

خطرات اور گارڈریلز

ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔

بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔

سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔

نفاذ کا روڈ میپ

1

نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔

2

حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔

3

غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔

4

اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KV Cache Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اکثر پوچھے گئے سوالات

What is KV Cache Optimization?

KV کیش ان کنجیوں اور قدروں کو ذخیرہ کرتا ہے جو ایک ٹرانسفارمر نے پہلے ہی شمار کیا ہوا ہے لہذا یہ ہر نئے ٹوکن کے لیے دوبارہ کام نہیں کرتا ہے — لیکن یہ گیگا بائٹس تک غبارہ کر سکتا ہے۔ KV کیش آپٹیمائزیشن اس میموری کو سکڑتی اور منظم کرتی ہے تاکہ ماڈلز ایک ساتھ زیادہ صارفین کو طویل سیاق و سباق فراہم کریں۔

KV کیش کیا ذخیرہ کرتا ہے اور کیوں؟

پہلے والے ٹوکنز سے کیشز اور ویلیوز کو کیش کرنا ہر نئے ٹوکن پر توجہ کی گنتی کو دوبارہ کرنے سے گریز کرتا ہے، وقت کی بچت کرتا ہے۔

KV کیش میموری کا مسئلہ کیوں بن سکتا ہے؟

سیاق و سباق کی لمبائی اور ہم آہنگی کے ساتھ کیشے کا سائز پیمانہ، لہذا طویل درخواستیں GPU میموری کی بہت زیادہ مقدار استعمال کرسکتی ہیں۔

PagedAttention کس آپریٹنگ سسٹم کا تصور لیتا ہے؟

PagedAttention OS پیجنگ کی طرح ٹیبل کے ذریعے میپ کیے گئے غیر متصل فکسڈ سائز بلاکس میں کیشے کو اسٹور کرتا ہے۔

گروپ شدہ سوال اور ملٹی سوال کی توجہ KV کیشے کے سائز کو کیسے کم کرتی ہے؟

ایک سے زیادہ استفسار کے سروں پر کلید/ویلیو ہیڈز کا اشتراک کرنے کا مطلب ہے ذخیرہ کرنے کے لیے بہت کم K اور V ویکٹرز۔

KV کیشے میں پریفکس شیئرنگ کا ایک فائدہ کیا ہے؟

ایک مشترکہ سسٹم پرامپٹ ایک جیسی KV اندراجات تیار کرتا ہے، لہذا متعدد درخواستیں ان کو نقل کرنے کے بجائے ایک ہی بلاکس کی طرف اشارہ کر سکتی ہیں۔