زبان AI گائیڈ

کے وی کیشے

KV کیش کلیدی اور ویلیو ویکٹرز کو اسٹور کرتا ہے جو ایک ٹرانسفارمر نے پچھلے ٹوکنز کے لیے پہلے ہی شمار کیا ہے، اس لیے اسے ہر نئے لفظ کے لیے ان کی دوبارہ گنتی کرنے کی ضرورت نہیں ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It is the single biggest reason text generation is fast — and the main thing eating your GPU memory during long conversations.

گہرا غوطہ

ٹرانسفارمرز ایک وقت میں ٹیکسٹ ایک ٹوکن تیار کرتے ہیں، اور ہر نئے ٹوکن کی توجہ کی پرت کو ہر سابقہ ​​ٹوکن سے موازنہ کرنے کی ضرورت ہوتی ہے۔ توجہ کا طریقہ کار ہر ٹوکن کو استفسار، کلید اور قدر ویکٹر میں بدل دیتا ہے۔ کیشنگ کے بغیر، ٹوکن نمبر 1,000 پیدا کرنے کا مطلب ہر قدم پر تمام 999 پہلے ٹوکنز کے لیے کلیدوں اور قدروں کو دوبارہ گننا ہوگا — چوکور، فضول کام۔ KV کیش ان کلیدوں اور قدر ویکٹرز کو محفوظ کرتا ہے جب ان کی پہلی گنتی کی جاتی ہے اور ان کا دوبارہ استعمال کیا جاتا ہے، لہذا ہر نیا مرحلہ صرف ایک تازہ ترین ٹوکن کے لیے ویکٹر کی گنتی کرتا ہے اور ذخیرہ شدہ کیش پر حاضر ہوتا ہے۔ یہ فی ٹوکن لاگت کو ترتیب کی لمبائی کے ساتھ سکیلنگ سے کم کر کے تقریباً مستقل کر دیتا ہے۔ ٹریڈ آف میموری ہے: کیشے سیاق و سباق کی لمبائی، تہوں کی تعداد، اور توجہ کے سروں کے ساتھ لکیری طور پر بڑھتا ہے، اکثر طویل سیاق و سباق کی خدمت میں غالب میموری صارف بن جاتا ہے۔

تکنیکی بصیرت

'پری فل' مرحلے کے دوران ماڈل پورے پرامپٹ پر کارروائی کرتا ہے اور کیشے کو بھرتا ہے۔ 'ڈی کوڈ' کے دوران یہ فی قدم ایک ٹوکن کے K/V کو جوڑتا ہے اور دوبارہ اٹینڈ کرتا ہے۔ کیشے کا سائز 2 (K اور V) × تہوں × ہیڈز × ہیڈ_ڈیم × تسلسل_لمبائی × بیچ کے طور پر، منتخب کردہ درستگی میں۔ اس پر قابو پانے کے لیے، جدید ماڈلز کلیدوں/ قدروں کو سروں پر بانٹنے کے لیے گروپ شدہ سوال یا کثیر استفسار کی توجہ کا استعمال کرتے ہیں، اور vLLM جیسے سرونگ سسٹم غیر متصل بلاکس میں کیشے مختص کرنے، ٹکڑے ٹکڑے کرنے اور فضلہ کو کاٹنے کے لیے PagedAttention کا استعمال کرتے ہیں۔

اسٹریٹجک اثر

رفتار اور پیمانہ

زبان کے کام کے بہاؤ مستقل مزاجی کی قربانی کے بغیر تیزی سے آگے بڑھ سکتے ہیں۔

رسائی اور رسائی

یہ زبانوں اور مواصلاتی طرزوں تک رسائی کو بڑھاتا ہے۔

واضح فیصلے

ٹیمیں فیصلے پر زیادہ وقت گزار سکتی ہیں جبکہ آٹومیشن تکرار کو سنبھالتی ہے۔

کے وی کیشے کا مستقبل

جیسا کہ سیاق و سباق کی ونڈوز لاکھوں ٹوکنز تک پھیلی ہوئی ہے، KV کیش مرکزی رکاوٹ بن جاتا ہے، اس لیے جدت بہت زیادہ ہے: 8 یا 4 بٹس تک کیشے کوانٹائزیشن، بے دخلی کی پالیسیاں جو کم اہمیت والے ٹوکنز کو چھوڑ دیتی ہیں، کراس ریکوسٹ پریفکس شیئرنگ، اور CPU یا ڈسک پر آف لوڈ کرنا۔ آرکیٹیکچرل تبدیلیاں جیسے ملٹی ہیڈ لیٹنٹ توجہ کیشے کو ہی کمپریس کرتی ہے۔ توجہ کے متغیرات اور میموری سسٹمز کے مسلسل مشترکہ ڈیزائن کی توقع کریں جس کا مقصد بہت طویل سیاق و سباق کو سستے اور اعلی تھرو پٹ پر پیش کرنا ہے۔

حقیقی دنیا کا نفاذ

چیٹ بوٹ کے جوابات کو ہر موڑ پر دوبارہ پروسیس کرنے کے بجائے گفتگو کی سرگزشت سے کیش شدہ کلیدوں/اقداروں کو دوبارہ استعمال کرکے تیز کرنا۔

پریفکس کیشنگ جو لاگت اور تاخیر کو کم کرتے ہوئے ایک طویل سسٹم پرامپٹ کے لیے کیش کو بہت سارے صارفین میں شیئر کرتی ہے۔

vLLM کا PagedAttention بلاکس میں KV کیشے کا انتظام کرتا ہے تاکہ ایک GPU پر متعدد ہم آہنگی کی درخواستوں کو مؤثر طریقے سے پیش کیا جا سکے۔

محدود GPU میموری میں طویل سیاق و سباق کو فٹ کرنے کے لیے کم درستگی کے لیے KV کیشے کو کوانٹائز کرنا۔

خطرات اور گارڈریلز

گمراہ شدہ حقائق خاموشی سے رپورٹس، سپورٹ فلو، یا تحقیقی نتائج درج کر سکتے ہیں۔

فوری حساسیت اسی طرح کی درخواستوں میں متضاد نتائج پیدا کر سکتی ہے۔

اگر رسائی کے کنٹرول کمزور ہیں تو حساس ٹیکسٹ ڈیٹا کو بے نقاب کیا جا سکتا ہے۔

نفاذ کا روڈ میپ

1

رول آؤٹ سے پہلے آؤٹ پٹ فارمیٹ، ٹون اور معیار کے معیارات کی وضاحت کریں۔

2

جب بھی درستگی اہمیت رکھتی ہے تو بھروسہ مند ذرائع کے ساتھ زمینی جوابات۔

3

ہائی اسٹیک آؤٹ پٹس کے لیے ایک انسانی جائزہ چیک پوائنٹ رکھیں۔

4

ناکامی کے نمونوں کو ٹریک کریں اور پرامپٹس یا ورک فلو کو باقاعدگی سے دوبارہ تربیت دیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KV Cache quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اکثر پوچھے گئے سوالات

What is KV Cache?

KV کیش کلیدی اور ویلیو ویکٹرز کو اسٹور کرتا ہے جو ایک ٹرانسفارمر نے پچھلے ٹوکنز کے لیے پہلے ہی شمار کیا ہے، اس لیے اسے ہر نئے لفظ کے لیے ان کی دوبارہ گنتی کرنے کی ضرورت نہیں ہے۔ ٹیکسٹ جنریشن کے تیز ہونے کی یہ واحد سب سے بڑی وجہ ہے - اور لمبی بات چیت کے دوران آپ کی GPU میموری کو کھا جانا اہم چیز ہے۔

KV کیشے کیا ذخیرہ کرتا ہے؟

KV کیشے میں پہلے والے ٹوکنز سے کلید اور ویلیو ویکٹر ہوتے ہیں تاکہ توجہ ان کو دوبارہ گنتی کے بجائے دوبارہ استعمال کر سکے۔

KV کیش بنیادی طور پر کون سا مسئلہ حل کرتا ہے؟

کیشنگ کے بغیر، ہر نئے ٹوکن کو ہر پچھلے ٹوکن کے لیے K/V کی دوبارہ گنتی کی ضرورت ہوگی، جو کہ فضول ہے۔ کیشے فی ٹوکن لاگت کو تقریباً مستقل بناتا ہے۔

KV کیشے کا بنیادی نقصان کیا ہے؟

کیش ترتیب کی لمبائی، تہوں اور سروں کے ساتھ بڑھتا ہے، اکثر طویل سیاق و سباق کی خدمت میں GPU میموری کا غالب صارف بن جاتا ہے۔

کون سی تکنیک توجہ کے سروں پر کلیدوں اور قدروں کو بانٹ کر KV کیشے کا سائز کم کرتی ہے؟

گروپ شدہ استفسار اور کثیر استفسار کی توجہ سے متعدد استفسار کے سروں کو کم کلید/ویلیو سیٹ کا اشتراک کرنے دیتا ہے، کیشے کو کافی حد تک سکڑتا ہے۔

KV کیشے کے نسبت ٹرانسفارمر انفرنس کے دو مراحل کیا ہیں؟

پری فل کیشے کو پرامپٹ کے K/V سے بھرتا ہے۔ ڈی کوڈ ہر قدم پر ایک نئے ٹوکن کے K/V کو جوڑتا ہے اور کیشے پر دوبارہ جوڑتا ہے۔