ٹیکنیکل گائیڈ

پیجڈ توجہ اور وی ایل ایل ایم

PagedAttention میموری کے انتظام کی ایک تکنیک ہے جو زبان کے ماڈل کی توجہ کیش کو ایک بڑے ملحقہ حصے کی بجائے چھوٹے دوبارہ قابل استعمال بلاکس میں محفوظ کرتی ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It powers vLLM, an open-source serving engine that dramatically boosts how many requests a single GPU can handle.

گہرا غوطہ

جب ایک زبان کا ماڈل متن تیار کرتا ہے، تو یہ اپنے دیکھے ہوئے ہر ٹوکن کے لیے ایک 'KV کیش' (کلیدی اور قدر ویکٹر) رکھتا ہے تاکہ اگلا ٹوکن مکمل سیاق و سباق کو دیکھ سکے۔ روایتی طور پر ہر درخواست میں اس کی زیادہ سے زیادہ ممکنہ لمبائی کے لیے GPU میموری کا ایک بڑا متصل سلیب محفوظ کیا جاتا ہے، جب ترتیب چھوٹے یا لمبائی میں مختلف ہوتی ہے تو بڑی مقدار میں ضائع ہوتا ہے۔ PagedAttention، UC Berkeley کے 2023 vLLM پیپر میں متعارف کرایا گیا، آپریٹنگ سسٹمز سے ورچوئل میموری پیجنگ کا آئیڈیا لیتا ہے: یہ KV کیشے کو فکسڈ سائز بلاکس میں تقسیم کرتا ہے جو میموری میں کہیں بھی رہ سکتے ہیں اور ڈیمانڈ پر مختص کیے جا سکتے ہیں۔ ایک تلاش کی میز منطقی ٹوکن پوزیشنوں کو جسمانی بلاکس پر نقشہ بناتی ہے۔ یہ میموری کے ٹکڑے ہونے کو تقریباً ختم کرتا ہے اور بلاکس کو شیئر کرنے دیتا ہے، مثال کے طور پر ایک ہی پرامپٹ سے متعدد آؤٹ پٹس میں۔

تکنیکی بصیرت

KV کیشے کو مقررہ سائز کے صفحات میں تقسیم کیا جاتا ہے، ہر ایک میں ٹوکنز کی ایک مقررہ تعداد کے لیے کلیدیں اور قدریں ہوتی ہیں۔ فی سیکوینس بلاک ٹیبل منطقی پوزیشنز کو فزیکل پیج کے مقامات پر نقشہ بناتا ہے، اس لیے ایک سیکوینس کی کیش کو متصل ہونے کی ضرورت نہیں ہے۔ چونکہ یکساں سابقہ ​​(ایک مشترکہ سسٹم پرامپٹ، یا بیم سرچ برانچز) کاپی آن رائٹ کے ذریعے ایک ہی فزیکل پیجز کی طرف اشارہ کر سکتے ہیں، اس لیے میموری کو ڈپلیکیٹ کی بجائے دوبارہ استعمال کیا جاتا ہے، فضلے کو 60% سے کچھ فیصد تک کم کرتے ہیں۔

اسٹریٹجک اثر

لاگت اور بجٹ

فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔

واضح فیصلے

تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔

کوالٹی کنٹرول

انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔

PagedAttention اور vLLM کا مستقبل

vLLM پہلے سے طے شدہ اوپن سورس انفرنس بیک بون بن گیا ہے، اور PagedAttention کے آئیڈیاز اب زیادہ تر سرونگ اسٹیک پر ظاہر ہوتے ہیں۔ گہرے پریفکس کیشنگ کی توقع کریں (صارفین میں کیشڈ سسٹم پرامپٹس کو دوبارہ استعمال کرنا)، الگ الگ مشینوں پر الگ الگ پری فل اور ڈی کوڈ، بہتر بے دخلی کی پالیسیاں، اور کوانٹائزیشن اور قیاس آرائی پر مبنی ضابطہ کشائی کے ساتھ سخت انضمام کی توقع کریں۔ جیسے جیسے سیاق و سباق کی ونڈوز لاکھوں ٹوکنز میں بڑھ رہی ہے، موثر پیجڈ KV مینجمنٹ سستی خدمت کو برقرار رکھنے کے لیے اور زیادہ مرکزی بن جاتی ہے۔

حقیقی دنیا کا نفاذ

ایک اوپن سورس LLM API کی میزبانی کرنا جہاں vLLM ایک GPU سے بہت سے ہم آہنگ چیٹ صارفین کو اعلی تھرو پٹ پر پیش کرتا ہے۔

پریفکس کیشنگ کے ذریعے ہزاروں درخواستوں میں ایک طویل سسٹم پرامپٹ کا اشتراک کرنا تاکہ اس پر ایک بار کارروائی ہو، بار بار نہیں۔

رننگ بیم کی تلاش یا ایک سے زیادہ نمونے کی تکمیلیں جو کاپی آن رائٹ کے ذریعے عام پرامپٹ کے لیے KV بلاکس کا اشتراک کرتی ہیں۔

GPU میموری کے فضلے کو ٹکڑے کرنے سے کاٹنا تاکہ ایک فراہم کنندہ ایک ہی ہارڈ ویئر پر بیک وقت زیادہ سیشن پیک کر سکے۔

خطرات اور گارڈریلز

ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔

بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔

سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔

نفاذ کا روڈ میپ

1

نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔

2

حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔

3

غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔

4

اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PagedAttention and vLLM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اکثر پوچھے گئے سوالات

What is PagedAttention and vLLM?

PagedAttention میموری کے انتظام کی ایک تکنیک ہے جو زبان کے ماڈل کی توجہ کیش کو ایک بڑے ملحقہ حصے کی بجائے چھوٹے دوبارہ قابل استعمال بلاکس میں محفوظ کرتی ہے۔ یہ vLLM کو طاقت دیتا ہے، ایک اوپن سورس سرونگ انجن جو ڈرامائی طور پر بڑھاتا ہے کہ ایک GPU کتنی درخواستوں کو سنبھال سکتا ہے۔

ٹیکسٹ جنریشن کے دوران 'KV کیشے' کیا اسٹور کرتا ہے؟

KV کیشے میں ہر پہلے ٹوکن کے لیے کلیدی اور ویلیو ویکٹر ہوتے ہیں، جس سے ماڈل کو ہر قدم پر دوبارہ گنتی کیے بغیر مکمل سیاق و سباق میں شرکت کرنے دیتا ہے۔

کس آپریٹنگ سسٹم کے تصور نے PagedAttention کو متاثر کیا؟

PagedAttention ورچوئل میموری پیجنگ لیتا ہے: KV کیشے کو فکسڈ سائز کے صفحات میں تقسیم کیا جاتا ہے جو کسی بھی جگہ رہ سکتے ہیں، بلاک ٹیبل کے ذریعے نقشہ بنایا گیا ہے۔

روایتی KV کیش ایلوکیشن کے ساتھ کیا مسئلہ PagedAttention حل کرتا ہے؟

فی درخواست ایک بڑا متصل سلیب محفوظ کرنے سے، زیادہ سے زیادہ لمبائی کے لیے سائز، GPU میموری کی بڑی مقدار ضائع ہو جاتی ہے۔ پیجنگ مانگ کے مطابق چھوٹے بلاکس مختص کرتی ہے، کچرے کو کم کرتی ہے۔

PagedAttention کس طرح ایک سے زیادہ آؤٹ پٹ کو ایک مشترکہ پرامپٹ کے لیے میموری کا اشتراک کرنے دیتا ہے؟

ایک جیسے سابقے (مشترکہ اشارے یا بیم سرچ برانچز) ایک ہی فزیکل KV صفحات کا حوالہ دیتے ہیں، صرف اس صورت میں کاپی کرتے ہیں جب کوئی برانچ ہٹ جاتی ہے۔

vLLM اور PagedAttention اصل میں کہاں تیار کیا گیا تھا؟

vLLM اور PagedAttention الگورتھم 2023 کے ایک مقالے میں UC Berkeley سے نکلے اور تیزی سے وسیع پیمانے پر استعمال ہونے والا اوپن سورس سرونگ انجن بن گیا۔