زبان AI گائیڈ

ملٹی ہیڈ لیٹنٹ توجہ

ملٹی ہیڈ لیٹنٹ اٹینشن (MLA) ایک توجہ کا طریقہ کار ہے، جسے DeepSeek-V2 میں متعارف کرایا گیا ہے، جو میموری کی بھوک لگی کلیدی قدر کے کیشے کو ایک چھوٹے مشترکہ لیٹنٹ ویکٹر میں کمپریس کرتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It lets large language models run with far less GPU memory while keeping quality close to standard attention.

گہرا غوطہ

جب ایک ٹرانسفارمر ٹیکسٹ بناتا ہے، تو یہ 'KV کیش' میں ہر ماضی کے ٹوکن کے لیے ایک کلید اور ویلیو ویکٹر محفوظ کرتا ہے۔ یہ کیش سیاق و سباق کی لمبائی کے ساتھ بڑھتا ہے اور اندازہ کے دوران میموری کے استعمال پر حاوی ہوتا ہے۔ ایم ایل اے بہت سے فل سائز کی کلید/ویلیو ویکٹرز کو فی ٹوکن واحد کم درجے کے لیٹنٹ ویکٹر سے بدل دیتا ہے، پھر ایسے پروجیکٹس جو فی ہیڈ کیز اور قدروں میں لیٹٹ بیک اپ ہو جاتے ہیں۔ چونکہ صرف کمپیکٹ لیٹنٹ کو کیش کیا جاتا ہے، ڈیپ سیک-V2 نے معیاری ملٹی ہیڈ توجہ کے مقابلے میں KV-کیشے میموری کو 90% سے زیادہ کم کرنے کی اطلاع دی ہے، جس سے طویل سیاق و سباق اور بڑے بیچ سائز کو قابل بنایا جا سکتا ہے۔ اہم طور پر، اپ پروجیکشن میٹرکس کو دوسرے وزنوں میں جوڑا جا سکتا ہے، لہذا ایم ایل اے اس کمپریشن کو ماڈلنگ کے معیار میں بہت کم یا کسی قابل پیمائش نقصان کے ساتھ حاصل کرتا ہے۔

تکنیکی بصیرت

ایم ایل اے کم درجے کا مشترکہ کمپریشن انجام دیتا ہے: ہر ٹوکن کی پوشیدہ حالت کو ایک چھوٹے سے اویکت ویکٹر پر پیش کیا جاتا ہے، اور الگ الگ اپ پروجیکشن میٹرکس فی سر کیز اور اقدار کو دوبارہ تشکیل دیتے ہیں۔ ایک ہوشیار چال استفسار اور آؤٹ پٹ تخمینوں میں اپ-پروجیکشن وزن کو 'جذب' کر رہی ہے، لہذا ماڈل کبھی بھی تخمینہ کے دوران مکمل کلیدوں/اقداروں کو عملی شکل نہیں دیتا ہے۔ روٹری پوزیشن ایمبیڈنگز کو ڈیکپلڈ کلیدی راستے کے ساتھ ہینڈل کیا جاتا ہے، کیونکہ گردش کو اسی طرح جذب نہیں کیا جا سکتا، پوزیشن کی معلومات کو محفوظ رکھا جاتا ہے۔

اسٹریٹجک اثر

رفتار اور پیمانہ

زبان کے کام کے بہاؤ مستقل مزاجی کی قربانی کے بغیر تیزی سے آگے بڑھ سکتے ہیں۔

رسائی اور رسائی

یہ زبانوں اور مواصلاتی طرزوں تک رسائی کو بڑھاتا ہے۔

واضح فیصلے

ٹیمیں فیصلے پر زیادہ وقت گزار سکتی ہیں جبکہ آٹومیشن تکرار کو سنبھالتی ہے۔

ملٹی ہیڈ لیٹینٹ توجہ کا مستقبل

ایم ایل اے نے DeepSeek-V2 اور V3 کو پیمانے پر کام کرنے کے لیے اقتصادی بنانے میں مدد کی، اور یہ تکنیک پھیل رہی ہے کیونکہ ٹیمیں سستے طویل سیاق و سباق کا تعاقب کرتی ہیں۔ ایم ایل اے طرز کی اویکت کمپریشن کی توقع ہے کہ مستقبل کے کھلے ماڈلز میں اسپارس مکسچر آف ایکسپرٹس لیئرز، کوانٹائزڈ کیچز، اور قیاس آرائی پر مبنی ڈی کوڈنگ کے ساتھ مل جائے گی۔ محققین یہ بھی تلاش کر رہے ہیں کہ معیار کے گرنے سے پہلے اویکت طول و عرض کس حد تک سکڑ سکتا ہے، اور کیا یہی کم درجہ کا خیال تربیت کے دوران توجہ کو دبا سکتا ہے، نہ کہ صرف اندازہ۔

حقیقی دنیا کا نفاذ

فی درخواست ڈرامائی طور پر چھوٹے GPU میموری فوٹ پرنٹس کے ساتھ DeepSeek-V2/V3 چیٹ ماڈلز کی خدمت کرنا

طویل دستاویز کے سوال کا جواب دینا جہاں ایک بڑا KV کیش بصورت دیگر VRAM کو ختم کردے گا۔

ایک مقررہ GPU پر تخمینہ بیچ کے سائز کو بڑھانا کیونکہ ہر ترتیب صرف ایک چھوٹا سا لیٹنٹ ویکٹر ذخیرہ کرتا ہے۔

دوبارہ حاصل کرنے والے بڑھے ہوئے معاونین کے لیے کموڈٹی ہارڈویئر پر طویل سیاق و سباق کی ونڈوز کو فعال کرنا

خطرات اور گارڈریلز

گمراہ شدہ حقائق خاموشی سے رپورٹس، سپورٹ فلو، یا تحقیقی نتائج درج کر سکتے ہیں۔

فوری حساسیت اسی طرح کی درخواستوں میں متضاد نتائج پیدا کر سکتی ہے۔

اگر رسائی کے کنٹرول کمزور ہیں تو حساس ٹیکسٹ ڈیٹا کو بے نقاب کیا جا سکتا ہے۔

نفاذ کا روڈ میپ

1

رول آؤٹ سے پہلے آؤٹ پٹ فارمیٹ، ٹون اور معیار کے معیارات کی وضاحت کریں۔

2

جب بھی درستگی اہمیت رکھتی ہے تو بھروسہ مند ذرائع کے ساتھ زمینی جوابات۔

3

ہائی اسٹیک آؤٹ پٹس کے لیے ایک انسانی جائزہ چیک پوائنٹ رکھیں۔

4

ناکامی کے نمونوں کو ٹریک کریں اور پرامپٹس یا ورک فلو کو باقاعدگی سے دوبارہ تربیت دیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Head Latent Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

کثیر سوالات کی توجہ

اکثر پوچھے گئے سوالات

What is Multi-Head Latent Attention?

ملٹی ہیڈ لیٹنٹ اٹینشن (MLA) ایک توجہ کا طریقہ کار ہے، جسے DeepSeek-V2 میں متعارف کرایا گیا ہے، جو میموری کی بھوک لگی کلیدی قدر کے کیشے کو ایک چھوٹے مشترکہ لیٹنٹ ویکٹر میں کمپریس کرتا ہے۔ یہ معیار کو معیاری توجہ کے قریب رکھتے ہوئے بہت کم GPU میموری کے ساتھ بڑے زبان کے ماڈلز کو چلانے دیتا ہے۔

بنیادی مسئلہ کیا ہے ملٹی ہیڈ لیٹنٹ اٹینشن کو کم کرنے کے لیے ڈیزائن کیا گیا ہے؟

ایم ایل اے KV کیشے کو نشانہ بناتا ہے، جو سیاق و سباق کی لمبائی کے ساتھ بڑھتا ہے اور ٹیکسٹ جنریشن کے دوران میموری پر غالب رہتا ہے۔

ایم ایل اے کے وی کیشے کو کیسے سکڑتا ہے؟

ایم ایل اے فی ٹوکن ایک کمپیکٹ لیٹنٹ ویکٹر کو کیش کرتا ہے اور اپ پروجیکشن کے ذریعے اس سے کلیدوں اور اقدار کو دوبارہ تشکیل دیتا ہے۔

کس ماڈل نے سب سے پہلے ملٹی ہیڈ لیٹنٹ اٹینشن متعارف کرایا؟

ایم ایل اے کو DeepSeek نے اپنے DeepSeek-V2 ماڈل میں متعارف کرایا تھا اور اسے DeepSeek-V3 میں لے جایا گیا تھا۔

ایم ایل اے کو روٹری پوزیشن ایمبیڈنگس کے لیے علیحدہ 'ڈیکپلڈ' راستے کی ضرورت کیوں ہے؟

روٹری ٹرانسفارمیشن کو دوسرے وزن کے میٹرس میں جذب نہیں کیا جا سکتا، اس لیے ایم ایل اے پوزیشن کی معلومات لے جانے کے لیے ایک چھوٹا سا ڈیکپلڈ کلیدی جزو رکھتا ہے۔

ڈیپ سیک-V2 نے ایم ایل اے بمقابلہ معیاری ملٹی ہیڈ توجہ کے مقابلے میں KV-کیشے میموری میں کتنی کمی کی؟

DeepSeek-V2 نے KV-کیشے میموری کو 90% سے زیادہ کاٹنے کی اطلاع دی ہے، جس سے لمبے سیاق و سباق اور بڑے بیچز کو قابل بنایا جا رہا ہے۔