زبان AI گائیڈ

کثیر سوالات کی توجہ

ملٹی کوئری اٹینشن (MQA) ٹرانسفارمر کی توجہ پر میموری کو بچانے والا ایک موڑ ہے جو تمام توجہ کے سروں پر کلیدوں اور اقدار کا ایک سیٹ شیئر کرتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It dramatically speeds up text generation by shrinking the memory the model must shuffle around.

گہرا غوطہ

معیاری ملٹی ہیڈ توجہ ہر سر کو اس کی اپنی استفسار، کلید اور قدر کے تخمینے دیتی ہے۔ جنریشن کے دوران، تمام ماضی کے ٹوکنز کی کلیدیں اور قدروں کو ہر قدم پر کیش اور دوبارہ لوڈ کیا جانا چاہیے - یہ KV کیش اہم رکاوٹ بن جاتا ہے، کیونکہ اسے میموری سے پڑھنا خود ریاضی سے سست ہے۔ 2019 میں Noam Shazeer کی طرف سے تجویز کردہ ملٹی-Query Attention، ہر سر کے لیے الگ الگ استفسارات رکھتا ہے لیکن کلیدوں اور اقدار کو ایک ہی مشترکہ سر پر سمٹتا ہے۔ یہ KV کیشے کو سروں کی تعداد کے برابر ایک عنصر سے سکڑتا ہے، بعض اوقات 8x سے 64x چھوٹا ہوتا ہے۔ نتیجہ بہت تیز آٹوریگریسو ڈیکوڈنگ اور ہلکا میموری فوٹ پرنٹ ہے، جس میں صرف ایک معمولی کوالٹی ڈِپ ہے۔ ایک درمیانی زمین، گروپ شدہ سوال کی توجہ، تجارت کو متوازن کرتی ہے۔

تکنیکی بصیرت

MQA میں، استفسار کے وزن اب بھی H الگ الگ استفسار ویکٹر تیار کرتے ہیں، لیکن ایک کلیدی پروجیکشن اور سنگل ویلیو پروجیکشن تمام سروں پر مشترک ہیں۔ ہر ہیڈ ایک ہی کلیدوں اور اقدار کے خلاف اپنے سوال کا استعمال کرتے ہوئے توجہ کا حساب لگاتا ہے۔ چونکہ کیشڈ K اور V ٹینسر اب سروں کی تعداد کے ساتھ پیمانہ نہیں رکھتے، ڈی کوڈنگ کے دوران میموری بینڈوڈتھ تیزی سے گرتی ہے — اور بینڈوڈتھ، نہ کہ حساب، جدید ایکسلریٹروں پر گیٹ جنریشن کی رفتار کو بڑھاتی ہے۔

اسٹریٹجک اثر

رفتار اور پیمانہ

زبان کے کام کے بہاؤ مستقل مزاجی کی قربانی کے بغیر تیزی سے آگے بڑھ سکتے ہیں۔

رسائی اور رسائی

یہ زبانوں اور مواصلاتی طرزوں تک رسائی کو بڑھاتا ہے۔

واضح فیصلے

ٹیمیں فیصلے پر زیادہ وقت گزار سکتی ہیں جبکہ آٹومیشن تکرار کو سنبھالتی ہے۔

کثیر سوالات کی توجہ کا مستقبل

MQA نے قائم کیا کہ آپ فالتو کلید/ویلیو ہیڈز کو تھوڑا سا نقصان پہنچا سکتے ہیں، اور یہ بصیرت اب تقریباً ہر تیز رفتار LLM کو شکل دیتی ہے۔ فیلڈ بڑی حد تک گروپڈ-کوئیری اٹینشن (GQA) پر اکٹھا ہو گیا ہے، جو Llama 2/3 اور بہت سے دوسرے میں استعمال ہوتا ہے، جو زیادہ تر رفتار کو برقرار رکھتے ہوئے معیار کو بحال کرنے کے لیے ایک کے بجائے چند KV گروپس کا استعمال کرتا ہے۔ مستقبل کا کام طویل سیاق و سباق اور سستی سرونگ کو آگے بڑھانے کے لیے KV-cache کمپریشن، کوانٹائزیشن، اور کثیر التواء توجہ کے ساتھ ان خیالات کو ملا دیتا ہے۔

حقیقی دنیا کا نفاذ

چیٹ اسسٹنٹس میں ٹوکن بہ ٹوکن جنریشن کو تیز کرنا جہاں KV کیش، خام کمپیوٹ نہیں، تھرو پٹ کو محدود کرتا ہے۔

Google's PaLM، جس نے بڑے پیمانے پر موثر اندازے کو فعال کرنے کے لیے کثیر سوالات کی توجہ کا استعمال کیا۔

فی درخواست KV کیش میموری کو سکڑ کر ایک GPU پر بہت سے ہم وقت صارفین کی خدمت کرنا۔

Llama 2 70B اور Llama 3 میں گروپ شدہ سوال کی توجہ، مکمل توجہ کے معیار کے ساتھ MQA کی رفتار کو متوازن کرنے والی براہ راست اولاد۔

خطرات اور گارڈریلز

گمراہ شدہ حقائق خاموشی سے رپورٹس، سپورٹ فلو، یا تحقیقی نتائج درج کر سکتے ہیں۔

فوری حساسیت اسی طرح کی درخواستوں میں متضاد نتائج پیدا کر سکتی ہے۔

اگر رسائی کے کنٹرول کمزور ہیں تو حساس ٹیکسٹ ڈیٹا کو بے نقاب کیا جا سکتا ہے۔

نفاذ کا روڈ میپ

1

رول آؤٹ سے پہلے آؤٹ پٹ فارمیٹ، ٹون اور معیار کے معیارات کی وضاحت کریں۔

2

جب بھی درستگی اہمیت رکھتی ہے تو بھروسہ مند ذرائع کے ساتھ زمینی جوابات۔

3

ہائی اسٹیک آؤٹ پٹس کے لیے ایک انسانی جائزہ چیک پوائنٹ رکھیں۔

4

ناکامی کے نمونوں کو ٹریک کریں اور پرامپٹس یا ورک فلو کو باقاعدگی سے دوبارہ تربیت دیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Query Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

گروپ شدہ سوال کی توجہ

اکثر پوچھے گئے سوالات

What is Multi-Query Attention?

ملٹی کوئری اٹینشن (MQA) ٹرانسفارمر کی توجہ پر میموری کو بچانے والا ایک موڑ ہے جو تمام توجہ کے سروں پر کلیدوں اور اقدار کا ایک سیٹ شیئر کرتا ہے۔ یہ ڈرامائی طور پر اس میموری کو سکڑ کر ٹیکسٹ جنریشن کو تیز کرتا ہے جسے ماڈل کے ارد گرد بدلنا ضروری ہے۔

متعدد سوالات کی توجہ تمام توجہ کے سروں میں کیا اشتراک کرتی ہے؟

MQA فی سر الگ الگ سوالات رکھتا ہے لیکن ایک اہم پروجیکشن اور ایک ویلیو پروجیکشن کو تمام ہیڈز پر شیئر کرتا ہے۔

وہ بنیادی رکاوٹ کیا ہے جسے MQA خود بخود پیدا کرنے کے دوران حل کرتا ہے؟

بڑے KV کیشے کو دوبارہ لوڈ کرنا ہر قدم بینڈوتھ کے ساتھ پابند ہے۔ ایم کیو اے ڈی کوڈنگ کو تیز کرنے کے لیے اس کیشے کو سکڑتا ہے۔

MQA تقریباً کس عنصر سے KV کیشے کو سکڑتا ہے؟

چونکہ کلیدیں اور قدریں H ہیڈز سے ایک پر گر جاتی ہیں، اس لیے کیش تقریباً ہیڈ گنتی سے سکڑ جاتا ہے۔

MQA کو استعمال کرنے کا اصل تجارت کیا ہے؟

کلیدوں اور قدروں کا اشتراک نمائندگی کی صلاحیت کو قدرے کم کرتا ہے، جس کی وجہ سے بڑی رفتار کے حصول کے بدلے میں معیار میں کمی واقع ہوتی ہے۔

معیاری ملٹی ہیڈ توجہ اور MQA کے درمیان کون سا قسم بیٹھتا ہے؟

گروپڈ-کوئیری اٹینشن (GQA) معیار اور رفتار کو متوازن کرتے ہوئے، ایک کے بجائے کئی KV گروپ استعمال کرتا ہے۔