زبان AI گائیڈ

گروپ شدہ سوال کی توجہ

گروپڈ-کوئیری اٹینشن (جی کیو اے) ٹیکسٹ جنریشن کے دوران درکار میموری کو سکڑنے کا ایک طریقہ ہے جس سے متعدد استفسار کے سروں کو ایک ہی کلید اور ویلیو ہیڈز کا اشتراک کرنے دیا جاتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It makes large models much faster to serve with almost no quality loss.

گہرا غوطہ

ایک معیاری ملٹی ہیڈ توجہ کی پرت میں، ہر سر کے اپنے سوالات، کلیدیں اور قدریں ہوتی ہیں۔ جنریشن کے دوران، تمام پچھلے ٹوکنز کی کلیدیں اور قدریں کیش کی جاتی ہیں ('KV کیشے') اس لیے ماڈل ان کی دوبارہ گنتی نہیں کرتا ہے۔ بہت سے سروں اور طویل سیاق و سباق کے ساتھ، یہ کیش بہت بڑا ہو جاتا ہے اور قیاس کے وقت میموری بینڈوڈتھ پر حاوی ہوتا ہے۔ GQA، 2023 میں Google محققین کے ذریعے متعارف کرایا گیا، استفسار کے سروں کو گروپ کرتا ہے اور ہر گروپ کو کلید اور ویلیو ہیڈز کا ایک مشترکہ سیٹ دیتا ہے۔ اگر آپ کے پاس 32 سوالات کے سر ہیں لیکن صرف 8 KV گروپس ہیں تو KV کیش تقریباً چار گنا سکڑ جاتا ہے۔ یہ مکمل ملٹی ہیڈ توجہ (ہر سر الگ) اور کثیر استفسار توجہ (تمام ہیڈز کے لیے ایک مشترکہ KV) کے درمیان بیٹھتا ہے، معیار کو پوری توجہ کے قریب رکھتے ہوئے MQA کی زیادہ تر رفتار حاصل کرتا ہے۔ Llama 2 70B اور بعد کے کئی ماڈلز نے اسے اپنایا۔

تکنیکی بصیرت

توجہ کے معیار کا بہت زیادہ انحصار استفسار کی بہت سی الگ سمتوں پر ہوتا ہے، لیکن یہ کلیدوں اور اقدار کا اشتراک برداشت کرتا ہے۔ GQA اس عدم توازن کا فائدہ اٹھاتا ہے: یہ تمام سوالات کے سروں کو رکھتا ہے لیکن ہر مشترکہ KV ہیڈ کو اپنے گروپ کے سوالات میں نقل کرتا ہے۔ بچت اندازہ پر آتی ہے، جہاں KV کیش میموری بینڈوڈتھ کا بنیادی صارف ہے۔ کم KV ہیڈز کا مطلب ہے کہ فی جنریٹڈ ٹوکن پڑھنے کے لیے کم ڈیٹا۔ موجودہ ملٹی ہیڈ چیک پوائنٹ کو GQA میں تبدیل کرنے کے لیے ماڈلز کو اکثر مختصر طور پر 'تربیت' دی جاتی ہے۔

اسٹریٹجک اثر

رفتار اور پیمانہ

زبان کے کام کے بہاؤ مستقل مزاجی کی قربانی کے بغیر تیزی سے آگے بڑھ سکتے ہیں۔

رسائی اور رسائی

یہ زبانوں اور مواصلاتی طرزوں تک رسائی کو بڑھاتا ہے۔

واضح فیصلے

ٹیمیں فیصلے پر زیادہ وقت گزار سکتی ہیں جبکہ آٹومیشن تکرار کو سنبھالتی ہے۔

گروہی سوال کی توجہ کا مستقبل

GQA اب اوپن ویٹ ماڈلز میں ایک معیاری ڈیفالٹ ہے کیونکہ یہ بڑی سرونگ جیت کے لیے ایک چھوٹی سی کوالٹی لاگت کو صاف طور پر تجارت کرتا ہے۔ توقع کریں کہ یہ دیگر کارکردگی کی چالوں جیسے FlashAttention، KV-cache کوانٹائزیشن، اور نئی اسکیموں جیسے کہ ملٹی ہیڈ لیٹنٹ توجہ جو کیشے کو مزید کمپریس کرتی ہے کے ساتھ تیزی سے یکجا ہونے کی توقع کریں۔ جیسے جیسے سیاق و سباق کی ونڈوز بڑھیں گی، KV-کیشے کے سائز کو کنٹرول کرنا ایک مرکزی ڈیزائن کا مسئلہ رہے گا، اور GQA طرز کا ہیڈ شیئرنگ ایک اہم لیور رہے گا۔

حقیقی دنیا کا نفاذ

Llama 2 70B اور Llama 3 GQA کا استعمال کرتے ہوئے ایک چھوٹے KV کیشے کے ساتھ طویل سیاق و سباق پیش کر رہے ہیں

GPU میموری کو کم کرنا تاکہ ایک بڑا چیٹ ماڈل کم یا سستے ایکسلریٹر پر فٹ ہو جائے۔

پروڈکشن APIs میں ٹوکن بہ ٹوکن جنریشن کو تیز کرنا جہاں KV-cache بینڈوڈتھ رکاوٹ ہے

میموری کو ختم کیے بغیر بیک وقت بہت سے صارفین کی خدمت کے لیے بڑے بیچ سائز کو فعال کرنا

خطرات اور گارڈریلز

گمراہ شدہ حقائق خاموشی سے رپورٹس، سپورٹ فلو، یا تحقیقی نتائج درج کر سکتے ہیں۔

فوری حساسیت اسی طرح کی درخواستوں میں متضاد نتائج پیدا کر سکتی ہے۔

اگر رسائی کے کنٹرول کمزور ہیں تو حساس ٹیکسٹ ڈیٹا کو بے نقاب کیا جا سکتا ہے۔

نفاذ کا روڈ میپ

1

رول آؤٹ سے پہلے آؤٹ پٹ فارمیٹ، ٹون اور معیار کے معیارات کی وضاحت کریں۔

2

جب بھی درستگی اہمیت رکھتی ہے تو بھروسہ مند ذرائع کے ساتھ زمینی جوابات۔

3

ہائی اسٹیک آؤٹ پٹس کے لیے ایک انسانی جائزہ چیک پوائنٹ رکھیں۔

4

ناکامی کے نمونوں کو ٹریک کریں اور پرامپٹس یا ورک فلو کو باقاعدگی سے دوبارہ تربیت دیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped-Query Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

کثیر سوالات کی توجہ

اکثر پوچھے گئے سوالات

What is Grouped-Query Attention?

گروپڈ-کوئیری اٹینشن (جی کیو اے) ٹیکسٹ جنریشن کے دوران درکار میموری کو سکڑنے کا ایک طریقہ ہے جس سے متعدد استفسار کے سروں کو ایک ہی کلید اور ویلیو ہیڈز کا اشتراک کرنے دیا جاتا ہے۔ یہ بڑے ماڈلز کو کوالٹی کے نقصان کے بغیر پیش کرنے کے لیے بہت تیز بناتا ہے۔

گروپ شدہ سوال کی توجہ میں، سوال کے سروں کے گروپ میں کیا اشتراک کیا جاتا ہے؟

GQA الگ الگ استفسار ہیڈز رکھتا ہے لیکن ان میں سے ہر ایک گروپ کو KV کیشے کو سکڑتے ہوئے کلید اور ویلیو ہیڈز کا ایک سیٹ شیئر کرنے دیتا ہے۔

GQA کو کس دو انتہاؤں کے درمیان ایک درمیانی زمین کے طور پر بہترین طور پر بیان کیا گیا ہے؟

ملٹی ہیڈ ہر سر کو اپنا KV دیتا ہے۔ کثیر استفسار تمام ہیڈز کے لیے ایک KV شیئر کرتا ہے۔ GQA چند KV گروپوں کے ساتھ درمیان میں بیٹھتا ہے۔

GQA بنیادی طور پر تخمینہ کا کون سا حصہ سستا کرتا ہے؟

بچت جنریشن کے وقت ظاہر ہوتی ہے، جہاں KV کیشے پڑھنا غالب میموری-بینڈوڈتھ لاگت ہے۔

اگر ایک ماڈل میں 32 سوالات کے سر اور 8 KV گروپس ہیں، تو KV کیش تقریباً کس فیکٹر سے کم ہو جاتی ہے؟

32 استفسار کے سروں کو 8 مشترکہ KV گروپوں کے ذریعے تقسیم کیا گیا ہے جو کیشڈ کیز اور اقدار میں تقریباً چار گنا کمی کرتا ہے۔

KV ہیڈز شیئر کرنے کے باوجود GQA ماڈل کے زیادہ تر معیار کو کیوں محفوظ رکھ سکتا ہے؟

توجہ شیئرنگ کیز اور اقدار کو اس سے کہیں بہتر برداشت کرتی ہے جتنا کہ یہ الگ الگ استفسار کی سمتوں کو کھونے کو برداشت کرتا ہے، لہذا GQA معیار کو بلند رکھتا ہے۔