تنبيه الاستعلام المجمع
يعد انتباه الاستعلام المجمع (GQA) طريقة لتقليص الذاكرة المطلوبة أثناء إنشاء النص عن طريق السماح لعدة رؤوس استعلام بمشاركة نفس المفتاح ورؤوس القيمة.
نظرة عامة
It makes large models much faster to serve with almost no quality loss.
الغوص العميق
في طبقة الاهتمام القياسية متعددة الرؤوس، يكون لكل رأس استعلاماته ومفاتيحه وقيمه الخاصة. أثناء الإنشاء، يتم تخزين المفاتيح والقيم الخاصة بجميع الرموز المميزة السابقة مؤقتًا ("ذاكرة التخزين المؤقت KV") بحيث لا يقوم النموذج بإعادة حسابها. مع العديد من الرؤوس والسياقات الطويلة، تصبح ذاكرة التخزين المؤقت هذه هائلة وتهيمن على عرض النطاق الترددي للذاكرة في وقت الاستدلال. يقوم GQA، الذي قدمه باحثو Google في عام 2023، بتجميع رؤوس الاستعلام ويمنح كل مجموعة مجموعة واحدة مشتركة من رؤوس المفاتيح والقيمة. إذا كان لديك 32 رأس استعلام ولكن 8 مجموعات KV فقط، فإن ذاكرة التخزين المؤقت KV تتقلص بمقدار أربعة أضعاف تقريبًا. يقع هذا بين الاهتمام الكامل متعدد الرؤوس (كل رأس منفصل) والاهتمام متعدد الاستعلامات (KV واحد مشترك لجميع الرؤوس)، مما يلتقط معظم سرعة MQA مع الحفاظ على الجودة قريبة من الاهتمام الكامل. Llama 2 70B والعديد من النماذج اللاحقة تبنته.
البصيرة الفنية
تعتمد جودة الانتباه بشكل كبير على وجود العديد من اتجاهات الاستعلام المميزة، ولكنها تسمح بمشاركة المفاتيح والقيم. تستغل GQA عدم التماثل هذا: فهي تحتفظ بجميع رؤوس الاستعلام ولكنها تكرر كل رأس KV مشترك عبر الاستعلامات في مجموعتها. تأتي المدخرات في الاستدلال، حيث تكون ذاكرة التخزين المؤقت KV هي المستهلك الرئيسي لعرض النطاق الترددي للذاكرة؛ عدد أقل من رؤوس KV يعني بيانات أقل للقراءة لكل رمز مميز تم إنشاؤه. غالبًا ما يتم "تدريب" النماذج لفترة وجيزة لتحويل نقطة تفتيش متعددة الرؤوس إلى نقطة تفتيش GQA.
التأثير الاستراتيجي
السرعة والحجم
يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.
الوصول والوصول
فهو يوسع الوصول عبر اللغات وأنماط الاتصال.
قرارات أوضح
يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.
مستقبل الاهتمام بالاستعلام المجمع
أصبح GQA الآن معيارًا افتراضيًا في النماذج ذات الوزن المفتوح لأنه يتاجر بشكل نظيف بتكلفة جودة صغيرة لتحقيق مكاسب كبيرة في الخدمة. توقع أن يتم دمجها بشكل متزايد مع حيل الكفاءة الأخرى مثل FlashAttention، وتكميم ذاكرة التخزين المؤقت KV، والمخططات الأحدث مثل الانتباه الكامن متعدد الرؤوس الذي يضغط ذاكرة التخزين المؤقت بشكل أكبر. مع نمو نوافذ السياق، سيظل التحكم في حجم ذاكرة التخزين المؤقت KV مشكلة تصميم مركزية، وستظل مشاركة الرأس على غرار GQA أداة رئيسية.
التنفيذ في العالم الحقيقي
Llama 2 70B وLlama 3 يستخدمان GQA لخدمة سياقات طويلة باستخدام ذاكرة تخزين مؤقت أصغر حجمًا KV
تقليل ذاكرة وحدة معالجة الرسومات بحيث يتناسب نموذج الدردشة الكبير مع مسرعات أقل أو أرخص
تسريع إنشاء رمز مميز في واجهات برمجة تطبيقات الإنتاج حيث يكون عرض النطاق الترددي لذاكرة التخزين المؤقت KV هو عنق الزجاجة
تمكين أحجام دفعات أكبر لخدمة العديد من المستخدمين في وقت واحد دون استنفاد الذاكرة
المخاطر والدرابزين
يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.
يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.
قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.
خارطة طريق التنفيذ
حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.
استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.
احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.
تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grouped-Query Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
الاهتمام بالاستعلام المتعدد
الأسئلة المتداولة
What is Grouped-Query Attention?
يعد انتباه الاستعلام المجمع (GQA) طريقة لتقليص الذاكرة المطلوبة أثناء إنشاء النص عن طريق السماح لعدة رؤوس استعلام بمشاركة نفس المفتاح ورؤوس القيمة. فهو يجعل النماذج الكبيرة أسرع بكثير في الخدمة دون فقدان الجودة تقريبًا.
في "انتباه الاستعلام المجمع"، ما الذي تتم مشاركته بين مجموعة من رؤوس الاستعلام؟
تحتفظ GQA برؤوس استعلام منفصلة ولكنها تسمح لكل مجموعة منها بمشاركة مجموعة واحدة من المفاتيح ورؤوس القيمة، مما يؤدي إلى تقليص ذاكرة التخزين المؤقت لـ KV.
من الأفضل وصف GQA بأنها حل وسط بين أي طرفين متطرفين؟
متعدد الرؤوس يعطي كل رأس كيلو فولت خاص به؛ يشترك الاستعلام المتعدد في كيلو فولت واحد لجميع الرؤوس؛ تقع GQA في الوسط مع عدد قليل من مجموعات KV.
ما هو الجزء من الاستدلال الذي تجعله GQA أرخص في المقام الأول؟
تظهر المدخرات في وقت التوليد، حيث تكون قراءة ذاكرة التخزين المؤقت KV هي التكلفة السائدة لعرض النطاق الترددي للذاكرة.
إذا كان النموذج يحتوي على 32 رأس استعلام ومجموعات 8 كيلو فولت، فسيتم تقليل ذاكرة التخزين المؤقت لـ KV بأي عامل تقريبًا؟
32 رأس استعلام مقسمة على 8 مجموعات KV مشتركة تعطي تقريبًا أربعة أضعاف تقليل المفاتيح والقيم المخزنة مؤقتًا.
لماذا تستطيع GQA الحفاظ على معظم جودة النموذج على الرغم من مشاركة رؤوس KV؟
يتحمل الاهتمام مشاركة المفاتيح والقيم بشكل أفضل بكثير من تحمل فقدان اتجاهات الاستعلام المميزة، لذلك تحافظ GQA على الجودة العالية.