الاهتمام بالاستعلام المتعدد
يعد الانتباه متعدد الاستعلامات (MQA) بمثابة تطور موفر للذاكرة في انتباه المحول الذي يشترك في مجموعة واحدة من المفاتيح والقيم عبر جميع رؤوس الانتباه.
نظرة عامة
It dramatically speeds up text generation by shrinking the memory the model must shuffle around.
الغوص العميق
يمنح الاهتمام القياسي متعدد الرؤوس كل رأس استعلامه الخاص ومفتاحه وإسقاطات القيمة. أثناء الإنشاء، يجب تخزين المفاتيح والقيم لجميع الرموز المميزة السابقة مؤقتًا وإعادة تحميلها في كل خطوة - تصبح ذاكرة التخزين المؤقت KV هذه هي عنق الزجاجة الرئيسي، نظرًا لأن قراءتها من الذاكرة أبطأ من العمليات الحسابية نفسها. يحتفظ برنامج Multi-Query Attention، الذي اقترحه Noam Shazeer في عام 2019، بإسقاطات استعلام منفصلة لكل رأس ولكنه يطوي المفاتيح والقيم في رأس واحد مشترك. يؤدي هذا إلى تقليص ذاكرة التخزين المؤقت KV بعامل يساوي عدد الرؤوس، وأحيانًا أصغر بمقدار 8x إلى 64x. والنتيجة هي فك تشفير انحداري أسرع بكثير وبصمة ذاكرة أخف، مع انخفاض بسيط في الجودة. الحل الوسط، وهو "انتباه الاستعلام المجمع"، يوازن بين المفاضلة.
البصيرة الفنية
في MQA، لا تزال أوزان الاستعلام تنتج متجهات استعلام منفصلة H، ولكن يتم مشاركة إسقاط رئيسي واحد وإسقاط قيمة واحدة عبر جميع الرؤوس. يحسب كل رأس الانتباه باستخدام الاستعلام الخاص به مقابل نفس المفاتيح والقيم. نظرًا لأن موترات K وV المخزنة مؤقتًا لم تعد تتكيف مع عدد الرؤوس، فإن عرض النطاق الترددي للذاكرة أثناء فك التشفير ينخفض بشكل حاد - وعرض النطاق الترددي، وليس الحساب، هو ما يولد سرعة البوابات في المسرعات الحديثة.
التأثير الاستراتيجي
السرعة والحجم
يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.
الوصول والوصول
فهو يوسع الوصول عبر اللغات وأنماط الاتصال.
قرارات أوضح
يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.
مستقبل الاهتمام بالاستعلام المتعدد
أثبتت MQA أنه يمكنك تقليم رؤوس المفاتيح/القيم الزائدة عن الحاجة دون ضرر يذكر، وهذه الرؤية تشكل الآن تقريبًا كل LLM سريع الاستدلال. لقد تقارب هذا المجال إلى حد كبير مع اهتمام الاستعلامات المجمعة (GQA)، المستخدم في Llama 2/3 وغيرها الكثير، والذي يستخدم عددًا قليلاً من مجموعات KV بدلاً من مجموعة واحدة لاستعادة الجودة مع الحفاظ على معظم التسريع. يمزج العمل المستقبلي هذه الأفكار مع ضغط ذاكرة التخزين المؤقت KV والتكميم والاهتمام المتعدد الكامن لدفع سياقات أطول وخدمة أرخص.
التنفيذ في العالم الحقيقي
تسريع إنشاء رمز مميز في مساعدي الدردشة حيث تعمل ذاكرة التخزين المؤقت KV، وليس الحوسبة الأولية، على الحد من الإنتاجية.
Google's PaLM، والذي يستخدم الانتباه متعدد الاستعلامات لتمكين الاستدلال الفعال على نطاق واسع.
خدمة العديد من المستخدمين المتزامنين على وحدة معالجة رسومات واحدة عن طريق تقليص ذاكرة التخزين المؤقت KV لكل طلب.
انتباه الاستعلام المجمع في Llama 2 70B وLlama 3، وهو سليل مباشر يوازن بين سرعة MQA وجودة الاهتمام الكامل.
المخاطر والدرابزين
يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.
يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.
قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.
خارطة طريق التنفيذ
حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.
استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.
احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.
تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Query Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
تنبيه الاستعلام المجمع
الأسئلة المتداولة
What is Multi-Query Attention?
يعد الانتباه متعدد الاستعلامات (MQA) بمثابة تطور موفر للذاكرة في انتباه المحول الذي يشترك في مجموعة واحدة من المفاتيح والقيم عبر جميع رؤوس الانتباه. فهو يعمل على تسريع عملية إنشاء النص بشكل كبير عن طريق تقليص الذاكرة التي يجب على النموذج تبديلها.
ما الذي يشاركه انتباه الاستعلام المتعدد عبر جميع رؤوس الانتباه؟
تحتفظ MQA باستعلامات منفصلة لكل رأس ولكنها تشترك في إسقاط رئيسي واحد وإسقاط قيمة واحد عبر جميع الرؤوس.
ما هو عنق الزجاجة الأساسي الذي يعالجه MQA أثناء توليد الانحدار الذاتي؟
إعادة تحميل ذاكرة التخزين المؤقت الكبيرة KV تكون كل خطوة مرتبطة بعرض النطاق الترددي؛ تعمل MQA على تقليص ذاكرة التخزين المؤقت هذه لتسريع عملية فك التشفير.
بأي عامل تقريبًا تقوم MQA بتقليص ذاكرة التخزين المؤقت لـ KV؟
نظرًا لانهيار المفاتيح والقيم من رؤوس H إلى رأس واحد، فإن ذاكرة التخزين المؤقت تتقلص بمقدار عدد الرؤوس تقريبًا.
ما هي المفاضلة الرئيسية لاستخدام MQA؟
تؤدي مشاركة المفاتيح والقيم إلى تقليل القدرة التمثيلية قليلاً، مما يؤدي إلى انخفاض طفيف في الجودة مقابل مكاسب كبيرة في السرعة.
ما هو البديل الذي يقع بين الاهتمام القياسي متعدد الرؤوس وMQA؟
يستخدم اهتمام الاستعلام المجمع (GQA) عدة مجموعات KV بدلاً من مجموعة واحدة، مما يؤدي إلى موازنة الجودة والسرعة.