دليل اللغة AI

الانتباه الكامن متعدد الرؤوس

الانتباه الكامن متعدد الرؤوس (MLA) عبارة عن آلية انتباه تم تقديمها في DeepSeek-V2، والتي تعمل على ضغط ذاكرة التخزين المؤقت لقيمة المفتاح المتعطشة للذاكرة في ناقل كامن صغير مشترك.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It lets large language models run with far less GPU memory while keeping quality close to standard attention.

الغوص العميق

عندما يقوم المحول بإنشاء نص، فإنه يقوم بتخزين مفتاح وناقل قيمة لكل رمز مميز سابق في "ذاكرة تخزين مؤقت KV". تنمو ذاكرة التخزين المؤقت هذه مع طول السياق وتهيمن على استخدام الذاكرة أثناء الاستدلال. يستبدل MLA العديد من نواقل المفاتيح/القيم كاملة الحجم بمتجه كامن واحد منخفض الرتبة لكل رمز مميز، ثم يقوم بإسقاط ذلك النواقل الكامنة احتياطيًا في مفاتيح وقيم لكل رأس بسرعة. نظرًا لأنه يتم تخزين المادة الكامنة المضغوطة فقط مؤقتًا، أبلغ DeepSeek-V2 عن قطع ذاكرة التخزين المؤقت KV بنسبة تزيد عن 90% مقابل الاهتمام القياسي متعدد الرؤوس، مما يتيح سياقات أطول وأحجام دفعات أكبر. والأهم من ذلك، أنه يمكن طي مصفوفات الإسقاط العلوي إلى أوزان أخرى، لذلك يحقق MLA هذا الضغط مع خسارة قليلة أو معدومة في جودة النمذجة.

البصيرة الفنية

يقوم MLA بإجراء ضغط مفصل منخفض الرتبة: يتم إسقاط الحالة المخفية لكل رمز مميز إلى ناقل كامن صغير، وتقوم مصفوفات الإسقاط الأعلى المنفصلة بإعادة بناء المفاتيح والقيم لكل رأس. تتمثل الخدعة الذكية في "امتصاص" أوزان الإسقاط العلوي في توقعات الاستعلام والمخرجات، بحيث لا يجسد النموذج مفاتيح/قيم كاملة أبدًا أثناء الاستدلال. يتم التعامل مع تضمينات الموضع الدوار باستخدام مسار مفتاح منفصل، حيث لا يمكن استيعاب التدوير بنفس الطريقة، مما يحافظ على المعلومات الموضعية.

التأثير الاستراتيجي

السرعة والحجم

يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.

الوصول والوصول

فهو يوسع الوصول عبر اللغات وأنماط الاتصال.

قرارات أوضح

يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.

مستقبل الاهتمام الكامن متعدد الرؤوس

ساعدت MLA في جعل DeepSeek-V2 وV3 اقتصاديًا للعمل على نطاق واسع، وتنتشر هذه التقنية مع سعي الفرق لاستدلال سياق طويل أرخص. توقع دمج الضغط الكامن بنمط MLA مع طبقات Mixture-of-Experts المتفرقة، وذاكرة التخزين المؤقت الكمية، وفك التشفير التخميني في النماذج المفتوحة المستقبلية. ويستكشف الباحثون أيضًا إلى أي مدى يمكن أن يتقلص البعد الكامن قبل انخفاض الجودة، وما إذا كانت نفس الفكرة ذات المرتبة المنخفضة يمكنها ضغط الانتباه أثناء التدريب، وليس مجرد الاستدلال.

التنفيذ في العالم الحقيقي

تقديم نماذج الدردشة DeepSeek-V2/V3 مع آثار ذاكرة GPU أصغر بشكل كبير لكل طلب

تشغيل إجابة سؤال طويل المستند حيث قد تؤدي ذاكرة التخزين المؤقت الكبيرة لـ KV إلى استنفاد VRAM

زيادة حجم دفعة الاستدلال على وحدة معالجة الرسومات الثابتة لأن كل تسلسل يخزن فقط ناقلًا كامنًا صغيرًا

تمكين نوافذ السياق الأطول على الأجهزة السلعية لمساعدي الاسترجاع المعزز

المخاطر والدرابزين

يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.

يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.

قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.

خارطة طريق التنفيذ

1

حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.

2

استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.

3

احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.

4

تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Head Latent Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

الاهتمام بالاستعلام المتعدد

الأسئلة المتداولة

What is Multi-Head Latent Attention?

الانتباه الكامن متعدد الرؤوس (MLA) عبارة عن آلية انتباه تم تقديمها في DeepSeek-V2، والتي تعمل على ضغط ذاكرة التخزين المؤقت لقيمة المفتاح المتعطشة للذاكرة في ناقل كامن صغير مشترك. فهو يتيح تشغيل نماذج اللغات الكبيرة بذاكرة GPU أقل بكثير مع الحفاظ على الجودة قريبة من الاهتمام القياسي.

ما هي المشكلة الأساسية التي تم تصميم نظام الانتباه الكامن متعدد الرؤوس لتقليلها؟

يستهدف MLA ذاكرة التخزين المؤقت KV، التي تنمو مع طول السياق وتهيمن على الذاكرة أثناء إنشاء النص.

كيف يقوم MLA بتقليص ذاكرة التخزين المؤقت KV؟

يقوم MLA بتخزين ناقل كامن مضغوط واحد مؤقتًا لكل رمز مميز ويعيد بناء المفاتيح والقيم منه عبر الإسقاط العلوي.

ما هو النموذج الذي قدم لأول مرة نظام الانتباه الكامن متعدد الرؤوس؟

تم تقديم MLA بواسطة DeepSeek في نموذج DeepSeek-V2 وتم نقله إلى DeepSeek-V3.

لماذا يحتاج MLA إلى مسار "منفصل" منفصل لتضمين الموضع الدوار؟

لا يمكن استيعاب التحويل الدوار في مصفوفات وزن أخرى، لذلك يحتفظ MLA بمكون رئيسي صغير منفصل لحمل المعلومات الموضعية.

ما هو تقريبًا مقدار تقليل ذاكرة التخزين المؤقت KV الذي أبلغ عنه DeepSeek-V2 من MLA مقابل الاهتمام القياسي متعدد الرؤوس؟

أبلغ DeepSeek-V2 عن قطع ذاكرة التخزين المؤقت KV بأكثر من 90%، مما يتيح سياقات أطول ودفعات أكبر.