دليل اللغة AI

انزلاق النافذة الاهتمام

يؤدي انتباه النافذة المنزلقة إلى تقييد كل رمز مميز للانتباه فقط إلى حي ذي حجم ثابت من الرموز المميزة القريبة بدلاً من التسلسل بأكمله.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

This cuts the quadratic cost of standard attention down to linear, making long-context models far cheaper to run.

الغوص العميق

يقارن الاهتمام الذاتي القياسي كل رمز مميز بكل رمز مميز آخر، لذا فإن تسلسل الطول N يتطلب مقارنات مربعة N تقريبًا. يعمل انتباه النافذة المنزلقة على إصلاح ذلك من خلال منح كل رمز نافذة بحجم W (على سبيل المثال 4096 رمزًا) والاهتمام فقط بالجيران داخل تلك النافذة. تنمو التكلفة بمقدار N مرات W بدلاً من N-squared. والأهم من ذلك، أن تكديس العديد من الطبقات ذات النوافذ يوسع مجال الاستقبال الفعال: بعد طبقات L، يمكن أن تنتشر المعلومات عبر رموز L تقريبًا W، مثل مجال الاستقبال المتنامي لشبكة CNN. قامت ميسترال 7B بنشر هذا من خلال نافذة تحتوي على 4096 رمزًا مميزًا عبر 32 طبقة، لتصل إلى نطاق نظري يبلغ 131 ألف رمز مميز. غالبًا ما تمزج النماذج الطبقات ذات النوافذ مع طبقات الاهتمام الكامل العرضية للحفاظ على الروابط طويلة المدى.

البصيرة الفنية

في قناع الانتباه، يُسمح للاستعلام في الموضع i فقط برؤية المفاتيح من المواضع i ناقص W بالإضافة إلى 1 إلى i (حالة سببية). يعني هذا القناع المتناثر أن ذاكرة التخزين المؤقت KV تحتاج فقط إلى رموز W الأخيرة لكل طبقة، مما يؤدي إلى خفض الذاكرة أثناء الإنشاء. نظرًا لأن النافذة تتغير مع كل رمز مميز جديد، فإنها تقترن بشكل طبيعي مع ذاكرة تخزين مؤقت متجددة تقوم بالكتابة فوق الإدخالات الأقدم بدلاً من النمو إلى الأبد.

التأثير الاستراتيجي

السرعة والحجم

يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.

الوصول والوصول

فهو يوسع الوصول عبر اللغات وأنماط الاتصال.

قرارات أوضح

يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.

مستقبل الاهتمام بالنافذة المنزلقة

تتداخل التصميمات الهجينة الآن مع عدد قليل من الطبقات العالمية أو طبقات الاهتمام الكامل بين العديد من طبقات النوافذ المنزلقة، مما يحقق التوازن بين الكفاءة والتفكير الحقيقي طويل المدى. جيما 2 وآخرون يتبادلون الكتل المحلية والعالمية. توقع أن يتحد انتباه النافذة مع نماذج مساحة الحالة، ومصارف الانتباه، وضغط ذاكرة التخزين المؤقت KV، بحيث تتعامل النماذج الحدودية مع سياقات مليون رمز دون ذاكرة هاربة. لقد أصبح لبنة البناء الافتراضية بدلاً من التحسين الغريب.

التنفيذ في العالم الحقيقي

يستخدم Mistral 7B نافذة منزلقة مكونة من 4096 رمزًا مميزًا عبر طبقاته للتعامل مع المطالبات الطويلة بسعر رخيص على وحدات معالجة الرسومات الاستهلاكية.

يطبق Longformer انتباه النوافذ بالإضافة إلى عدد قليل من الرموز العالمية لتصنيف وتلخيص المستندات متعددة الصفحات.

تقوم Gemma 2 بتبديل طبقات النافذة المنزلقة المحلية مع طبقات الاهتمام العالمي لتحقيق التوازن بين السرعة والاستدعاء بعيد المدى.

تحتفظ ذاكرة التخزين المؤقت KV ذات المخزن المؤقت المتداول في مساعدي الدردشة فقط بأحدث نافذة من الرموز المميزة، مما يؤدي إلى تحديد سقف للذاكرة أثناء المحادثات الطويلة.

المخاطر والدرابزين

يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.

يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.

قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.

خارطة طريق التنفيذ

1

حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.

2

استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.

3

احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.

4

تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Sliding Window Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

تنبيه الاستعلام المجمع

الأسئلة المتداولة

What is Sliding Window Attention?

يؤدي انتباه النافذة المنزلقة إلى تقييد كل رمز مميز للانتباه فقط إلى حي ذي حجم ثابت من الرموز المميزة القريبة بدلاً من التسلسل بأكمله. يؤدي هذا إلى خفض التكلفة التربيعية للانتباه القياسي إلى تكلفة خطية، مما يجعل تشغيل نماذج السياق الطويل أرخص بكثير.

ما هي الفائدة الحسابية الرئيسية لانتباه النافذة المنزلقة مقارنة بالاهتمام الذاتي القياسي؟

من خلال قصر كل رمز على نافذة ثابتة من جيران W، تنمو التكلفة بمقدار N مرات W (خطي في N) بدلاً من N-squared.

في تصميم ميسترال 7 بي، كيف يمكن للمعلومات أن تنتقل إلى ما هو أبعد من نافذة واحدة مكونة من 4096 رمزًا؟

مثل CNN، تدفع كل طبقة المعلومات نافذة واحدة أبعد، لذا فإن الطبقات L تعطي نطاقًا فعالاً يبلغ L تقريبًا W من الرموز المميزة.

لماذا يؤدي انتباه النافذة المنزلقة إلى تقليل الذاكرة أثناء إنشاء النص؟

نظرًا لأن الرمز المميز لا يهتم إلا بنافذته الحديثة، فيمكن تجاهل إدخالات المفتاح/القيمة الأقدم، غالبًا عبر ذاكرة تخزين مؤقت متجددة.

ما هو خيار التصميم الذي تستخدمه نماذج مثل Gemma 2 بجانب النوافذ المنزلقة للحفاظ على التفكير طويل المدى؟

يؤدي مزج الطبقات العالمية/الاهتمام الكامل بين الطبقات المحلية إلى الحفاظ على الاتصالات الحقيقية بعيدة المدى التي تضعفها النوافذ النقية.

بالنسبة لنافذة منزلقة عرضية بحجم W، ما هي المفاتيح التي يمكن الاستعلام عنها في الموضع الذي أتوجه إليه؟

في الحالة السببية، يرى الاستعلام نفسه والرموز المميزة W ناقص 1 التي تسبقه مباشرةً، وليس الرموز المميزة أبدًا.