الدليل الفني

كتلة متفرقة والانتباه المتناثر الأصلي

يتيح الاهتمام المتناثر والكتلة المتفرقة للمحولات الاهتمام فقط بالأجزاء الأكثر صلة بالتسلسل الطويل بدلاً من كل رمز مميز، مما يخفض التكلفة التربيعية للانتباه القياسي.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

This is what makes efficient long-context models practical on real hardware.

الغوص العميق

يقارن الاهتمام الذاتي القياسي كل رمز مميز بكل رمز مميز آخر، وبالتالي فإن التكلفة تنمو بشكل تربيعي مع طول التسلسل، مما يصبح محظورًا بالنسبة للمستندات الطويلة جدًا. يقيد الاهتمام المتناثر كل رمز مميز بمجموعة فرعية من الرموز الأخرى. تقسم أساليب الكتل المتفرقة التسلسل إلى كتل وتحسب الانتباه فقط لأزواج الكتل المحددة، والتي يتم تعيينها بكفاءة على نوى موتر وحدة معالجة الرسومات. يذهب Native Sparse Attention (NSA)، من DeepSeek، إلى أبعد من ذلك: فهو قابل للتدريب من طرف إلى طرف ومتوافق مع الأجهزة، ويجمع بين ثلاثة فروع، وضغط رمزي خشن، واختيار دقيق للكتل الأكثر أهمية، ونافذة منزلقة للسياق المحلي. ونظرًا لأن نمط التفرق يتم تعلمه أثناء التدريب المسبق بدلاً من تثبيته بعد ذلك، فإن NSA تحافظ على الدقة مع توفير سرعات كبيرة في تسلسلات طويلة.

البصيرة الفنية

تقوم NSA بمعالجة المفاتيح والقيم من خلال ثلاثة مسارات متوازية، ثم تقوم بدمجها مع البوابات المستفادة. يقوم الضغط بتجميع كتل الرموز المميزة في تمثيلات موجزة؛ يقوم الاختيار بتحصيل الكتل ويحتفظ فقط بالأعلى مرتبة للحصول على الاهتمام الكامل؛ تغطي النافذة المنزلقة الرموز القريبة. تتماشى العمليات على مستوى الكتلة مع الوصول إلى ذاكرة وحدة معالجة الرسومات وإنتاجية موتر النواة، وبالتالي تترجم مدخرات FLOP النظرية إلى عمليات تسريع حقيقية لساعة الحائط أثناء كل من التدريب والاستدلال، خاصة بالنسبة لخطوة فك التشفير المرتبطة بالذاكرة.

التأثير الاستراتيجي

التكلفة والميزانية

تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.

قرارات أوضح

يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.

مراقبة الجودة

تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.

مستقبل الكتلة المتناثرة والانتباه المتناثر الأصلي

أصبح التشتت القابل للتدريب والمدرك للأجهزة هو الطريق إلى سياق مليون رمز دون تكلفة باهظة. توقع أن يتم تصميم الاهتمام المتناثر بشكل مشترك مع النوى والمسرعات، ومزجه مع الاهتمام الخطي وأفكار مساحة الحالة، واعتماده في نماذج الحدود الطويلة والسياق والاستدلال. عندما تصبح الأنماط قابلة للتعلم وديناميكية، ستقوم النماذج بتخصيص ميزانية الاهتمام بشكل تكيفي لكل استعلام، وسوف تقيس المعايير بشكل متزايد إنتاجية فك التشفير على تسلسلات طويلة، وليس فقط الجودة الأولية.

التنفيذ في العالم الحقيقي

تشغيل نموذج على قاعدة تعليمات برمجية كاملة أو عقد قانوني طويل حيث يؤدي الاهتمام الكامل إلى استنفاد ذاكرة وحدة معالجة الرسومات.

تعمل NSA الخاصة بـ DeepSeek على تسريع كل من التدريب المسبق واستدلال السياق الطويل مع مطابقة دقة الانتباه الكامل أو التغلب عليها.

تلخيص المستندات بطول الكتاب من خلال الاطلاع على ملخصات الكتل المضغوطة بالإضافة إلى المقاطع ذات الصلة محليًا.

تسريع مساعدي الدردشة ذات السياق الطويل الذين تكون خطوة فك التشفير الخاصة بهم مرتبطة بالذاكرة عن طريق قصر كل رمز مميز على الكتل ذات التصنيف الأعلى.

المخاطر والدرابزين

يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.

غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.

يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.

خارطة طريق التنفيذ

1

تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.

2

المعيار في ظل ظروف التحميل والبيانات الواقعية.

3

مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.

4

قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Block-Sparse and Native Sparse Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

أنماط الاهتمام المتفرقة

الأسئلة المتداولة

What is Block-Sparse and Native Sparse Attention?

يتيح الاهتمام المتناثر والكتلة المتفرقة للمحولات الاهتمام فقط بالأجزاء الأكثر صلة بالتسلسل الطويل بدلاً من كل رمز مميز، مما يخفض التكلفة التربيعية للانتباه القياسي. وهذا ما يجعل النماذج ذات السياق الطويل الفعالة عملية على الأجهزة الحقيقية.

لماذا يعد الاهتمام الذاتي القياسي مكلفًا للتسلسلات الطويلة؟

يهتم كل رمز بكل رمز مميز آخر، لذا قم بقياس الحساب والذاكرة بمربع طول التسلسل.

ما هي الفكرة الأساسية للاهتمام المتناثر؟

يتم تقسيم التسلسل إلى كتل ويتم حساب الانتباه فقط لأزواج الكتل المختارة، والتي يتم أيضًا تعيينها جيدًا على نوى موتر وحدة معالجة الرسومات.

ما الذي يجعل الانتباه المتفرق الأصلي (NSA) مختلفًا عن العديد من الأساليب المتفرقة السابقة؟

تتعلم NSA نمطها المتفرق أثناء التدريب المسبق وهي مصممة للتوافق مع الأجهزة، لذلك تحافظ على الدقة أثناء التشغيل السريع.

ما هي الفروع الثلاثة التي تجمعها وكالة الأمن القومي لمفاتيحها وقيمها؟

تقوم NSA بدمج ضغط الرمز المميز واختيار الكتل الدقيقة والنافذة المنزلقة المحلية باستخدام البوابات المستفادة.

لماذا تستخدم وكالة الأمن القومي العمليات على مستوى الكتلة بدلاً من التشتت التعسفي على مستوى الرمز المميز؟

تتناسب أنماط الوصول على مستوى الكتلة مع أجهزة وحدة معالجة الرسومات، لذا تصبح مدخرات FLOP النظرية عمليات تسريع فعلية لساعة الحائط.