الدليل الفني

انتباه فلاش

يعد Flash Attention طريقة ذكية لحساب خطوة الانتباه داخل Transformers دون كتابة مصفوفة الانتباه العملاقة لإبطاء الذاكرة.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It makes long-context models far faster and more memory-efficient without changing their math.

الغوص العميق

يقارن الاهتمام القياسي كل رمز مميز بكل رمز مميز آخر، مما ينتج مصفوفة نقاط N-by-N التي تنمو بشكل تربيعي مع طول التسلسل. بسذاجة، تتم كتابة هذه المصفوفة وقراءتها مرة أخرى من ذاكرة GPU ذات النطاق الترددي العالي (HBM)، وهذا النقل المكوكي - وليس الضرب - هو عنق الزجاجة الحقيقي. يعيد Flash Attention، الذي قدمه Tri Dao وزملاؤه في عام 2022، تنظيم العمليات الحسابية بحيث لا يتم تخزين المصفوفة بالكامل أبدًا. فهو يعالج الاستعلامات والمفاتيح والقيم في مربعات صغيرة تتلاءم مع ذاكرة SRAM السريعة الموجودة على الرقاقة، ويحسب النتائج الجزئية، ويجمعها معًا باستخدام خدعة run-softmax عبر الإنترنت. الناتج مطابق رياضيًا للانتباه العادي ولكنه يستخدم الذاكرة الخطية ويعمل بشكل أسرع عدة مرات، خاصة في التسلسلات الطويلة.

البصيرة الفنية

الحيلة الأساسية هي التبليط بالإضافة إلى softmax عبر الإنترنت. يحتاج Softmax عادةً إلى صف الدرجات بالكامل لحساب مقامه، لكن Flash Attention يحافظ على الحد الأقصى للتشغيل والمجموع الجاري أثناء تدفق كل مربع، وإعادة قياس المخرجات الجزئية السابقة بحيث تكون النتيجة النهائية دقيقة. نظرًا لأن الدرجات المتوسطة تبقى في SRAM (مراتب من حيث الحجم أسرع من HBM)، فإن الخوارزمية تكون على دراية بـ IO: فهي تقلل من عمليات القراءة والكتابة في الذاكرة بدلاً من العمليات الحسابية الأولية.

التأثير الاستراتيجي

التكلفة والميزانية

تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.

قرارات أوضح

يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.

مراقبة الجودة

تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.

مستقبل فلاش الاهتمام

أصبح Flash Attention بمثابة لبنة بناء افتراضية، حيث يقوم FlashAttention-2 وFlashAttention-3 بضغط المزيد من الإنتاجية من وحدات معالجة الرسوميات الأحدث مثل H100 من خلال تحسين تقسيم العمل واستغلال مسارات FP8 منخفضة الدقة. توقع استمرار التصميم المشترك مع الأجهزة، والتكامل الأكثر إحكامًا في أطر التدريب والاستدلال، والمتغيرات المضبوطة من أجل الاهتمام المتناثر والنوافذ المنزلقة والسياق الطويل جدًا. مع امتداد نوافذ السياق نحو ملايين الرموز المميزة، تظل النواة المدركة للإدخال والإخراج مثل هذه ضرورية للحفاظ على الذاكرة والسرعة العملية.

التنفيذ في العالم الحقيقي

تدريب نماذج اللغات الكبيرة مثل أنظمة Llama وGPT مع نوافذ سياق أطول وبتكلفة ذاكرة أقل.

خدمة مساعدي الدردشة بشكل أسرع من خلال تسريع مرحلة التعبئة المسبقة حيث تتم قراءة المطالبة الطويلة لأول مرة.

تمكين أدوات تحليل المستندات التي تستوعب كتبًا أو قواعد تعليمات برمجية كاملة عن طريق جعل الانتباه بالتسلسل الطويل ممكنًا على وحدة معالجة رسومات واحدة.

تشغيل محولات الرؤية والصوت حيث تقوم المدخلات عالية الدقة بإنشاء تسلسلات رمزية طويلة جدًا.

المخاطر والدرابزين

يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.

غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.

يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.

خارطة طريق التنفيذ

1

تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.

2

المعيار في ظل ظروف التحميل والبيانات الواقعية.

3

مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.

4

قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Flash Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

طرح الاهتمام وتشذيب الرأس

الأسئلة المتداولة

What is Flash Attention?

يعد Flash Attention طريقة ذكية لحساب خطوة الانتباه داخل Transformers دون كتابة مصفوفة الانتباه العملاقة لإبطاء الذاكرة. فهو يجعل نماذج السياق الطويل أسرع بكثير وأكثر كفاءة في الذاكرة دون تغيير حساباتها.

ما هو عنق الزجاجة الرئيسي الذي يستهدفه Flash Attention؟

Flash Attention مدرك لـ IO: فهو يقلل من نقل البيانات بين ذاكرة SRAM السريعة على الرقاقة والذاكرة البطيئة ذات النطاق الترددي العالي، وهو ما يمثل عنق الزجاجة الحقيقي وليس الحسابي نفسه.

كيف يتجنب Flash Attention تخزين مصفوفة انتباه N-by-N الكاملة؟

يقوم بتجانب العمليات الحسابية بحيث تتناسب كل كتلة مع ذاكرة SRAM السريعة، مما يؤدي إلى حساب وتجميع المخرجات الجزئية دون تجسيد المصفوفة بأكملها في HBM.

ما هي التقنية التي تتيح لـ Flash Attention حساب softmax بشكل صحيح دون رؤية الصف بأكمله مرة واحدة؟

يحافظ softmax عبر الإنترنت على الحد الأقصى للتشغيل والمقام الجاري أثناء تدفق المربعات، وإعادة قياس المخرجات الجزئية السابقة بحيث تكون التسوية النهائية دقيقة.

لماذا يساعد Flash Attention كثيرًا في التسلسلات الطويلة؟

يتم قياس مصفوفة الانتباه الساذجة على أنها N-squared في الذاكرة، لذا فإن تجنب تخزينها بالكامل يؤدي إلى أكبر توفير عندما تكون التسلسلات طويلة.

ما الذي يعطيه تصميم Flash Attention "المدرك للإدخال" الأولوية للتصغير؟

تعني تقنية IO-aware أن الخوارزمية مصممة حول تكلفة نقل البيانات في التسلسل الهرمي للذاكرة، مما يقلل من حركة مرور HBM بدلاً من العمليات الحسابية.