دليل اللغة AI

تنبيه فلاش

FlashAttention عبارة عن خوارزمية موفرة للذاكرة تحسب نفس الاهتمام تمامًا مثل المحولات القياسية ولكن دون كتابة مصفوفة الاهتمام العملاقة لإبطاء ذاكرة وحدة معالجة الرسومات.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It made long-context training and inference dramatically faster and cheaper.

الغوص العميق

يحسب الاهتمام القياسي النتيجة لكل زوج من الرموز المميزة، مما ينتج مصفوفة N-by-N. بالنسبة لتسلسل مكون من 4000 رمز يمثل 16 مليون نتيجة، ويجب كتابة المصفوفة وقراءتها مرة أخرى من ذاكرة النطاق الترددي العالي (HBM) الخاصة بوحدة معالجة الرسومات. إن حركة الذاكرة، وليس الرياضيات، هي عنق الزجاجة الحقيقي. يعيد FlashAttention، الذي قدمه Tri Dao وزملاؤه في عام 2022، هيكلة الحساب بحيث لا تتحقق المصفوفة بالكامل أبدًا. فهو يعالج التسلسل في المربعات التي تتلاءم مع ذاكرة SRAM الصغيرة فائقة السرعة الموجودة على شريحة وحدة معالجة الرسومات، ويحسب softmax بشكل متزايد مع تقدمه. والنتيجة مطابقة رياضيًا للانتباه القياسي ولكنها تستخدم ذاكرة أقل بكثير وتعمل بشكل أسرع عدة مرات، مما يتيح نوافذ سياق أطول بكثير.

البصيرة الفنية

الحيلة هي "softmax عبر الإنترنت" مع التبليط. يقوم FlashAttention بتحميل كتل صغيرة من الاستعلامات والمفاتيح والقيم إلى SRAM، ويحسب مخرجات الانتباه الجزئية، ويعيد قياس المجاميع الجارية عند وصول كتل جديدة بحيث تظل تسوية softmax صحيحة دون رؤية جميع النتائج مرة واحدة. نظرًا لأنها لا تقوم مطلقًا بتخزين مصفوفة N-by-N الكاملة في HBM، يتم قياس الذاكرة خطيًا وليس تربيعيًا، ويتم دمج النواة في عملية GPU واحدة لتقليل القراءة والكتابة البطيئة للذاكرة.

التأثير الاستراتيجي

السرعة والحجم

يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.

الوصول والوصول

فهو يوسع الوصول عبر اللغات وأنماط الاتصال.

قرارات أوضح

يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.

مستقبل FlashAttention

أصبح FlashAttention لبنة البناء الافتراضية. قام FlashAttention-2 بتحسين تقسيم عمل وحدة معالجة الرسومات، ويستغل FlashAttention-3 ميزات أجهزة Hopper الأحدث مثل عدم التزامن وFP8 منخفض الدقة. توقع استمرار التصميم المشترك مع الرقائق، والتكامل الأعمق في خوادم الاستدلال للمستندات الطويلة، والمتغيرات المضبوطة للانتباه المتناثر أو النافذة المنزلقة. نظرًا لأن نوافذ السياق تتجه نحو ملايين الرموز المميزة، تظل النواة المدركة لـ IO مثل هذه ضرورية للحفاظ على إمكانية التحكم في تكاليف التدريب وخدمة التكاليف.

التنفيذ في العالم الحقيقي

تدريب نماذج اللغات الكبيرة مثل أنظمة Llama وGPT بشكل أسرع وبتكلفة أقل لوحدة معالجة الرسومات

خدمة مساعدي الدردشة ذوي السياق الطويل الذين يستوعبون كتبًا أو قواعد تعليمات برمجية كاملة دون نفاد الذاكرة

تسريع مسارات تلخيص المستندات التي تعالج عشرات الآلاف من الرموز المميزة في وقت واحد

تعزيز الرؤية والمحولات متعددة الوسائط حيث تجعل التسلسلات الطويلة من تصحيحات الصور الانتباه مكلفًا

المخاطر والدرابزين

يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.

يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.

قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.

خارطة طريق التنفيذ

1

حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.

2

استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.

3

احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.

4

تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the FlashAttention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

الروتاري موقف التضمين

الأسئلة المتداولة

What is FlashAttention?

FlashAttention عبارة عن خوارزمية موفرة للذاكرة تحسب نفس الاهتمام تمامًا مثل المحولات القياسية ولكن دون كتابة مصفوفة الاهتمام العملاقة لإبطاء ذاكرة وحدة معالجة الرسومات. لقد جعل التدريب والاستدلال طويل السياق أسرع وأرخص بشكل كبير.

ما هو عنق الزجاجة الرئيسي لأهداف FlashAttention في الاهتمام القياسي؟

الاهتمام القياسي مرتبط بالذاكرة: إن نقل مصفوفة N-by-N الضخمة من وإلى الذاكرة ذات النطاق الترددي العالي يهيمن على الوقت، وليس على العمليات الحسابية نفسها.

كيف يمكن مقارنة مخرجات FlashAttention بالانتباه القياسي؟

يحسب FlashAttention نفس قيم الانتباه بالضبط؛ إنه يعيد تنظيم الحساب فقط لتجنب تجسيد المصفوفة الكاملة.

ما هي ذاكرة GPU التي يستغلها FlashAttention من خلال معالجة البيانات في المربعات؟

يقوم FlashAttention بتحميل مربعات صغيرة في ذاكرة SRAM السريعة الموجودة على شريحة وحدة معالجة الرسومات، مما يجعل العمل الثقيل قريبًا من وحدات الحوسبة.

ما هي التقنية التي تتيح لـ FlashAttention حساب softmax دون رؤية جميع النتائج مرة واحدة؟

يحافظ softmax عبر الإنترنت على الحد الأقصى والمبالغ الجارية، ويعيد قياس النتائج الجزئية مع وصول مربعات جديدة بحيث تكون التسوية النهائية صحيحة.

ما الذي استفاد منه FlashAttention-3 على وجه التحديد؟

تم تصميم FlashAttention-3 بالاشتراك مع وحدات معالجة الرسوميات Hopper الحديثة، باستخدام التنفيذ غير المتزامن وFP8 منخفض الدقة لمزيد من التسريع.