فلیش توجہ
FlashAttention ایک میموری پر اثر رکھنے والا الگورتھم ہے جو معیاری ٹرانسفارمرز کی طرح عین توجہ کا حساب لگاتا ہے لیکن GPU میموری کو سست کرنے کے لیے کبھی بھی جائنٹ توجہ میٹرکس لکھے بغیر۔
جائزہ
It made long-context training and inference dramatically faster and cheaper.
گہرا غوطہ
معیاری توجہ ٹوکن کے ہر جوڑے کے لیے ایک اسکور کی گنتی کرتی ہے، جس سے N-by-N میٹرکس تیار ہوتا ہے۔ 4,000 ٹوکن کی ترتیب کے لیے جو کہ 16 ملین سکور ہے، اور میٹرکس کو GPU کی ہائی بینڈوڈتھ میموری (HBM) سے لکھا جانا اور واپس پڑھنا چاہیے۔ وہ میموری ٹریفک، ریاضی نہیں، اصل رکاوٹ ہے۔ 2022 میں Tri Dao اور ساتھیوں کے ذریعے متعارف کرایا گیا FlashAttention، کمپیوٹیشن کی تشکیل نو کرتا ہے تاکہ میٹرکس کبھی بھی مکمل طور پر تیار نہ ہو۔ یہ ٹائلوں کی ترتیب کو پروسیس کرتا ہے جو GPU کے چھوٹے، انتہائی تیز آن چپ SRAM میں فٹ ہوتا ہے، سافٹ میکس کو بتدریج کمپیوٹنگ کرتا ہے۔ نتیجہ ریاضی کے لحاظ سے معیاری توجہ سے مماثل ہے لیکن بہت کم میموری استعمال کرتا ہے اور کئی گنا زیادہ تیزی سے چلتا ہے، جس سے سیاق و سباق کی زیادہ لمبی ونڈوز کو فعال کیا جاتا ہے۔
تکنیکی بصیرت
چال ٹائلنگ کے ساتھ مل کر 'آن لائن سافٹ میکس' ہے۔ FlashAttention استفسارات، کلیدوں اور قدروں کے چھوٹے بلاکس کو SRAM میں لوڈ کرتا ہے، جزوی توجہ کے نتائج کا حساب لگاتا ہے، اور نئے بلاکس کے آتے ہی رقوم کو دوبارہ اسکیل کرتا ہے تاکہ softmax نارملائزیشن ایک ساتھ تمام اسکورز کو دیکھے بغیر درست رہے۔ چونکہ یہ HBM میں مکمل N-by-N میٹرکس کو کبھی بھی ذخیرہ نہیں کرتا ہے، میموری کی پیمائش چوکور کی بجائے لکیری طور پر ہوتی ہے، اور دانا کو ایک ہی GPU آپریشن میں ملایا جاتا ہے تاکہ میموری کو پڑھنے اور لکھنے کی رفتار کو کم سے کم کیا جا سکے۔
اسٹریٹجک اثر
رفتار اور پیمانہ
زبان کے کام کے بہاؤ مستقل مزاجی کی قربانی کے بغیر تیزی سے آگے بڑھ سکتے ہیں۔
رسائی اور رسائی
یہ زبانوں اور مواصلاتی طرزوں تک رسائی کو بڑھاتا ہے۔
واضح فیصلے
ٹیمیں فیصلے پر زیادہ وقت گزار سکتی ہیں جبکہ آٹومیشن تکرار کو سنبھالتی ہے۔
فلیش توجہ کا مستقبل
FlashAttention ایک ڈیفالٹ بلڈنگ بلاک بن گیا ہے۔ FlashAttention-2 نے GPU ورک پارٹیشننگ کو بہتر بنایا، اور FlashAttention-3 نے Hopper ہارڈویئر کی نئی خصوصیات جیسے asynchrony اور کم درستگی FP8 کا استحصال کیا۔ چپس کے ساتھ جاری مشترکہ ڈیزائن، لمبی دستاویزات کے لیے انفرنس سرورز میں گہرا انضمام، اور ویرینٹ یا سلائیڈنگ ونڈو توجہ کے لیے ٹیون کیے جانے کی توقع کریں۔ جیسا کہ سیاق و سباق کی ونڈوز لاکھوں ٹوکنز کی طرف دھکیلتی ہیں، اس طرح کے IO سے آگاہ کرنل تربیت اور سرونگ کے اخراجات کو قابل انتظام رکھنے کے لیے ضروری رہتے ہیں۔
حقیقی دنیا کا نفاذ
لاما اور GPT طرز کے نظام جیسے بڑے لینگویج ماڈلز کو تیز تر اور کم GPU لاگت پر تربیت دینا
طویل سیاق و سباق کے چیٹ اسسٹنٹس کی خدمت کرنا جو میموری ختم ہونے کے بغیر پوری کتابیں یا کوڈ بیس ہضم کر لیتے ہیں۔
دستاویز کا خلاصہ کرنے والی پائپ لائنوں کو تیز کرنا جو ایک ساتھ دسیوں ہزار ٹوکن پر کارروائی کرتی ہیں۔
پاورنگ ویژن اور ملٹی موڈل ٹرانسفارمرز جہاں تصویری پیچ کی لمبی ترتیب توجہ کو مہنگا بناتی ہے۔
خطرات اور گارڈریلز
گمراہ شدہ حقائق خاموشی سے رپورٹس، سپورٹ فلو، یا تحقیقی نتائج درج کر سکتے ہیں۔
فوری حساسیت اسی طرح کی درخواستوں میں متضاد نتائج پیدا کر سکتی ہے۔
اگر رسائی کے کنٹرول کمزور ہیں تو حساس ٹیکسٹ ڈیٹا کو بے نقاب کیا جا سکتا ہے۔
نفاذ کا روڈ میپ
رول آؤٹ سے پہلے آؤٹ پٹ فارمیٹ، ٹون اور معیار کے معیارات کی وضاحت کریں۔
جب بھی درستگی اہمیت رکھتی ہے تو بھروسہ مند ذرائع کے ساتھ زمینی جوابات۔
ہائی اسٹیک آؤٹ پٹس کے لیے ایک انسانی جائزہ چیک پوائنٹ رکھیں۔
ناکامی کے نمونوں کو ٹریک کریں اور پرامپٹس یا ورک فلو کو باقاعدگی سے دوبارہ تربیت دیں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the FlashAttention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
روٹری پوزیشن ایمبیڈنگس
اکثر پوچھے گئے سوالات
What is FlashAttention?
FlashAttention ایک میموری پر اثر رکھنے والا الگورتھم ہے جو معیاری ٹرانسفارمرز کی طرح عین توجہ کا حساب لگاتا ہے لیکن GPU میموری کو سست کرنے کے لیے کبھی بھی جائنٹ توجہ میٹرکس لکھے بغیر۔ اس نے طویل سیاق و سباق کی تربیت اور اندازہ کو ڈرامائی طور پر تیز اور سستا بنا دیا۔
معیاری توجہ میں اہم رکاوٹ FlashAttention کے اہداف کیا ہیں؟
معیاری توجہ میموری سے منسلک ہے: بڑے N-by-N میٹرکس کو ہائی بینڈوڈتھ میموری تک اور اس سے شٹل کرنا وقت پر حاوی ہوتا ہے، خود ریاضی پر نہیں۔
FlashAttention کا آؤٹ پٹ معیاری توجہ سے کیسے موازنہ کرتا ہے؟
FlashAttention بالکل اسی توجہ کی قدروں کا حساب لگاتا ہے۔ یہ مکمل میٹرکس کو عملی جامہ پہنانے سے بچنے کے لیے صرف کمپیوٹیشن کو دوبارہ منظم کرتا ہے۔
ٹائلوں میں ڈیٹا پروسیسنگ کرکے فلیش اٹٹینشن کس GPU میموری کا فائدہ اٹھاتا ہے؟
FlashAttention بھاری کام کو کمپیوٹ یونٹس کے قریب رکھتے ہوئے GPU کے تیز آن چپ SRAM میں چھوٹی ٹائلیں لوڈ کرتا ہے۔
FlashAttention کو کونسی تکنیک ایک ساتھ تمام سکور دیکھے بغیر سافٹ میکس کی گنتی کرنے دیتی ہے؟
ایک آن لائن سافٹ میکس زیادہ سے زیادہ اور رقوم کو برقرار رکھتا ہے، نئے ٹائلز کے آتے ہی جزوی نتائج کو دوبارہ اسکیل کرتا ہے تاکہ حتمی نارملائزیشن درست ہو۔
FlashAttention-3 نے خاص طور پر کیا فائدہ اٹھایا؟
FlashAttention-3 کو جدید Hopper GPUs کے ساتھ مل کر ڈیزائن کیا گیا تھا، جس میں مزید اسپیڈ اپس کے لیے غیر مطابقت پذیر عمل اور کم درستگی FP8 کا استعمال کیا گیا تھا۔