لکیری توجہ اور پرفارمر دانا
لکیری توجہ ٹرانسفارمرز میں چوکور سوفٹ میکس توجہ کو ریاضی کی چال سے بدل دیتی ہے جو ترتیب کی لمبائی کے ساتھ لکیری طور پر ترازو کرتی ہے۔
جائزہ
Performer is a landmark method that approximates softmax using random feature kernels, making very long sequences computationally affordable.
گہرا غوطہ
معیاری ٹرانسفارمر توجہ ٹوکن کے ہر جوڑے کے درمیان اسکور کی گنتی کرتا ہے، لاگت کا وقت اور میموری جو ترتیب کی لمبائی (O(n^2)) کے مربع کے ساتھ بڑھتا ہے۔ لکیری توجہ حساب کو دوبارہ لکھتی ہے لہذا لاگت صرف لکیری طور پر بڑھتی ہے (O(n))۔ کلیدی خیال: softmax توجہ softmax(QK^T)V ہے، لیکن اگر آپ softmax کو کرنل فیچر میپ phi سے تبدیل کرتے ہیں، تو آپ کو phi(Q)(phi(K)^T V) ملتا ہے۔ چونکہ میٹرکس ضرب ملحقہ ہے، آپ پہلے phi(K)^T V (ایک چھوٹا d-by-d میٹرکس) کی گنتی کرتے ہیں، مکمل طور پر وشال n-by-n سکور میٹرکس سے گریز کرتے ہیں۔ پرفارمر، Google سے 2020 میں، FAVOR+ (فاسٹ اٹینشن ویا مثبت آرتھوگونل رینڈم فیچرز) کا استعمال کرتے ہوئے اسے حقیقی سافٹ میکس کا ایک وفادار تخمینہ بناتا ہے، بے ترتیب تخمینے تیار کرتا ہے جو دانا کے تخمینے کو غیر جانبدارانہ اور مستحکم رکھتے ہیں۔
تکنیکی بصیرت
پرفارمر کا FAVOR+ مثبت بے ترتیب خصوصیات کا استعمال کرتے ہوئے softmax kernel exp(q.k) کا تخمینہ لگاتا ہے: یہ استفسارات میں لپٹے ہوئے بے ترتیب گاوسی پروجیکشنز کے ذریعے سوالات اور کلیدوں کا نقشہ بناتا ہے، غیر منفی توجہ کے وزن کی ضمانت دیتا ہے اور پہلے تخمینہ لگانے والوں کی عددی عدم استحکام سے بچتا ہے۔ آرتھوگونل بے ترتیب خصوصیات کا استعمال تغیر کو کم کرتا ہے۔ اہم بات یہ ہے کہ n-by-n توجہ کا میٹرکس کبھی عملی نہیں ہوتا، لہذا میموری چوکور سے لکیری تک گر جاتی ہے، جس سے دسیوں ہزار ٹوکنز کی ترتیب کو فعال کیا جاتا ہے۔
اسٹریٹجک اثر
لاگت اور بجٹ
فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔
واضح فیصلے
تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔
کوالٹی کنٹرول
انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔
لکیری توجہ اور پرفارمر دانا کا مستقبل
خالص لکیری توجہ اکثر کوالٹی پر سافٹ میکس کو پیچھے چھوڑتی ہے، اس لیے فیلڈ ہائبرڈز پر تبدیل ہو رہی ہے: سٹیٹ اسپیس ماڈلز (Mamba)، گیٹڈ لکیری توجہ، اور فن تعمیر جو بہت ساری لکیری پرتوں کے ساتھ پوری توجہ دینے والی پرتوں کو ملا دیتے ہیں۔ جیسا کہ سیاق و سباق کی ونڈوز لاکھوں ٹوکنز کی طرف دھکیل رہی ہیں، لکیری اور ذیلی چوکور میکانزم لاگت کے لیے تیزی سے پرکشش ہیں، اور موثر اسٹریمنگ انفرنس اور آن ڈیوائس ماڈلز کے لیے بار بار کی طرز کی لکیری توجہ پر نظر ثانی کی جا رہی ہے۔
حقیقی دنیا کا نفاذ
طویل جینومک یا پروٹین کی ترتیب پر کارروائی کرنا جہاں مکمل چوکور توجہ GPU میموری کو ختم کردے گی۔
پرفارمر طرز کی ریڑھ کی ہڈی کا استعمال کرتے ہوئے بغیر چنک کیے بہت طویل رپورٹس پر دستاویز کی سطح کا خلاصہ
موثر لانگ فارم آڈیو یا ٹائم سیریز ماڈلنگ جہاں تسلسل دسیوں ہزار قدموں پر محیط ہے
لمبے سیاق و سباق کے چیٹ ماڈلز میں کچھ softmax تہوں کو لکیری-توجہ کی مختلف حالتوں سے بدل کر تخمینہ لاگت کو کم کرنا
خطرات اور گارڈریلز
ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔
بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔
سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔
نفاذ کا روڈ میپ
نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔
حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔
غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔
اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Linear Attention and Performer Kernels quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
RWKV لکیری توجہ
اکثر پوچھے گئے سوالات
What is Linear Attention and Performer Kernels?
لکیری توجہ ٹرانسفارمرز میں چوکور سوفٹ میکس توجہ کو ریاضی کی چال سے بدل دیتی ہے جو ترتیب کی لمبائی کے ساتھ لکیری طور پر ترازو کرتی ہے۔ پرفارمر ایک تاریخی طریقہ ہے جو بے ترتیب فیچر کرنل کا استعمال کرتے ہوئے سافٹ میکس کا تخمینہ لگاتا ہے، جس سے کمپیوٹیشنل طور پر بہت لمبے سلسلے کو سستی بنایا جاتا ہے۔
معیاری سافٹ میکس توجہ ترتیب کی لمبائی کے ساتھ خراب کیوں ہے؟
Softmax توجہ ٹوکن کے ہر جوڑے کا موازنہ کرتی ہے، ایک n-by-n سکور میٹرکس تیار کرتی ہے، لہذا لاگت O(n^2) کے طور پر بڑھتی ہے۔
کون سی ریاضیاتی خاصیت لکیری توجہ کو n-by-n میٹرکس سے بچنے دیتی ہے؟
چونکہ میٹرکس ضرب ملحقہ ہے، آپ phi(Q)phi(K)^T کے بجائے پہلے phi(K)^T V، ایک چھوٹا d-by-d میٹرکس گن سکتے ہیں۔
پرفارمر کے FAVOR+ میکانزم کا تخمینہ کیا ہے؟
FAVOR+ مکمل توجہ کا میٹرکس بنائے بغیر ایکسپونینشل سافٹ میکس کرنل کا تخمینہ لگانے کے لیے مثبت آرتھوگونل رینڈم خصوصیات کا استعمال کرتا ہے۔
پرفارمر پہلے کی مثلثی خصوصیات کے بجائے مثبت بے ترتیب خصوصیات کیوں استعمال کرتا ہے؟
مثبت خصوصیات دانا کے تخمینے کو غیر منفی رکھتی ہیں، ان عدم استحکام اور منفی اقدار سے گریز کرتی ہیں جو پہلے کے sin/cos فیچر کے نقشوں سے دوچار تھیں۔
ترتیب کی لمبائی n میں پرفارمر طرز کی لکیری توجہ کی تخمینی پیچیدگی کیا ہے؟
کمپیوٹیشن کو دوبارہ ترتیب دے کر اور کبھی بھی n-by-n میٹرکس نہ بنا کر، لاگت کا ترازو ترتیب کی لمبائی کے ساتھ لکیری طور پر ہوتا ہے۔