زبان AI گائیڈ

سلائیڈنگ ونڈو توجہ

سلائیڈنگ ونڈو توجہ ہر ٹوکن کو پوری ترتیب کے بجائے صرف قریبی ٹوکن کے ایک مقررہ سائز کے پڑوس میں شرکت کرنے پر پابندی لگاتی ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

This cuts the quadratic cost of standard attention down to linear, making long-context models far cheaper to run.

گہرا غوطہ

معیاری خود دھیان ہر ٹوکن کا دوسرے ٹوکن سے موازنہ کرتا ہے، لہذا لمبائی N کے سلسلے میں تقریباً N مربع موازنہ کی ضرورت ہوتی ہے۔ سلائیڈنگ ونڈو کی توجہ ہر ٹوکن کو W سائز کی ونڈو (4,096 ٹوکن کہتے ہیں) دے کر اور صرف اس کھڑکی کے اندر پڑوسیوں کو دیکھ کر اسے ٹھیک کرتی ہے۔ لاگت N-squared کے بجائے N گنا W کے طور پر بڑھتی ہے۔ اہم طور پر، بہت سی کھڑکیوں والی تہوں کو اسٹیک کرنے سے موثر ریسپٹیو فیلڈ میں توسیع ہوتی ہے: L تہوں کے بعد، معلومات تقریباً L بار ڈبلیو ٹوکنز میں پھیل سکتی ہے، جیسے CNN کے بڑھتے ہوئے ریسپٹیو فیلڈ۔ Mistral 7B نے اسے 32 تہوں میں 4,096 ٹوکن ونڈو کے ساتھ مقبول بنایا، جو کہ نظریاتی 131K ٹوکن اسپین تک پہنچ گیا۔ ماڈلز اکثر کھڑکیوں والی تہوں کو کبھی کبھار مکمل توجہ دینے والی تہوں کے ساتھ ملا دیتے ہیں تاکہ طویل فاصلے کے لنکس کو محفوظ رکھا جا سکے۔

تکنیکی بصیرت

توجہ کے ماسک میں، پوزیشن i پر ایک سوال کو صرف پوزیشنز i مائنس W پلس 1 سے i (causal case) تک کیز دیکھنے کی اجازت ہے۔ اس ویرل ماسک کا مطلب ہے کہ KV کیشے کو صرف آخری ڈبلیو ٹوکن فی پرت کی ضرورت ہوتی ہے، جنریشن کے دوران میموری کو کم کرنا۔ چونکہ ونڈو ہر نئے ٹوکن کے ساتھ شفٹ ہوتی ہے، اس لیے یہ قدرتی طور پر ایک رولنگ بفر کیش کے ساتھ جوڑتی ہے جو ہمیشہ کے لیے بڑھنے کے بجائے قدیم ترین اندراجات کو اوور رائٹ کرتی ہے۔

اسٹریٹجک اثر

رفتار اور پیمانہ

زبان کے کام کے بہاؤ مستقل مزاجی کی قربانی کے بغیر تیزی سے آگے بڑھ سکتے ہیں۔

رسائی اور رسائی

یہ زبانوں اور مواصلاتی طرزوں تک رسائی کو بڑھاتا ہے۔

واضح فیصلے

ٹیمیں فیصلے پر زیادہ وقت گزار سکتی ہیں جبکہ آٹومیشن تکرار کو سنبھالتی ہے۔

سلائیڈنگ ونڈو توجہ کا مستقبل

ہائبرڈ ڈیزائن اب بہت سی سلائیڈنگ ونڈو تہوں کے درمیان چند عالمی یا پوری توجہ کی تہوں کو باہم جوڑ دیتے ہیں، حقیقی طویل فاصلے کے استدلال کے ساتھ کارکردگی کو متوازن کرتے ہیں۔ Gemma 2 اور دیگر متبادل مقامی اور عالمی بلاکس۔ توقع ہے کہ ونڈو توجہ کو اسٹیٹ اسپیس ماڈلز، توجہ کے سنک، اور KV-کیشے کمپریشن کے ساتھ جوڑنے کی توقع ہے تاکہ فرنٹیئر ماڈلز بغیر کسی رن وے میموری کے ملین ٹوکن سیاق و سباق کو ہینڈل کریں۔ یہ ایک غیر ملکی اصلاح کے بجائے پہلے سے طے شدہ بلڈنگ بلاک بنتا جا رہا ہے۔

حقیقی دنیا کا نفاذ

Mistral 7B صارفین کے GPUs پر سستے طور پر طویل اشارے کو سنبھالنے کے لیے اپنی تہوں میں 4,096 ٹوکن سلائیڈنگ ونڈو کا استعمال کرتا ہے۔

لانگفارمر کثیر صفحاتی دستاویزات کی درجہ بندی اور خلاصہ کرنے کے لیے ونڈو توجہ کے علاوہ چند عالمی ٹوکنز کا اطلاق کرتا ہے۔

Gemma 2 رفتار اور طویل فاصلے تک یاد کرنے کے لیے عالمی سطح پر توجہ دینے والی تہوں کے ساتھ مقامی سلائیڈنگ ونڈو تہوں کو تبدیل کرتا ہے۔

چیٹ اسسٹنٹس میں رولنگ بفر کے وی کیشز ٹوکنز کی صرف تازہ ترین ونڈو رکھتے ہیں، لمبی گفتگو کے دوران میموری کیپنگ کرتے ہیں۔

خطرات اور گارڈریلز

گمراہ شدہ حقائق خاموشی سے رپورٹس، سپورٹ فلو، یا تحقیقی نتائج درج کر سکتے ہیں۔

فوری حساسیت اسی طرح کی درخواستوں میں متضاد نتائج پیدا کر سکتی ہے۔

اگر رسائی کے کنٹرول کمزور ہیں تو حساس ٹیکسٹ ڈیٹا کو بے نقاب کیا جا سکتا ہے۔

نفاذ کا روڈ میپ

1

رول آؤٹ سے پہلے آؤٹ پٹ فارمیٹ، ٹون اور معیار کے معیارات کی وضاحت کریں۔

2

جب بھی درستگی اہمیت رکھتی ہے تو بھروسہ مند ذرائع کے ساتھ زمینی جوابات۔

3

ہائی اسٹیک آؤٹ پٹس کے لیے ایک انسانی جائزہ چیک پوائنٹ رکھیں۔

4

ناکامی کے نمونوں کو ٹریک کریں اور پرامپٹس یا ورک فلو کو باقاعدگی سے دوبارہ تربیت دیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Sliding Window Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

گروپ شدہ سوال کی توجہ

اکثر پوچھے گئے سوالات

What is Sliding Window Attention?

سلائیڈنگ ونڈو توجہ ہر ٹوکن کو پوری ترتیب کے بجائے صرف قریبی ٹوکن کے ایک مقررہ سائز کے پڑوس میں شرکت کرنے پر پابندی لگاتی ہے۔ یہ معیاری توجہ کی چوکور لاگت کو لکیری تک کم کر دیتا ہے، جس سے طویل سیاق و سباق کے ماڈلز کو چلانے کے لیے بہت سستا ہو جاتا ہے۔

معیاری خود توجہ پر ونڈو کی توجہ کو سلائیڈ کرنے کا بنیادی کمپیوٹیشنل فائدہ کیا ہے؟

ہر ٹوکن کو W پڑوسیوں کی ایک مقررہ ونڈو تک محدود کرنے سے، لاگت N-squared کے بجائے N گنا W (N میں لکیری) کے طور پر بڑھتی ہے۔

Mistral 7B کے ڈیزائن میں، معلومات اب بھی ایک 4,096 ٹوکن ونڈو سے آگے کیسے سفر کر سکتی ہے؟

CNN کی طرح، ہر پرت معلومات کو ایک ونڈو کو مزید آگے بڑھاتی ہے، اس لیے L پرتیں تقریباً L گنا W ٹوکنز کا ایک مؤثر دورانیہ دیتی ہیں۔

ٹیکسٹ جنریشن کے دوران سلائیڈنگ ونڈو کی توجہ میموری کو کیوں کم کرتی ہے؟

چونکہ ٹوکن صرف اس کی حالیہ ونڈو میں آتا ہے، اس لیے پرانی کلید/قدر کے اندراجات کو اکثر رولنگ بفر کیش کے ذریعے رد کیا جا سکتا ہے۔

Gemma 2 جیسے ماڈل طویل فاصلے تک استدلال کو برقرار رکھنے کے لیے سلائیڈنگ ونڈوز کے ساتھ کس ڈیزائن کا انتخاب کرتے ہیں؟

مقامی لوگوں کے درمیان کبھی کبھار عالمی/مکمل توجہ کی تہوں کو ملانے سے حقیقی لمبی دوری کے رابطوں کو محفوظ رکھا جاتا ہے جو خالص کھڑکی کو کمزور کرتے ہیں۔

W سائز کی ایک causal سلائیڈنگ ونڈو کے لیے، میں اس پوزیشن پر کون سی کلیدوں سے استفسار کر سکتا ہوں؟

causal کیس میں استفسار خود کو دیکھتا ہے اور W مائنس 1 ٹوکن اس کے فوراً پہلے، کبھی بھی مستقبل کے ٹوکن نہیں۔