زبان AI گائیڈ

توجہ کا طریقہ کار

توجہ ایک ماڈل کو یہ فیصلہ کرنے دیتی ہے کہ ہر لفظ کی تشریح کرتے وقت جملے میں کون سے دوسرے الفاظ سب سے زیادہ اہمیت رکھتے ہیں۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It is the core idea that made the transformer — and therefore modern AI like ChatGPT — possible.

گہرا غوطہ

توجہ ہر لفظ کے لیے ایک آسان سوال کا جواب دیتی ہے: اس کو سمجھنے کے لیے مجھے کون سے دوسرے الفاظ پر غور کرنا چاہیے؟ واسوانی اور Google کے ساتھیوں کے ذریعہ 2017 کے پیپر 'توجہ آپ کی ضرورت ہے' نے ٹرانسفارمر متعارف کرایا، جو توجہ کو اپنے مرکزی انجن کے طور پر استعمال کرتا ہے اور پرانے بار بار ڈیزائن کو چھوڑتا ہے۔ ہر ٹوکن کو تین ویکٹرز میں تبدیل کیا جاتا ہے: ایک سوال (میں کیا ڈھونڈ رہا ہوں؟)، ایک کلید (میں کیا پیش کرتا ہوں؟)، اور ایک قدر (جو معلومات میرے پاس ہے)۔ توجہ کا وزن پیدا کرنے کے لیے ٹوکن کے استفسار کا موازنہ ہر دوسرے ٹوکن کی کلید سے کیا جاتا ہے، جو پھر اقدار کو آپس میں ملا دیتی ہے۔ خود توجہ یہ ایک ترتیب کے اندر کرتی ہے تاکہ ہر لفظ براہ راست ہر دوسرے لفظ پر جا سکے۔ ملٹی ہیڈ توجہ متوازی طور پر اس طرح کے بہت سے موازنہ چلاتی ہے، ہر ایک مختلف نمونوں پر مرکوز ہے۔

تکنیکی بصیرت

ریاضی کی پیمائش کی گئی ڈاٹ پروڈکٹ توجہ: softmax(QK^T / √d_k) V. سوالات اور کلیدوں کا ڈاٹ پروڈکٹ یہ بتاتا ہے کہ ہر جوڑا کتنا متعلقہ ہے۔ کلیدی جہت (√d_k) کے مربع جڑ سے تقسیم کرنا ان اسکورز کو بہت زیادہ بڑھنے سے روکتا ہے۔ softmax انہیں وزن میں بدل دیتا ہے جس کا مجموعہ ایک ہوتا ہے۔ اور V سے ضرب کرنے سے قدروں کا وزنی مرکب پیدا ہوتا ہے۔ چونکہ ہر ٹوکن کا ہر دوسرے سے موازنہ ہوتا ہے، لاگت ترتیب کی لمبائی کے مربع کے ساتھ بڑھتی ہے — O(n²) — یہی وجہ ہے کہ طویل ان پٹ مہنگے ہیں اور کیوں FlashAttention جیسی اصلاح موجود ہے۔

اسٹریٹجک اثر

رفتار اور پیمانہ

زبان کے کام کے بہاؤ مستقل مزاجی کی قربانی کے بغیر تیزی سے آگے بڑھ سکتے ہیں۔

رسائی اور رسائی

یہ زبانوں اور مواصلاتی طرزوں تک رسائی کو بڑھاتا ہے۔

واضح فیصلے

ٹیمیں فیصلے پر زیادہ وقت گزار سکتی ہیں جبکہ آٹومیشن تکرار کو سنبھالتی ہے۔

توجہ کے میکانزم کا مستقبل

توجہ یہاں رہنے کے لئے ہے، لیکن اس کی چوکور لاگت شدید تحقیق کو آگے بڑھاتی ہے۔ FlashAttention نے کمپیوٹیشن کو دوبارہ ترتیب دے کر معیاری توجہ کو کہیں زیادہ تیز اور زیادہ میموری کو موثر بنایا۔ نئی سمتوں میں ویرل اور لکیری توجہ، نسل کے دوران میموری کو سکڑنے کے لیے گروپ شدہ اور کثیر استفسار پر توجہ، اور ہائبرڈ ڈیزائنز شامل ہیں جو بہت طویل ان پٹ کے لیے ریاستی خلائی ماڈلز جیسے Mamba کے ساتھ توجہ ملاتے ہیں۔ مستقبل کے نظاموں سے توقع ہے کہ وہ لاگت کے منحنی خطوط کو موڑنے کے دوران توجہ کی لچک کو برقرار رکھیں تاکہ کتاب کی لمبائی یا کثیر دستاویزی ان پٹ پر کارروائی معمول اور سستی بن جائے۔

حقیقی دنیا کا نفاذ

مشینی ترجمہ، جہاں ہر ترجمہ شدہ لفظ تیار کرتے وقت ماڈل متعلقہ ماخذ کے الفاظ کو دیکھتا ہے۔

خلاصہ، جہاں توجہ ماڈل کو ایک طویل مضمون کے اہم ترین جملوں پر توجہ مرکوز کرنے میں مدد دیتی ہے۔

کوڈ اسسٹنٹس جو اگلی لائن کی پیشین گوئی کرتے وقت پہلے کی متغیر تعریفوں پر واپس آتے ہیں۔

ایک دستاویز پر سوال کا جواب دینا، جہاں توجہ سوالیہ الفاظ کو اس حوالے سے جوڑتی ہے جس میں جواب ہوتا ہے۔

خطرات اور گارڈریلز

گمراہ شدہ حقائق خاموشی سے رپورٹس، سپورٹ فلو، یا تحقیقی نتائج درج کر سکتے ہیں۔

فوری حساسیت اسی طرح کی درخواستوں میں متضاد نتائج پیدا کر سکتی ہے۔

اگر رسائی کے کنٹرول کمزور ہیں تو حساس ٹیکسٹ ڈیٹا کو بے نقاب کیا جا سکتا ہے۔

نفاذ کا روڈ میپ

1

رول آؤٹ سے پہلے آؤٹ پٹ فارمیٹ، ٹون اور معیار کے معیارات کی وضاحت کریں۔

2

جب بھی درستگی اہمیت رکھتی ہے تو بھروسہ مند ذرائع کے ساتھ زمینی جوابات۔

3

ہائی اسٹیک آؤٹ پٹس کے لیے ایک انسانی جائزہ چیک پوائنٹ رکھیں۔

4

ناکامی کے نمونوں کو ٹریک کریں اور پرامپٹس یا ورک فلو کو باقاعدگی سے دوبارہ تربیت دیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Attention Mechanisms quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اکثر پوچھے گئے سوالات

What is Attention Mechanisms?

توجہ ایک ماڈل کو یہ فیصلہ کرنے دیتی ہے کہ ہر لفظ کی تشریح کرتے وقت جملے میں کون سے دوسرے الفاظ سب سے زیادہ اہمیت رکھتے ہیں۔ یہ بنیادی خیال ہے جس نے ٹرانسفارمر — اور اس لیے جدید AI جیسے ChatGPT — کو ممکن بنایا۔

ایک جملے میں، توجہ کا طریقہ کار کیا کرتا ہے؟

توجہ ان وزنوں کی گنتی کرتی ہے جو یہ فیصلہ کرتی ہے کہ ہر ایک ٹوکن کو اپنی نمائندگی کرتے وقت دوسرے ٹوکن پر کتنا کھینچنا چاہیے۔

2017 کے کس تاریخی کاغذ نے ٹرانسفارمر فن تعمیر کو متعارف کرایا؟

'توجہ صرف آپ کی ضرورت ہے' (Vaswani et al., 2017) نے ٹرانسفارمر کی تجویز پیش کی، جو تکرار کے بجائے توجہ پر انحصار کرتا ہے۔

توجہ کے لحاظ سے ہر ٹوکن کے لیے تین ویکٹرز کیا ہیں؟

ہر ٹوکن ایک سوال، ایک کلید اور ایک قدر پیدا کرتا ہے۔ اقدار کو وزن دینے کے لیے سوالات کو کلیدوں سے ملایا جاتا ہے۔

فارمولہ softmax(QK^T / √d_k) V میں، کیوں تقسیم کریں √d_k سے؟

کلیدی جہت کے مربع جڑ کی طرف سے اسکیلنگ بڑے ڈاٹ پروڈکٹس کو روکتی ہے جو تربیت کو مستحکم رکھتے ہوئے سافٹ میکس کو چھوٹے گریڈینٹ میں دھکیل دیتے ہیں۔

معیاری خود توجہ بہت طویل ان پٹ کے لیے مہنگی کیوں ہو جاتی ہے؟

ہر ٹوکن ہر دوسرے ٹوکن پر ہوتا ہے، اس لیے موازنہ کی تعداد n² کے طور پر ہوتی ہے، جس سے طویل ترتیب وقت اور یادداشت میں مہنگی ہو جاتی ہے۔