بنیادی اصول گائیڈ

وزن میں کمی اور L2 ریگولرائزیشن

وزن میں کمی ایک سادہ، طاقتور تکنیک ہے جو ٹریننگ کے دوران ماڈل کے وزن کو صفر کی طرف دھکیل دیتی ہے، اور اسے کسی ایک خصوصیت پر بہت زیادہ انحصار کرنے سے روکتی ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It reduces overfitting and is one of the most widely used regularizers in deep learning.

گہرا غوطہ

جب ایک ماڈل ٹریننگ کرتا ہے، تو یہ بڑے، باریک ٹون والے وزن کو بڑھا کر ڈیٹا میں شور کو روک سکتا ہے جو ٹریننگ سیٹ پر بالکل فٹ بیٹھتا ہے لیکن عام طور پر خراب ہوتا ہے۔ L2 ریگولرائزیشن نقصان کے فنکشن میں مربع وزن کی رقم کے متناسب جرمانہ شامل کرکے اس کا مقابلہ کرتی ہے۔ اصلاح کار کے اب دو اہداف ہیں: ڈیٹا کو فٹ کریں اور وزن کو چھوٹا رکھیں، لہذا یہ ہموار، زیادہ مضبوط حلوں پر طے پاتا ہے۔ وزن میں کمی ہر ایک اپ ڈیٹ کے مرحلے پر ہر وزن کو ایک چھوٹے سے حصے سے سکڑنے کا قریب سے متعلق خیال ہے۔ سادہ تدریجی نزول کے ساتھ دونوں ریاضی کے لحاظ سے مساوی ہیں، لیکن ایڈم جیسے موافقت پذیر اصلاح کاروں کے ساتھ ان میں فرق ہے، یہی وجہ ہے کہ ایڈم ڈبلیو کو تدریجی بنیاد پر اپ ڈیٹ سے کشی کو ڈیکپل کرنے اور اسے صحیح طریقے سے برتاؤ کرنے کے لیے متعارف کرایا گیا تھا۔

تکنیکی بصیرت

L2 ریگولرائزیشن نقصان میں مربع وزن کے مجموعے کا لیمبڈا گنا اضافہ کرتی ہے، لہذا اس کا میلان ہر وزن کے متناسب اصطلاح کا اضافہ کرتا ہے، اسے صفر کی طرف کھینچتا ہے۔ ڈیکپلڈ وزن کی کمی ہر وزن کو ایک عنصر سے ضرب کرتی ہے جیسے (1 مائنس سیکھنے کی شرح اوقات لیمبڈا)۔ انکولی طریقوں میں، L2 کو نقصان میں جوڑنے سے فی پیرامیٹر اسکیلنگ جرمانہ کو مسخ کرنے دیتی ہے، لہذا ایڈم ڈبلیو چھوٹے وزن کی طرف مطلوبہ یکساں پل کو بحال کرتے ہوئے، سکڑنے کو الگ سے لاگو کرتا ہے۔

اسٹریٹجک اثر

واضح فیصلے

یہ آپ کو مارکیٹنگ کی زبان سے واضح تکنیکی دعووں کو الگ کرنے میں مدد کرتا ہے۔

لاگت اور بجٹ

آپ پیسہ یا وقت خرچ کرنے سے پہلے بہتر نفاذ کے سوالات پوچھ سکتے ہیں۔

Team and workflow

مشترکہ تفہیم کے ساتھ ٹیمیں بہتر پروڈکٹ، پالیسی اور سیکھنے کے فیصلے کرتی ہیں۔

وزن میں کمی اور L2 ریگولرائزیشن کا مستقبل

بڑے لینگویج ماڈلز اور ویژن ٹرانسفارمرز کے لیے تربیتی ترکیبوں میں وزن میں کمی ایک طے شدہ جزو بنی ہوئی ہے، اور ایڈم ڈبلیو اب ان کے لیے معیاری اصلاح کار ہے۔ تحقیق جاری ہے کہ کس طرح زوال سیکھنے کی شرح کے نظام الاوقات، نارملائزیشن لیئرز، اور ماڈل اسکیل کے ساتھ تعامل کرتا ہے، کیونکہ ماڈل کے بڑھنے کے ساتھ ساتھ اس کی موثر طاقت میں تبدیلی آتی ہے۔ مزید اصولی، ممکنہ طور پر فی پرت یا شیڈول کے بارے میں آگاہی کشی ٹیوننگ کی توقع کریں کیونکہ خودکار ہائپر پیرامیٹر تلاش اور اسکیلنگ قانون کے مطالعہ بالغ ہوتے ہیں۔

حقیقی دنیا کا نفاذ

PyTorch کے AdamW یا SGD آپٹیمائزر میں وزن کا اضافہ کرنا جب تصویر کی درجہ بندی کرنے والوں کو اوور فٹنگ کو روکنے کے لیے تربیت دی جائے

متعلقہ خصوصیات پر پیشین گوئیوں کو مستحکم کرنے کے لیے، کلاسک L2-پینالائزڈ لکیری ماڈل، رج ریگریشن میں لیمبڈا کوفیسٹینٹ کو ٹیوننگ

بڑی زبان کے ماڈل کی پیشگی تربیت کی ترکیبیں جو سیکھنے کی شرح کے نظام الاوقات کے ساتھ وزن میں کمی (اکثر 0.1 کے لگ بھگ) طے کرتی ہیں۔

ایک چھوٹا میڈیکل امیجنگ ماڈل کو محدود تربیتی اسکینوں کو حفظ کرنے سے روکنے کے لیے ڈیٹا میں اضافے اور ڈراپ آؤٹ کے ساتھ وزن میں کمی کا امتزاج

خطرات اور گارڈریلز

مختلف ٹیمیں ایک ہی اصطلاح کو مختلف طریقے سے استعمال کر سکتی ہیں، اس لیے دائرہ کار کی جلد وضاحت کریں۔

بینچ مارکس مضبوط نظر آسکتے ہیں جبکہ حقیقی دنیا کی کارکردگی ناہموار ہے۔

ڈیٹا کے معیار اور تشخیص کے منصوبوں کو نظر انداز کرنا اکثر نازک نتائج پیدا کرتا ہے۔

نفاذ کا روڈ میپ

1

آپ کو مطلوبہ نتائج کی سادہ زبان کی تعریف کے ساتھ شروع کریں۔

2

جانچ کرنے سے پہلے ایک کامیابی میٹرک اور ایک ناکامی کی شرط منتخب کریں۔

3

نمائندہ ڈیٹا کے ساتھ ایک چھوٹا پائلٹ چلائیں، نہ کہ پالش شدہ ڈیمو سیٹ۔

4

دستاویز جہاں وزن میں کمی اور L2 ریگولرائزیشن میں مدد ملتی ہے اور جہاں آسان طریقے بہتر ہیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Weight Decay and L2 Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اکثر پوچھے گئے سوالات

What is Weight Decay and L2 Regularization?

وزن میں کمی ایک سادہ، طاقتور تکنیک ہے جو ٹریننگ کے دوران ماڈل کے وزن کو صفر کی طرف دھکیل دیتی ہے، اور اسے کسی ایک خصوصیت پر بہت زیادہ انحصار کرنے سے روکتی ہے۔ یہ اوور فٹنگ کو کم کرتا ہے اور گہری تعلیم میں سب سے زیادہ استعمال ہونے والے ریگولرائزرز میں سے ایک ہے۔

L2 ریگولرائزیشن نقصان کے فنکشن میں کیا اضافہ کرتی ہے؟

L2 ریگولرائزیشن مربع وزن کے مجموعے میں لیمبڈا گنا اضافہ کرتی ہے، بڑے وزن کو جرمانہ اور چھوٹے، ہموار حل کی حوصلہ افزائی کرتی ہے۔

وزن میں کمی کو روکنے میں مدد کرنے والا بنیادی مسئلہ کیا ہے؟

وزن کو چھوٹا رکھنے سے، وزن میں کمی ماڈل کو شور مچانے سے حوصلہ شکنی کرتی ہے، نئے ڈیٹا کو عام کرنے میں بہتری لاتی ہے۔

وزن میں کمی ماڈل کے وزن کو کس سمت میں دھکیلتی ہے؟

وزن میں کمی ہر اپ ڈیٹ پر وزن کو گھٹا کر صفر کی طرف لے جاتی ہے، یہی وجہ ہے کہ اسے بعض اوقات وزن کے 'سڑنے' کے طور پر بیان کیا جاتا ہے۔

ایڈم ڈبلیو کو کیوں متعارف کرایا گیا؟

ایڈم میں، L2 کو نقصان میں ڈالنا فی پیرامیٹر اسکیلنگ کے ساتھ بری طرح سے تعامل کرتا ہے۔ ایڈم ڈبلیو مطلوبہ یکساں سکڑنے کو بحال کرنے کے لیے الگ سے کشی کا اطلاق کرتا ہے۔

سادہ اسٹاکسٹک گریڈینٹ ڈیسنٹ کے لیے، L2 ریگولرائزیشن اور وزن میں کمی کا تعلق کیسے ہے؟

سادہ SGD کے ساتھ، نقصان میں L2 جرمانہ شامل کرنے سے وہی تازہ کاری ہوتی ہے جو براہ راست سکڑتے ہوئے وزن کے ہوتے ہیں، اس لیے دونوں برابر ہیں۔