تدریجی نزول
گریڈیئنٹ ڈیسنٹ اصلاح کا وہ طریقہ ہے جو دراصل ایک ماڈل کے وزن کو نیچے کی طرف لے جاتا ہے، ایک وقت میں ایک چھوٹا قدم۔
جائزہ
It is how learning happens once backpropagation has computed the gradients.
گہرا غوطہ
تصور کریں کہ ایک دھند زدہ پہاڑی پر کھڑے ہو کر وادی کے فرش تک پہنچنے کی کوشش کرتے ہوئے صرف اپنے پیروں کے نیچے کی ڈھلوان محسوس کر رہے ہیں۔ گریڈینٹ ڈیسنٹ بالکل ایسا ہی کسی ماڈل کے ایرر لینڈ اسکیپ کے لیے کرتا ہے۔ میلان نقصان میں تیز ترین اضافے کی سمت اشارہ کرتا ہے، اس لیے الگورتھم غلطی کو کم کرنے کے لیے مخالف سمت میں قدم رکھتا ہے۔ ہر قدم کے سائز کو سیکھنے کی شرح، ایک اہم ہائپر پیرامیٹر کے ذریعے کنٹرول کیا جاتا ہے: بہت بڑا اور ماڈل بہت چھوٹا اور ٹریننگ کرال ہوتا ہے۔ عملی طور پر، ماڈل شاذ و نادر ہی ہر قدم کے لیے مکمل ڈیٹا سیٹ استعمال کرتے ہیں۔ سٹوکاسٹک گراڈینٹ ڈیسنٹ (SGD) اور منی بیچ ویریئنٹس چھوٹے بے ترتیب نمونوں سے گریڈینٹ کا تخمینہ لگاتے ہیں، جس سے ٹریننگ تیز ہوتی ہے اور ماڈل کو نقصان کی سطح میں اتھلے جال سے بچنے میں مدد ملتی ہے۔
تکنیکی بصیرت
ہر اپ ڈیٹ ایک سادہ اصول کی پیروی کرتا ہے: نیا وزن پرانے وزن کے مائنس سیکھنے کی شرح کے میلان کے برابر ہے۔ منی بیچ گریڈینٹ ڈیسنٹ اس گریڈینٹ کو پورے سیٹ کے بجائے ڈیٹا کے ایک چھوٹے ذیلی سیٹ پر شمار کرتا ہے، رفتار اور مفید شور کے لیے درست درستگی کی تجارت کرتا ہے۔ ایڈم جیسے جدید اصلاح کار سیکھنے کی موثر شرح کو فی پیرامیٹر کے مطابق ڈھال کر اور رفتار کو شامل کرکے اس پر استوار کرتے ہیں، جو ماضی کے میلان کو جمع کرتا ہے تاکہ دوغلوں کو ہموار کیا جا سکے اور نقصان کے زمین کی تزئین کے فلیٹ یا کھائی کی شکل والے علاقوں میں پیش رفت کو تیز کیا جا سکے۔
اسٹریٹجک اثر
واضح فیصلے
یہ آپ کو مارکیٹنگ کی زبان سے واضح تکنیکی دعووں کو الگ کرنے میں مدد کرتا ہے۔
لاگت اور بجٹ
آپ پیسہ یا وقت خرچ کرنے سے پہلے بہتر نفاذ کے سوالات پوچھ سکتے ہیں۔
Team and workflow
مشترکہ تفہیم کے ساتھ ٹیمیں بہتر پروڈکٹ، پالیسی اور سیکھنے کے فیصلے کرتی ہیں۔
تدریجی نزول کا مستقبل
سادہ میلان نزول آج شاذ و نادر ہی اکیلے استعمال ہوتا ہے۔ ایڈم اور ایڈم ڈبلیو جیسے انکولی اصلاح کار بڑے پیمانے پر تربیت پر حاوی ہیں۔ سیکھنے کی شرح کے نظام الاوقات، وارم اپ کی حکمت عملیوں، اور دوسرے ترتیب کے طریقوں پر تحقیق جاری ہے جو تیزی سے ہم آہنگی کے لیے گھماؤ والی معلومات کا استعمال کرتے ہیں۔ جیسے جیسے ماڈلز بڑھتے ہیں، ہزاروں GPUs میں تقسیم شدہ اور شارڈ گریڈینٹ ڈیسنٹ ضروری ہو جاتا ہے، اور ان بڑے اپ ڈیٹس کو مستحکم کرنے کی تکنیک ایک فعال محاذ ہے۔ بنیادی خیال، منفی میلان پر عمل کریں، برقرار رہے گا، لیکن قدموں کے سائز کے ارد گرد کی مشینری تیار ہوتی رہتی ہے۔
حقیقی دنیا کا نفاذ
منی بیچ اپ ڈیٹس کا استعمال کرتے ہوئے اربوں ٹریننگ ٹوکنز میں زبان کے ماڈل کی پیشن گوئی کی غلطی کو کم کرنا
سیکھنے کی شرح کو ٹیوننگ کریں تاکہ ایک تصویری ماڈل نقصان کے پھٹنے کے بغیر تیزی سے بدل جائے۔
ایک لمبی، تنگ وادی میں پھنسے ہوئے اسپیچ ریکگنیشن نیٹ ورک کی تربیت کو تیز کرنے کے لیے رفتار کا استعمال
ایک چھوٹے ڈیٹاسیٹ پر ایک ماڈل کو ٹھیک کرنے کے لیے ایڈم کو لاگو کرنا جہاں فی پیرامیٹر سیکھنے کی شرحیں استحکام میں مدد کرتی ہیں
خطرات اور گارڈریلز
مختلف ٹیمیں ایک ہی اصطلاح کو مختلف طریقے سے استعمال کر سکتی ہیں، اس لیے دائرہ کار کی جلد وضاحت کریں۔
بینچ مارکس مضبوط نظر آسکتے ہیں جبکہ حقیقی دنیا کی کارکردگی ناہموار ہے۔
ڈیٹا کے معیار اور تشخیص کے منصوبوں کو نظر انداز کرنا اکثر نازک نتائج پیدا کرتا ہے۔
نفاذ کا روڈ میپ
آپ کو مطلوبہ نتائج کی سادہ زبان کی تعریف کے ساتھ شروع کریں۔
جانچ کرنے سے پہلے ایک کامیابی میٹرک اور ایک ناکامی کی شرط منتخب کریں۔
نمائندہ ڈیٹا کے ساتھ ایک چھوٹا پائلٹ چلائیں، نہ کہ پالش شدہ ڈیمو سیٹ۔
دستاویز جہاں گراڈینٹ ڈیسنٹ مدد کرتا ہے اور جہاں آسان طریقے بہتر ہیں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Gradient Descent quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
مومنٹم کے ساتھ Stochastic Gradient Descent
اکثر پوچھے گئے سوالات
What is Gradient Descent?
گریڈیئنٹ ڈیسنٹ اصلاح کا وہ طریقہ ہے جو دراصل ایک ماڈل کے وزن کو نیچے کی طرف لے جاتا ہے، ایک وقت میں ایک چھوٹا قدم۔ بیک پروپیگیشن نے میلان کی گنتی کرنے کے بعد سیکھنا اس طرح ہوتا ہے۔
تدریجی نزول وزن کو کس سمت منتقل کرتا ہے؟
میلان نقصان میں تیز ترین اضافے کی طرف اشارہ کرتا ہے، اس لیے نقصان کو کم کرنے کے لیے الگورتھم کے اقدامات مخالف (منفی) سمت میں کرتے ہیں۔
سیکھنے کی شرح کو کیا کنٹرول کرتا ہے؟
سیکھنے کی شرح اس بات کی پیمائش کرتی ہے کہ ہر اپ ڈیٹ پر وزن کس حد تک منتقل ہوتا ہے۔ بہت زیادہ اوور شوٹس، بہت چھوٹا ٹریننگ کو دردناک طور پر سست بنا دیتا ہے۔
اسٹاکسٹک یا منی بیچ گریڈینٹ ڈیسنٹ مکمل ڈیٹا سیٹ کے استعمال سے کیسے مختلف ہے؟
منی بیچ اور سٹاکاسٹک گریڈینٹ ڈیسنٹ چھوٹے نمونوں کا استعمال کرتے ہوئے گریڈینٹ کا تخمینہ لگاتے ہیں، جو تربیت کو تیز کرتا ہے اور مددگار شور بڑھاتا ہے۔
سیکھنے کی شرح جس کی وجہ بہت زیادہ ہے کیا مسئلہ ہو سکتا ہے؟
بڑے قدم کم سے کم سے آگے کود سکتے ہیں اور ادھر ادھر اچھال سکتے ہیں یا اڑا سکتے ہیں، جس سے نقصان طے ہونے کی بجائے بڑھتا ہے۔
رفتار تدریجی نزول میں کیا اضافہ کرتی ہے؟
مومینٹم ماضی کے میلان کا ایک چل رہا اوسط رکھتا ہے، جو آپٹمائزر کو گھاٹیوں کے ذریعے تیزی سے آگے بڑھنے میں مدد کرتا ہے اور دوغلوں کو گیلا کرتا ہے۔