बुनियादी गाइड

ड्रॉपआउट और स्टोकेस्टिक नियमितीकरण

ड्रॉपआउट एक नियमितीकरण चाल है जो प्रत्येक प्रशिक्षण चरण के दौरान न्यूरॉन्स के एक अंश को यादृच्छिक रूप से बंद कर देती है, जिससे नेटवर्क को अनावश्यक, मजबूत प्रतिनिधित्व बनाने के लिए मजबूर किया जाता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It became one of the most influential techniques for fighting overfitting in deep learning.

गहरा गोता

2012 के आसपास हिंटन के समूह द्वारा प्रस्तुत, ड्रॉपआउट बड़े नेटवर्क की एक प्रमुख कमजोरी को संबोधित करता है: न्यूरॉन्स सह-अनुकूलन कर सकते हैं, एक-दूसरे की गलतियों को उन तरीकों से ठीक करना सीख सकते हैं जो केवल प्रशिक्षण डेटा पर काम करते हैं। प्रशिक्षण के दौरान प्रत्येक फॉरवर्ड पास पर, ड्रॉपआउट यादृच्छिक रूप से प्रत्येक न्यूरॉन के आउटपुट को कुछ संभावना पी (अक्सर घनी परतों में 0.5) के साथ शून्य पर सेट करता है। क्योंकि कोई भी न्यूरॉन गायब हो सकता है, नेटवर्क नाजुक साझेदारी पर निर्भर नहीं रह सकता है और उसे कई इकाइयों में उपयोगी जानकारी फैलानी होगी। यह वज़न साझा करने वाले पतले नेटवर्कों के एक विशाल समूह को प्रशिक्षित करने जैसा कार्य करता है। परीक्षण के समय ड्रॉपआउट बंद कर दिया जाता है और पूर्ण नेटवर्क का उपयोग किया जाता है, सक्रियणों को स्केल किया जाता है ताकि अपेक्षित आउटपुट प्रशिक्षण से मेल खाए। परिणाम आम तौर पर थोड़े लंबे प्रशिक्षण की कीमत पर बेहतर सामान्यीकरण होता है।

तकनीकी अंतर्दृष्टि

प्रशिक्षण के दौरान प्रत्येक इकाई को यादृच्छिक बाइनरी मास्क के माध्यम से संभाव्यता (1 माइनस पी) के साथ रखा जाता है, इसलिए प्रत्येक बैच में अलग-अलग उप-नेटवर्क का नमूना लिया जाता है। आधुनिक ढाँचे उल्टे ड्रॉपआउट का उपयोग करते हैं: जीवित सक्रियणों को ट्रेन के समय (1 माइनस पी) से विभाजित किया जाता है, इसलिए अनुमान के समय किसी स्केलिंग की आवश्यकता नहीं होती है। यह यादृच्छिकता शोर उत्पन्न करती है जो सह-अनुकूलन को हतोत्साहित करती है और साझा-वजन उप-नेटवर्क की एक घातीय संख्या के औसत का अनुमान लगाती है, जो संयोजन का एक सस्ता रूप है।

सामरिक प्रभाव

स्पष्ट निर्णय

यह आपको स्पष्ट तकनीकी दावों को मार्केटिंग भाषा से अलग करने में मदद करता है।

लागत और बजट

आप पैसा या समय खर्च करने से पहले बेहतर कार्यान्वयन संबंधी प्रश्न पूछ सकते हैं।

टीम और वर्कफ़्लो

साझा समझ वाली टीमें बेहतर उत्पाद, नीति और सीखने के निर्णय लेती हैं।

ड्रॉपआउट और स्टोकेस्टिक नियमितीकरण का भविष्य

कन्वेन्शनल विज़न नेटवर्क में, बैच सामान्यीकरण ने बड़े पैमाने पर मानक ड्रॉपआउट को विस्थापित कर दिया है, लेकिन वेरिएंट कहीं और पनपते हैं: ट्रांसफार्मर ड्रॉपआउट को ध्यान और फ़ीड-फ़ॉरवर्ड परतों पर लागू करते हैं, और ड्रॉपपाथ (स्टोकेस्टिक गहराई) पूरे अवशिष्ट ब्लॉक को गिरा देता है। मोंटे कार्लो ड्रॉपआउट, जो अनुमान के समय ड्रॉपआउट को सक्रिय रखता है, का उपयोग मॉडल अनिश्चितता का अनुमान लगाने के लिए किया जाता है। उम्मीद करें कि स्टोकेस्टिक नियमितीकरण एक लचीला टूलकिट बना रहेगा, जो एक निश्चित रेसिपी के बजाय प्रति आर्किटेक्चर के अनुसार अनुकूलित होगा।

वास्तविक विश्व कार्यान्वयन

PyTorch या Keras में किसी छवि या टेक्स्ट क्लासिफायरियर की सघन परतों के बीच लगभग 0.5 p के साथ एक ड्रॉपआउट परत जोड़ना

ट्रांसफार्मर मॉडल प्रीट्रेनिंग के दौरान ध्यान भार और फीड-फॉरवर्ड सक्रियण पर ड्रॉपआउट लागू करते हैं

मोंटे कार्लो ड्रॉपआउट, जहां चिकित्सा या सुरक्षा-महत्वपूर्ण भविष्यवाणियों के लिए अनिश्चितता अनुमान उत्पन्न करने के लिए ड्रॉपआउट अनुमान पर रहता है

स्टोकेस्टिक डेप्थ (ड्रॉपपाथ) रेसनेट्स और विज़न ट्रांसफार्मर जैसे बहुत गहरे नेटवर्क को नियमित करने के लिए अवशिष्ट ब्लॉकों को बेतरतीब ढंग से छोड़ देता है

जोखिम और रेलिंग

अलग-अलग टीमें एक ही शब्द का अलग-अलग इस्तेमाल कर सकती हैं, इसलिए दायरे को पहले ही परिभाषित कर लें।

बेंचमार्क मजबूत दिख सकते हैं जबकि वास्तविक दुनिया का प्रदर्शन असमान है।

डेटा गुणवत्ता और मूल्यांकन योजनाओं की अनदेखी अक्सर नाजुक परिणाम पैदा करती है।

कार्यान्वयन रोडमैप

1

आपको जिस परिणाम की आवश्यकता है उसकी सरल भाषा में परिभाषा से शुरुआत करें।

2

परीक्षण से पहले एक सफलता मीट्रिक और एक विफलता स्थिति चुनें।

3

प्रतिनिधि डेटा के साथ एक छोटा पायलट चलाएँ, न कि एक परिष्कृत डेमो सेट।

4

दस्तावेज़ जहां ड्रॉपआउट और स्टोकेस्टिक नियमितीकरण मदद करता है और जहां सरल तरीके बेहतर हैं।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Dropout and Stochastic Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

मोमेंटम के साथ स्टोकेस्टिक ग्रेडिएंट डिसेंट

अक्सर पूछे जाने वाले प्रश्नों

What is Dropout and Stochastic Regularization?

ड्रॉपआउट एक नियमितीकरण चाल है जो प्रत्येक प्रशिक्षण चरण के दौरान न्यूरॉन्स के एक अंश को यादृच्छिक रूप से बंद कर देती है, जिससे नेटवर्क को अनावश्यक, मजबूत प्रतिनिधित्व बनाने के लिए मजबूर किया जाता है। गहन शिक्षण में ओवरफिटिंग से लड़ने के लिए यह सबसे प्रभावशाली तकनीकों में से एक बन गई है।

प्रशिक्षण के दौरान ड्रॉपआउट क्या करता है?

प्रशिक्षण के दौरान ड्रॉपआउट बेतरतीब ढंग से प्रत्येक न्यूरॉन को प्रायिकता पी के साथ शून्य कर देता है, इसलिए प्रत्येक चरण में एक अलग पतले उप-नेटवर्क का उपयोग किया जाता है।

ड्रॉपआउट से सामान्यीकरण में सुधार क्यों होता है?

इकाइयों को बेतरतीब ढंग से हटाने से, ड्रॉपआउट न्यूरॉन्स को नाजुक साझेदारी बनाने से रोकता है जो केवल प्रशिक्षण डेटा पर काम करते हैं, मजबूती में सुधार करते हैं।

परीक्षण (अनुमान) समय पर ड्रॉपआउट का क्या होता है?

अनुमान के अनुसार पूरा नेटवर्क ड्रॉपआउट अक्षम के साथ चलता है, और सक्रियणों को स्केल किया जाता है ताकि अपेक्षित आउटपुट प्रशिक्षण वितरण से मेल खा सकें।

एक परत में पी = 0.5 की ड्रॉपआउट दर का प्रशिक्षण के दौरान मोटे तौर पर क्या मतलब है?

पी = 0.5 के साथ प्रत्येक न्यूरॉन के शून्य होने की 50 प्रतिशत संभावना होती है, इसलिए औसतन प्रति फॉरवर्ड पास में लगभग आधे गिरा दिए जाते हैं।

ड्रॉपआउट को अक्सर अनुमानित रूप में क्या वर्णित किया जाता है?

प्रत्येक चरण में एक अलग उप-नेटवर्क का नमूना लेने से साझा-वजन वाले नेटवर्क की एक घातीय संख्या के औसत का अनुमान लगाया जाता है, जो सस्ते संयोजन का एक रूप है।