बुनियादी गाइड

वजन में कमी और एल2 नियमितीकरण

वज़न घटाना एक सरल, शक्तिशाली तकनीक है जो प्रशिक्षण के दौरान एक मॉडल के वज़न को शून्य की ओर ले जाती है, और उसे किसी एक सुविधा पर बहुत अधिक निर्भर होने से हतोत्साहित करती है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It reduces overfitting and is one of the most widely used regularizers in deep learning.

गहरा गोता

जब कोई मॉडल प्रशिक्षण लेता है, तो यह बड़े, बारीक-बारीक वजन बढ़ाकर डेटा में शोर को पकड़ सकता है जो प्रशिक्षण सेट में पूरी तरह फिट बैठता है लेकिन सामान्यीकरण खराब होता है। L2 नियमितीकरण हानि फ़ंक्शन के वर्ग भार के योग के अनुपात में जुर्माना जोड़कर इससे लड़ता है। ऑप्टिमाइज़र के अब दो लक्ष्य हैं: डेटा को फिट करना और वज़न को छोटा रखना, इसलिए यह आसान, अधिक मजबूत समाधानों पर आधारित है। वज़न में कमी प्रत्येक अद्यतन चरण पर प्रत्येक वज़न को एक छोटे अंश से कम करने का निकट से संबंधित विचार है। सादे ग्रेडिएंट डिसेंट के साथ दोनों गणितीय रूप से समतुल्य हैं, लेकिन एडम जैसे अनुकूली अनुकूलक के साथ वे भिन्न हैं, यही कारण है कि एडमडब्ल्यू को ग्रेडिएंट-आधारित अपडेट से क्षय को अलग करने और इसे सही ढंग से व्यवहार करने के लिए पेश किया गया था।

तकनीकी अंतर्दृष्टि

L2 नियमितीकरण नुकसान में वर्ग भार के योग को लैम्ब्डा गुना जोड़ता है, इसलिए इसका ग्रेडिएंट प्रत्येक वजन के लिए आनुपातिक शब्द जोड़ता है, जो इसे शून्य की ओर खींचता है। इसके बजाय वियुग्मित वजन क्षय प्रत्येक वजन को सीधे (1 माइनस लर्निंग_रेट टाइम्स लैम्ब्डा) जैसे कारक से गुणा करता है। अनुकूली तरीकों में, L2 को हानि में युग्मित करने से प्रति-पैरामीटर स्केलिंग दंड को विकृत कर देती है, इसलिए एडमडब्ल्यू अलग से सिकुड़न लागू करता है, जिससे छोटे वजन की ओर इच्छित समान खिंचाव बहाल होता है।

सामरिक प्रभाव

स्पष्ट निर्णय

यह आपको स्पष्ट तकनीकी दावों को मार्केटिंग भाषा से अलग करने में मदद करता है।

लागत और बजट

आप पैसा या समय खर्च करने से पहले बेहतर कार्यान्वयन संबंधी प्रश्न पूछ सकते हैं।

टीम और वर्कफ़्लो

साझा समझ वाली टीमें बेहतर उत्पाद, नीति और सीखने के निर्णय लेती हैं।

वज़न क्षय और एल2 नियमितीकरण का भविष्य

बड़े भाषा मॉडल और दृष्टि ट्रांसफार्मर के लिए प्रशिक्षण व्यंजनों में वजन में कमी एक डिफ़ॉल्ट घटक बनी हुई है, और एडमडब्लू अब उनके लिए मानक अनुकूलक है। अनुसंधान इस बात पर जारी है कि क्षय सीखने की दर के शेड्यूल, सामान्यीकरण परतों और मॉडल पैमाने के साथ कैसे संपर्क करता है, क्योंकि मॉडल बढ़ने के साथ इसकी प्रभावी ताकत बदल जाती है। स्वचालित हाइपरपैरामीटर खोज और स्केलिंग-लॉ अध्ययन परिपक्व होने पर अधिक सैद्धांतिक, संभवतः प्रति-परत या शेड्यूल-जागरूक क्षय ट्यूनिंग की अपेक्षा करें।

वास्तविक विश्व कार्यान्वयन

ओवरफिटिंग पर अंकुश लगाने के लिए इमेज क्लासिफायर को प्रशिक्षित करते समय PyTorch के एडमडब्ल्यू या एसजीडी ऑप्टिमाइज़र में वज़न_डेके जोड़ना

सहसंबद्ध सुविधाओं पर भविष्यवाणियों को स्थिर करने के लिए, रिज रिग्रेशन में लैम्ब्डा गुणांक को ट्यून करना, क्लासिक एल 2-दंडित रैखिक मॉडल

बड़े भाषा मॉडल पूर्व-प्रशिक्षण व्यंजन जो सीखने की दर के कार्यक्रम के साथ-साथ एक छोटे वजन में कमी (अक्सर लगभग 0.1) निर्धारित करते हैं

सीमित प्रशिक्षण स्कैन को याद रखने से एक छोटे मेडिकल-इमेजिंग मॉडल को रखने के लिए डेटा वृद्धि और ड्रॉपआउट के साथ वजन घटाने का संयोजन

जोखिम और रेलिंग

अलग-अलग टीमें एक ही शब्द का अलग-अलग इस्तेमाल कर सकती हैं, इसलिए दायरे को पहले ही परिभाषित कर लें।

बेंचमार्क मजबूत दिख सकते हैं जबकि वास्तविक दुनिया का प्रदर्शन असमान है।

डेटा गुणवत्ता और मूल्यांकन योजनाओं की अनदेखी अक्सर नाजुक परिणाम पैदा करती है।

कार्यान्वयन रोडमैप

1

आपको जिस परिणाम की आवश्यकता है उसकी सरल भाषा में परिभाषा से शुरुआत करें।

2

परीक्षण से पहले एक सफलता मीट्रिक और एक विफलता स्थिति चुनें।

3

प्रतिनिधि डेटा के साथ एक छोटा पायलट चलाएँ, न कि एक परिष्कृत डेमो सेट।

4

दस्तावेज़ जहां वजन क्षय और एल2 नियमितीकरण से मदद मिलती है और जहां सरल तरीके बेहतर हैं।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Weight Decay and L2 Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is Weight Decay and L2 Regularization?

वज़न घटाना एक सरल, शक्तिशाली तकनीक है जो प्रशिक्षण के दौरान एक मॉडल के वज़न को शून्य की ओर ले जाती है, और उसे किसी एक सुविधा पर बहुत अधिक निर्भर होने से हतोत्साहित करती है। यह ओवरफिटिंग को कम करता है और गहन शिक्षण में सबसे व्यापक रूप से उपयोग किए जाने वाले नियमितकर्ताओं में से एक है।

L2 नियमितीकरण हानि फ़ंक्शन में क्या जोड़ता है?

L2 नियमितीकरण वर्ग भारों के योग में लैम्ब्डा गुना जोड़ता है, बड़े भारों को दंडित करता है और छोटे, आसान समाधानों को प्रोत्साहित करता है।

वह मुख्य समस्या क्या है जिसे वज़न घटने से रोकने में मदद मिलती है?

वजन को छोटा रखने से, वजन में कमी मॉडल को शोर को फिट करने से हतोत्साहित करती है, जिससे नए डेटा के सामान्यीकरण में सुधार होता है।

वजन में कमी मॉडल के वजन को किस दिशा में धकेलती है?

वज़न घटने से प्रत्येक अद्यतन पर वज़न शून्य की ओर सिकुड़ जाता है, यही कारण है कि इसे कभी-कभी वज़न को 'क्षय' करने के रूप में वर्णित किया जाता है।

एडमडब्ल्यू को क्यों पेश किया गया?

एडम में, L2 को हानि में मोड़ना प्रति-पैरामीटर स्केलिंग के साथ बुरी तरह इंटरैक्ट करता है; एडमडब्ल्यू इच्छित समान संकोचन को बहाल करने के लिए क्षय को अलग से लागू करता है।

सादे स्टोकेस्टिक ग्रेडिएंट डिसेंट के लिए, L2 नियमितीकरण और वजन क्षय कैसे संबंधित हैं?

सादे एसजीडी के साथ, नुकसान में एल2 जुर्माना जोड़ने से सीधे घटते वजन के समान अद्यतन उत्पन्न होता है, इसलिए दोनों बराबर हैं।