सीखने की दर का निर्धारण
सीखने की दर का शेड्यूल प्रशिक्षण के दौरान चरण के आकार को स्थिर रखने के बजाय बदल देता है।
सिंहावलोकन
Getting it right is often the single biggest lever for whether a model converges quickly and reaches high accuracy.
गहरा गोता
सीखने की दर नियंत्रित करती है कि ऑप्टिमाइज़र प्रत्येक अपडेट में कितना बड़ा कदम उठाता है। बहुत अधिक और प्रशिक्षण अलग हो जाता है; बहुत नीचे और यह रेंगता है या अटक जाता है। शेड्यूलिंग समय के साथ इस मान को समायोजित करती है। एक आम आधुनिक नुस्खा है वार्मअप जिसके बाद क्षय होता है: शून्य के करीब से शुरू करें और पहले कुछ सौ या हजार चरणों में चढ़ें (इतनी जल्दी, शोर वाले ग्रेडिएंट अस्थिर वजन को न उड़ाएं), फिर धीरे-धीरे कम करें। लोकप्रिय क्षय आकृतियों में चरण क्षय (निर्धारित युगों में एक कारक द्वारा गिरावट), घातांकीय क्षय, और कोसाइन एनीलिंग शामिल हैं, जो सुचारू रूप से शून्य के करीब आधे-कोसाइन वक्र का अनुसरण करता है। रैखिक वार्मअप के साथ कोसाइन शेड्यूल अब बड़े भाषा मॉडल के प्रशिक्षण के लिए मानक हैं, जबकि चक्रीय और एक-चक्र नीतियां छोटे-मॉडल प्रशिक्षण को गति दे सकती हैं।
तकनीकी अंतर्दृष्टि
वार्मअप मायने रखता है क्योंकि एडम जैसे अनुकूली अनुकूलक के पास पहले चरण में दूसरे क्षण के अविश्वसनीय अनुमान होते हैं; एक छोटी सी सीखने की दर उन आँकड़ों के व्यवस्थित होने से पहले वजन को अस्थिर करने से बचाती है। कोसाइन एनीलिंग सेट lr = lr_min + 0.5 * (lr_max - lr_min) * (1 + cos(pi * t / T)), शुरुआत में तेजी से प्रगति और अंत के पास छोटे, फाइन-ट्यूनिंग चरण देता है। कुछ शेड्यूल में वार्म रीस्टार्ट जोड़ा जाता है, जिससे तीव्र न्यूनतम सीमा से बचने के लिए दर में फिर से बढ़ोतरी होती है।
सामरिक प्रभाव
लागत और बजट
वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।
स्पष्ट निर्णय
तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।
गुणवत्ता नियंत्रण
बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।
सीखने की दर निर्धारण का भविष्य
जैसे-जैसे प्रशिक्षण चलाना अधिक महंगा होता जा रहा है, शेड्यूल को ऑप्टिमाइज़र और बैच आकार के साथ सह-डिज़ाइन किया जा रहा है, और शोधकर्ता प्रशिक्षण से पहले सर्वोत्तम शिखर दर की भविष्यवाणी करने के लिए स्केलिंग कानूनों का अध्ययन करते हैं। शेड्यूल-मुक्त ऑप्टिमाइज़र जो क्षय वक्र को पहले से चुनने की आवश्यकता को दूर करते हैं, कर्षण प्राप्त कर रहे हैं, और अनुकूली, फीडबैक-संचालित शेड्यूल जो लाइव लॉस कर्व्स पर प्रतिक्रिया करते हैं, परीक्षण-और-त्रुटि को कम कर सकते हैं जो अभी भी बड़े पैमाने पर प्रशिक्षण पर हावी है।
वास्तविक विश्व कार्यान्वयन
ट्रांसफार्मर भाषा मॉडल को प्रीट्रेनिंग करते समय रैखिक वार्मअप प्लस कोसाइन क्षय का उपयोग किया जाता है।
चरण क्षय जो इमेजनेट पर छवि वर्गीकरणकर्ताओं को प्रशिक्षित करते समय 30, 60 और 90 के युग में सीखने की दर 10 गुना कम कर देता है।
किसी मॉडल को बहुत कम समय में अच्छी सटीकता के लिए प्रशिक्षित करने के लिए fast.ai में एक-चक्र नीति।
समय-समय पर तीव्र हानि न्यूनतम से बचने और सामान्यीकरण में सुधार करने के लिए गर्म पुनरारंभ के साथ कोसाइन एनीलिंग।
जोखिम और रेलिंग
एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।
बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।
जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।
कार्यान्वयन रोडमैप
कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।
यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।
त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।
स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Learning Rate Scheduling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
चक्रीय सीखने की दरें
अक्सर पूछे जाने वाले प्रश्नों
What is Learning Rate Scheduling?
सीखने की दर का शेड्यूल प्रशिक्षण के दौरान चरण के आकार को स्थिर रखने के बजाय बदल देता है। इसे सही करना अक्सर यह जानने के लिए सबसे बड़ा लीवर होता है कि कोई मॉडल जल्दी से अभिसरण करता है और उच्च सटीकता तक पहुंचता है या नहीं।
सीखने की दर अनुसूची में 'वार्मअप' चरण का उद्देश्य क्या है?
वार्मअप शून्य के करीब शुरू होता है और दर बढ़ाता है ताकि अस्थिर शुरुआती अपडेट ऑप्टिमाइज़र आंकड़ों के व्यवस्थित होने से पहले मॉडल को अस्थिर न करें।
कौन सी अनुसूची न्यूनतम दर की ओर अर्ध-कोसाइन वक्र का सुचारू रूप से अनुसरण करती है?
कोसाइन एनीलिंग आधे-कोसाइन आकार के साथ सीखने की दर को कम कर देता है, जिससे शुरुआत में बड़े कदम और अंत के करीब छोटे कदम मिलते हैं।
यदि सीखने की दर बहुत अधिक निर्धारित कर दी जाए तो क्या होगा?
अत्यधिक उच्च दर ओवरशूटिंग का कारण बनती है, इसलिए नुकसान व्यवस्थित होने के बजाय बढ़ सकता है या बढ़ सकता है।
चरण क्षय सीखने की दर पर क्या प्रभाव डालता है?
चरण क्षय चयनित मील के पत्थर पर दर को एक कारक (उदाहरण के लिए, 0.1) से गुणा करता है, जिससे एक सीढ़ी पैटर्न बनता है।
कभी-कभी 'वार्म रीस्टार्ट' को शेड्यूल में क्यों जोड़ा जाता है?
वार्म रीस्टार्ट सीखने की दर को अंतराल पर वापस उछाल देता है, जिससे ऑप्टिमाइज़र को संकीर्ण मिनीमा से बाहर निकलने और बेहतर समाधान तलाशने में मदद मिलती है।