बुनियादी गाइड

दोहरी वंश घटना

डबल डिसेंट आश्चर्यजनक अवलोकन है कि जैसे-जैसे एक मॉडल बड़ा होता जाता है, परीक्षण त्रुटि पहले 'इंटरपोलेशन थ्रेशोल्ड' के पास खराब हो जाती है, लेकिन फिर फिर से बेहतर हो जाती है - क्लासिक पाठ्यपुस्तक ट्रेडऑफ़ को धता बताते हुए।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It matters because it helps explain why enormous, overparameterized neural networks generalize well instead of overfitting.

गहरा गोता

शास्त्रीय आँकड़े एक यू-आकार का वक्र सिखाते हैं: जैसे-जैसे मॉडल की जटिलता बढ़ती है, परीक्षण त्रुटि कम होती जाती है, नीचे आती जाती है, फिर मॉडल के ओवरफिट होने पर ऊपर उठती है। डबल डिसेंट, जिसे 2019 में बेल्किन, सू, मा और मंडल द्वारा लोकप्रिय बनाया गया और OpenAI द्वारा पैमाने पर अध्ययन किया गया, दिखाता है कि वक्र में दूसरा डिसेंट है। परीक्षण त्रुटि सीधे इंटरपोलेशन थ्रेशोल्ड पर चरम पर होती है - वह बिंदु जहां मॉडल के पास प्रत्येक प्रशिक्षण बिंदु को बिल्कुल फिट करने के लिए पर्याप्त पैरामीटर होते हैं (शून्य प्रशिक्षण त्रुटि)। इसे अति-पैरामीटराइज़्ड शासन में धकेलें और परीक्षण त्रुटि फिर से गिर जाती है, अक्सर शास्त्रीय मीठे स्थान से नीचे। समान प्रभाव मॉडल आकार, प्रशिक्षण समय ('युग-वार' डबल डिसेंट), और डेटासेट आकार पर दिखाई देता है। यह पुराने डर को खारिज करता है कि 'अधिक मापदंडों का मतलब हमेशा ओवरफिटिंग होता है।'

तकनीकी अंतर्दृष्टि

इंटरपोलेशन थ्रेशोल्ड पर अनिवार्य रूप से एक समाधान होता है जो डेटा को बिल्कुल फिट बैठता है, और इसे दांतेदार और उच्च-मानदंड के लिए मजबूर किया जाता है, इसलिए यह खराब रूप से सामान्यीकृत होता है। ओवरपैरामीटराइज़्ड शासन में, असीम रूप से कई शून्य-त्रुटि समाधान मौजूद हैं, और ग्रेडिएंट डिसेंट का अंतर्निहित पूर्वाग्रह सबसे आसान, निम्नतम-मानदंड की ओर बढ़ता है। कम-जटिलता वाले इंटरपोलेटर्स के लिए वह प्राथमिकता - पैरामीटर गिनती ही नहीं - वह है जो दूसरे वंश को कम परीक्षण त्रुटि की ओर ले जाती है।

सामरिक प्रभाव

स्पष्ट निर्णय

यह आपको स्पष्ट तकनीकी दावों को मार्केटिंग भाषा से अलग करने में मदद करता है।

लागत और बजट

आप पैसा या समय खर्च करने से पहले बेहतर कार्यान्वयन संबंधी प्रश्न पूछ सकते हैं।

टीम और वर्कफ़्लो

साझा समझ वाली टीमें बेहतर उत्पाद, नीति और सीखने के निर्णय लेती हैं।

डबल डिसेंट फेनोमेनन का भविष्य

स्केलिंग कानूनों को परिष्कृत करने और प्रशिक्षण कब बंद करना है यह चुनने के लिए शोधकर्ता डबल डिसेंट का उपयोग कर रहे हैं, क्योंकि 'लंबे समय तक प्रशिक्षण, बदतर हो जाना, फिर बेहतर' का वास्तविक लागत प्रभाव पड़ता है। इसे अंतर्निहित नियमितीकरण, तंत्रिका स्पर्शरेखा कर्नेल और ग्रोकिंग से जोड़ने वाले सख्त सिद्धांत की अपेक्षा करें। व्यावहारिक रूप से, सबक - बड़ा और लंबा खतरे के क्षेत्र को पार करने में मदद कर सकता है - पहले से ही सावधानीपूर्वक आकार वाले मॉडलों के बजाय बड़े-बड़े नींव मॉडल को प्रशिक्षित करने के निर्णयों को रेखांकित करता है।

वास्तविक विश्व कार्यान्वयन

यह समझाते हुए कि 175 बिलियन-पैरामीटर भाषा मॉडल अत्यधिक क्षमता के बावजूद सावधानीपूर्वक ट्यून किए गए मध्यम आकार के मॉडल से बेहतर सामान्यीकरण क्यों करता है

उस बिंदु से आगे प्रशिक्षण का चयन करना जहां सत्यापन हानि अस्थायी रूप से खराब हो जाती है, क्योंकि युग-वार दोहरा वंश बाद में पुनर्प्राप्ति की भविष्यवाणी करता है

एक विज़न मॉडल का निदान करना जिसकी सटीकता बिल्कुल तब कम हो गई जब पैरामीटर गणना प्रशिक्षण-सेट आकार से मेल खाती है, फिर इसे ओवरपैरामीटराइजेशन में गहराई से मार्गदर्शन करना

ऑटोएमएल में मॉडल-आकार के निर्णयों को सूचित करना ताकि व्यवसायी नाजुक इंटरपोलेशन-थ्रेशोल्ड क्षेत्र से बच सकें

जोखिम और रेलिंग

अलग-अलग टीमें एक ही शब्द का अलग-अलग इस्तेमाल कर सकती हैं, इसलिए दायरे को पहले ही परिभाषित कर लें।

बेंचमार्क मजबूत दिख सकते हैं जबकि वास्तविक दुनिया का प्रदर्शन असमान है।

डेटा गुणवत्ता और मूल्यांकन योजनाओं की अनदेखी अक्सर नाजुक परिणाम पैदा करती है।

कार्यान्वयन रोडमैप

1

आपको जिस परिणाम की आवश्यकता है उसकी सरल भाषा में परिभाषा से शुरुआत करें।

2

परीक्षण से पहले एक सफलता मीट्रिक और एक विफलता स्थिति चुनें।

3

प्रतिनिधि डेटा के साथ एक छोटा पायलट चलाएँ, न कि एक परिष्कृत डेमो सेट।

4

दस्तावेज़ जहां डबल डिसेंट फेनोमेनन मदद करता है और जहां सरल तरीके बेहतर हैं।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Double Descent Phenomenon quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is Double Descent Phenomenon?

डबल डिसेंट आश्चर्यजनक अवलोकन है कि जैसे-जैसे एक मॉडल बड़ा होता जाता है, परीक्षण त्रुटि पहले 'इंटरपोलेशन थ्रेशोल्ड' के पास खराब हो जाती है, लेकिन फिर फिर से बेहतर हो जाती है - क्लासिक पाठ्यपुस्तक ट्रेडऑफ़ को धता बताते हुए। यह मायने रखता है क्योंकि यह यह समझाने में मदद करता है कि क्यों विशाल, अति-मानकीकृत तंत्रिका नेटवर्क ओवरफिटिंग के बजाय अच्छी तरह से सामान्यीकृत होते हैं।

डबल डिसेंट वक्र में परीक्षण त्रुटि आम तौर पर कहाँ चरम पर होती है?

त्रुटि स्पाइक इंटरपोलेशन थ्रेशोल्ड पर होता है, जहां मॉडल में अनिवार्य रूप से एक कठोर समाधान के साथ प्रशिक्षण त्रुटि को शून्य तक ले जाने की पर्याप्त क्षमता होती है।

जब एक मॉडल अत्यधिक पैरामीटरयुक्त हो जाता है तो परीक्षण त्रुटि का क्या होता है?

ओवरपैरामीटराइज़्ड शासन परीक्षण में त्रुटि दूसरी बार आती है, जो परिभाषित करने वाली विशेषता है जो डबल डिसेंट को इसका नाम देती है।

ग्रेडिएंट डिसेंट ओवरपैरामीटराइज़्ड शासन में मदद क्यों करता है?

कई शून्य-त्रुटि समाधान उपलब्ध होने के साथ, ग्रेडिएंट डिसेंट का अंतर्निहित पूर्वाग्रह सबसे सहज, निम्नतम-मानदंड की ओर बढ़ता है, जो बेहतर सामान्यीकरण करता है।

'युग-वार' दोहरा वंश किस प्रभाव के रूप में प्रकट होने को संदर्भित करता है?

प्रशिक्षण-समय अक्ष के साथ दोहरा अवतरण हो सकता है: परीक्षण त्रुटि बदतर हो सकती है और फिर सुधार हो सकती है क्योंकि प्रशिक्षण अधिक समय तक जारी रहता है।

डबल डिसेंट किस शास्त्रीय विचार को चुनौती देता है?

यह पाठ्यपुस्तक के यू-आकार के वक्र का खंडन करता है जो कहता है कि एक बिंदु से अधिक जटिलता हमेशा ओवरफिटिंग के माध्यम से परीक्षण त्रुटि को बढ़ाती है।