बुनियादी गाइड

ग्रोकिंग और विलंबित सामान्यीकरण

ग्रोकिंग एक चौंकाने वाली घटना है जहां एक तंत्रिका नेटवर्क पहले अपने प्रशिक्षण डेटा को याद रखता है, लंबे समय तक लगभग-शून्य सत्यापन सटीकता पर बैठता है, और फिर प्रशिक्षण सटीकता 100% तक पहुंचने के बाद अचानक सामान्यीकृत हो जाता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It overturns the intuition that learning and generalization happen together.

गहरा गोता

मॉड्यूलर अंकगणित जैसे छोटे एल्गोरिथम कार्यों पर 2021 में OpenAI शोधकर्ताओं द्वारा खोजे गए, ग्रोकिंग एक तेज दो-चरण वक्र दिखाता है। प्रारंभ में, मॉडल प्रशिक्षण सेट पर पूरी तरह से फिट बैठता है, जबकि सत्यापन प्रदर्शन जोखिम में रहता है, निराशाजनक रूप से ओवरफिट दिखता है। फिर, बिना किसी स्पष्ट प्रगति के हजारों या लाखों अतिरिक्त कदमों के बाद, सत्यापन सटीकता अचानक लगभग पूर्ण हो जाती है। प्रमुख स्पष्टीकरण यह है कि वजन में कमी (नियमितीकरण) धीरे-धीरे नेटवर्क पर एक भंगुर याद किए गए समाधान को त्यागने और एक कॉम्पैक्ट, संरचित समाधान की खोज करने का दबाव डालती है जो वास्तव में अंतर्निहित नियम को पकड़ती है, उदाहरण के लिए एक सर्कल पर घूर्णन के रूप में मॉड्यूलर जोड़ का प्रतिनिधित्व करना। ग्रोकिंग सबसे अधिक छोटे सिंथेटिक डेटासेट पर दिखाई देती है, लेकिन इसे समझने से सामान्यीकरण कब और क्यों उभरता है, इसकी गहरी यांत्रिकी पर प्रकाश पड़ता है।

तकनीकी अंतर्दृष्टि

मैकेनिस्टिक ने रिवर्स-इंजीनियर्ड ग्रोक्ड नेटवर्क का अध्ययन किया और पाया कि वे स्वच्छ एल्गोरिदम लागू करते हैं, जैसे कि त्रिकोणमितीय पहचान के माध्यम से मॉड्यूलर अंकगणित करने के लिए फूरियर-जैसे परिपत्र एम्बेडिंग का उपयोग करना। यह परिवर्तन नियमितीकरण के तहत नेटवर्क के वजन के विरल और निम्न-मानक बनने से संबंधित है: याद रखने के लिए बड़े, अनियमित वजन की आवश्यकता होती है, जबकि सामान्यीकरण सर्किट सरल होता है। ग्रोकिंग इस प्रकार तेजी से ढूंढने वाले याद रखने वाले समाधान और धीमी गति से बनने वाले, अधिक कुशल सामान्यीकरण वाले समाधान के बीच प्रतिस्पर्धा को दर्शाता है।

सामरिक प्रभाव

स्पष्ट निर्णय

यह आपको स्पष्ट तकनीकी दावों को मार्केटिंग भाषा से अलग करने में मदद करता है।

लागत और बजट

आप पैसा या समय खर्च करने से पहले बेहतर कार्यान्वयन संबंधी प्रश्न पूछ सकते हैं।

टीम और वर्कफ़्लो

साझा समझ वाली टीमें बेहतर उत्पाद, नीति और सीखने के निर्णय लेती हैं।

ग्रोकिंग और विलंबित सामान्यीकरण का भविष्य

ग्रोकिंग सामान्यीकरण के विज्ञान में एक खिड़की है जिसे शोधकर्ता आगे बढ़ाने की उम्मीद करते हैं। खुले प्रश्नों में शामिल है कि क्या विलंबित सामान्यीकरण बड़े मॉडलों के अंदर चुपचाप होता है, संक्रमण का पता कैसे लगाया जाए या उसमें तेजी कैसे लाई जाए, और यह जानने के लिए इसका क्या अर्थ है कि किसी मॉडल ने वास्तव में याद किए गए उदाहरणों की तुलना में एक अवधारणा सीखी है। अंतर्दृष्टि बेहतर नियमितीकरण, प्रशिक्षण कार्यक्रम और व्याख्यात्मक उपकरण की जानकारी दे सकती है, और बड़े भाषा मॉडल में उभरती क्षमताओं की भविष्यवाणी करने में मदद कर सकती है।

वास्तविक विश्व कार्यान्वयन

नेटवर्क द्वारा सीखे गए सटीक सर्किट को रिवर्स-इंजीनियर करने के लिए मॉड्यूलर अंकगणितीय कार्यों का अध्ययन करना

यह प्रदर्शित करते हुए कि कैसे वज़न कम होने से याद रखने की प्रक्रिया से वास्तविक सामान्यीकरण की ओर परिवर्तन होता है

विश्लेषण करने के लिए स्वच्छ, पूरी तरह से समझे गए मॉडल व्यवहार देकर व्याख्यात्मक अनुसंधान को सूचित करना

अभ्यासकर्ताओं को सावधान करते हुए कहा गया है कि प्रारंभिक सत्यापन पठार का मतलब हमेशा यह नहीं होता है कि कोई मॉडल सीखने में विफल रहा है

जोखिम और रेलिंग

अलग-अलग टीमें एक ही शब्द का अलग-अलग इस्तेमाल कर सकती हैं, इसलिए दायरे को पहले ही परिभाषित कर लें।

बेंचमार्क मजबूत दिख सकते हैं जबकि वास्तविक दुनिया का प्रदर्शन असमान है।

डेटा गुणवत्ता और मूल्यांकन योजनाओं की अनदेखी अक्सर नाजुक परिणाम पैदा करती है।

कार्यान्वयन रोडमैप

1

आपको जिस परिणाम की आवश्यकता है उसकी सरल भाषा में परिभाषा से शुरुआत करें।

2

परीक्षण से पहले एक सफलता मीट्रिक और एक विफलता स्थिति चुनें।

3

प्रतिनिधि डेटा के साथ एक छोटा पायलट चलाएँ, न कि एक परिष्कृत डेमो सेट।

4

दस्तावेज़ जहां ग्रोकिंग और विलंबित सामान्यीकरण मदद करता है और जहां सरल तरीके बेहतर हैं।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grokking and Delayed Generalization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is Grokking and Delayed Generalization?

ग्रोकिंग एक चौंकाने वाली घटना है जहां एक तंत्रिका नेटवर्क पहले अपने प्रशिक्षण डेटा को याद रखता है, लंबे समय तक लगभग-शून्य सत्यापन सटीकता पर बैठता है, और फिर प्रशिक्षण सटीकता 100% तक पहुंचने के बाद अचानक सामान्यीकृत हो जाता है। यह उस अंतर्ज्ञान को उलट देता है कि सीखना और सामान्यीकरण एक साथ होते हैं।

तंत्रिका नेटवर्क प्रशिक्षण में ग्रोकिंग को क्या परिभाषित करता है?

ग्रोकिंग अच्छे सत्यापन प्रदर्शन के लिए अचानक छलांग है जो प्रशिक्षण सटीकता पहले से ही 100% होने के बाद होती है।

ग्रोकिंग को सबसे पहले किस प्रकार के कार्यों पर प्रमुखता से देखा गया?

OpenAI शोधकर्ताओं ने 2021 में मॉड्यूलर जोड़ जैसी छोटी सिंथेटिक एल्गोरिथम समस्याओं पर ग्रोकिंग की सूचना दी।

ग्रोकिंग में सामान्यीकरण की ओर परिवर्तन को प्रेरित करने के लिए किस कारक को सबसे अधिक श्रेय दिया जाता है?

वजन में कमी धीरे-धीरे नेटवर्क को एक भंगुर याद किए गए समाधान से एक कॉम्पैक्ट, सामान्यीकरण सर्किट की ओर धकेलती है।

जब शोधकर्ताओं ने मॉड्यूलर अंकगणित पर एक ग्रोक्ड नेटवर्क को रिवर्स-इंजीनियर किया, तो उन्हें क्या मिला?

यंत्रवत व्याख्या से पता चला कि नेटवर्क ने मॉड्यूलर अंकगणित की गणना करने के लिए त्रिकोणमितीय, परिपत्र प्रतिनिधित्व सीखा है।

ग्रोकिंग को दो समाधानों के बीच प्रतिस्पर्धा के रूप में क्यों वर्णित किया गया है?

नेटवर्क जल्दी से एक यादगार समाधान ढूंढ लेते हैं, लेकिन नियमितीकरण के तहत, अंततः एक सरल सामान्यीकरण सर्किट में परिवर्तित हो जाते हैं।