बुनियादी गाइड

तंत्रिका नेटवर्क के लिए स्केलिंग कानून

स्केलिंग कानून अनुभवजन्य सूत्र हैं जो दिखाते हैं कि जैसे-जैसे आप मॉडल आकार, डेटासेट आकार और गणना बढ़ाते हैं, तंत्रिका नेटवर्क का नुकसान अनुमानित रूप से कम हो जाता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

They matter because they let researchers forecast performance before spending millions on training a giant model.

गहरा गोता

कपलान और सहकर्मियों द्वारा OpenAI के 2020 पेपर द्वारा लोकप्रिय स्केलिंग कानूनों में पाया गया कि परीक्षण हानि तीन मात्राओं में एक सुचारू शक्ति कानून के रूप में घट जाती है: पैरामीटर गणना (एन), प्रशिक्षण टोकन (डी), और कुल गणना (सी)। लॉग-लॉग अक्षों पर प्लॉट किया गया, प्रत्येक कारक बनाम हानि परिमाण के कई आदेशों को फैलाते हुए लगभग सीधी रेखा बनाती है। रिश्ते हानि ≈ a + b·X^(-c) का रूप लेते हैं, जहां X स्केलिंग कारक है। महत्वपूर्ण रूप से, मूल कार्य में सुझाव दिया गया कि मॉडल का आकार डेटा से अधिक मायने रखता है, जिससे GPT-3 के 175 बिलियन मापदंडों जैसे बड़े मॉडल की ओर दौड़ को बढ़ावा मिला। स्केलिंग कानूनों ने अनुमान से गहन शिक्षा को एक पूर्वानुमानित इंजीनियरिंग अनुशासन में बदल दिया, जिससे टीमों को छोटे, सस्ते प्रयोगों से बड़े परिणामों की भविष्यवाणी करने की सुविधा मिली।

तकनीकी अंतर्दृष्टि

पावर-लॉ फॉर्म का मतलब है कि गणना में प्रत्येक निश्चित गुणक वृद्धि से हानि में लगभग निरंतर योगात्मक गिरावट आती है। हानि को क्रॉस-एन्ट्रॉपी के प्रति टोकन नेट या बिट्स में मापा जाता है। क्योंकि घातांक c छोटा है (अक्सर 0.05-0.1 के आसपास), लाभ वास्तविक हैं लेकिन कम हो रहे हैं: दोहरीकरण गणना पहले दोहरीकरण की तुलना में बहुत कम मदद करती है। महत्वपूर्ण बात यह है कि ये कानून इरेड्यूसिबल-प्लस-रिड्यूसिबल नुकसान का वर्णन करते हैं, जहां एक स्थिर शब्द डेटा की आंतरिक एन्ट्रापी को कैप्चर करता है जिसे कोई भी मॉडल हरा नहीं सकता है।

सामरिक प्रभाव

स्पष्ट निर्णय

यह आपको स्पष्ट तकनीकी दावों को मार्केटिंग भाषा से अलग करने में मदद करता है।

लागत और बजट

आप पैसा या समय खर्च करने से पहले बेहतर कार्यान्वयन संबंधी प्रश्न पूछ सकते हैं।

टीम और वर्कफ़्लो

साझा समझ वाली टीमें बेहतर उत्पाद, नीति और सीखने के निर्णय लेती हैं।

तंत्रिका नेटवर्क के लिए स्केलिंग कानूनों का भविष्य

शोधकर्ता स्केलिंग कानूनों को पूर्व-प्रशिक्षण हानि से परे डाउनस्ट्रीम कार्य सटीकता, मल्टीमॉडल मॉडल और अनुमान-समय गणना तक विस्तारित कर रहे हैं, जहां तर्क मॉडल प्रति प्रश्न अधिक सोचने में खर्च करते हैं। जैसे-जैसे उच्च-गुणवत्ता वाला पाठ दुर्लभ होता जा रहा है, ध्यान डेटा गुणवत्ता, सिंथेटिक डेटा और बार-बार डेटा स्केलिंग कानूनों पर केंद्रित हो रहा है। कुछ लोगों का तर्क है कि कच्ची स्केलिंग धन, ऊर्जा और उपलब्ध पाठ की व्यावहारिक सीमाओं को प्रभावित कर रही है, जिससे क्षेत्र केवल बड़े निर्माण के बजाय एल्गोरिदमिक दक्षता और नए आर्किटेक्चर की ओर बढ़ रहा है।

वास्तविक विश्व कार्यान्वयन

GPU बजट निर्धारित करने से पहले छोटे 100-मिलियन-पैरामीटर परीक्षण की श्रृंखला से नियोजित 70-बिलियन-पैरामीटर मॉडल के अंतिम नुकसान का पूर्वानुमान लगाना।

यह तय करना कि कितने ट्रिलियन टोकन एकत्र करने हैं ताकि एक निश्चित गणना बजट एक प्रशिक्षित मॉडल पर बर्बाद न हो।

दोनों आर्किटेक्चर को पूर्ण आकार में प्रशिक्षित करने के बजाय उनके स्केलिंग कर्व को छोटे पैमाने पर फिट करके सस्ते में तुलना करना।

हानि वक्र को लक्ष्य गणना स्तर पर एक्सट्रपलेशन करके निवेशकों या अनुदान समीक्षकों के लिए यथार्थवादी सटीकता अपेक्षाएँ निर्धारित करना।

जोखिम और रेलिंग

अलग-अलग टीमें एक ही शब्द का अलग-अलग इस्तेमाल कर सकती हैं, इसलिए दायरे को पहले ही परिभाषित कर लें।

बेंचमार्क मजबूत दिख सकते हैं जबकि वास्तविक दुनिया का प्रदर्शन असमान है।

डेटा गुणवत्ता और मूल्यांकन योजनाओं की अनदेखी अक्सर नाजुक परिणाम पैदा करती है।

कार्यान्वयन रोडमैप

1

आपको जिस परिणाम की आवश्यकता है उसकी सरल भाषा में परिभाषा से शुरुआत करें।

2

परीक्षण से पहले एक सफलता मीट्रिक और एक विफलता स्थिति चुनें।

3

प्रतिनिधि डेटा के साथ एक छोटा पायलट चलाएँ, न कि एक परिष्कृत डेमो सेट।

4

दस्तावेज़ जहां तंत्रिका नेटवर्क के लिए स्केलिंग कानून मदद करते हैं और जहां सरल तरीके बेहतर हैं।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Scaling Laws for Neural Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

कन्वेन्शनल न्यूरल नेटवर्क

अक्सर पूछे जाने वाले प्रश्नों

What is Scaling Laws for Neural Networks?

स्केलिंग कानून अनुभवजन्य सूत्र हैं जो दिखाते हैं कि जैसे-जैसे आप मॉडल आकार, डेटासेट आकार और गणना बढ़ाते हैं, तंत्रिका नेटवर्क का नुकसान अनुमानित रूप से कम हो जाता है। वे मायने रखते हैं क्योंकि वे शोधकर्ताओं को एक विशाल मॉडल के प्रशिक्षण पर लाखों खर्च करने से पहले प्रदर्शन का पूर्वानुमान लगाने देते हैं।

लॉग-लॉग अक्षों पर, स्केलिंग कानूनों के तहत गणना बढ़ने पर परीक्षण हानि आम तौर पर कैसे व्यवहार करती है?

हानि बनाम गणना, मॉडल आकार, या डेटा लॉग-लॉग प्लॉट पर एक सीधी-सीधी रेखा बनाता है, जो पावर-लॉ संबंध का हस्ताक्षर है।

मूल स्केलिंग नियम हानि से संबंधित कौन सी तीन मात्राएँ हैं?

कपलान एट अल. पैरामीटर गणना (एन), प्रशिक्षण टोकन (डी), और कुल गणना (सी) में शक्ति कानून के रूप में हानि का अध्ययन किया गया।

एआई प्रयोगशालाओं के लिए स्केलिंग कानून इतने मूल्यवान क्यों हैं?

छोटे पैमाने पर वक्र फिट करके, टीमें बड़ी रकम खर्च करने से पहले एक विशाल मॉडल के प्रदर्शन का अनुमान लगाती हैं।

स्केलिंग कानून हानि सूत्र में स्थिर (अघुलनशील) शब्द क्या दर्शाता है?

हानि में एक कम करने योग्य हिस्सा होता है जो पैमाने के साथ-साथ डेटा की अंतर्निहित यादृच्छिकता द्वारा निर्धारित एक अपरिवर्तनीय मंजिल के साथ सिकुड़ता है।

स्केलिंग लाभ को 'घटते' के रूप में क्यों वर्णित किया गया है?

चूँकि शक्ति-विधि प्रतिपादक छोटा है, समान गुणात्मक गणना से लगातार छोटी पूर्ण हानि में कमी आती है।