चिनचिला स्केलिंग कानून
2022 में डीपमाइंड के चिनचिला स्केलिंग कानूनों से पता चला कि अधिकांश बड़े भाषा मॉडल को बुरी तरह से प्रशिक्षित किया गया था: एक निश्चित गणना बजट के लिए, आपको मॉडल आकार और प्रशिक्षण डेटा को लगभग समान अनुपात में स्केल करना चाहिए।
सिंहावलोकन
It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.
गहरा गोता
चिनचिला से पहले, प्रवृत्ति अपेक्षाकृत मामूली मात्रा में डेटा पर प्रशिक्षण करते हुए बड़े मॉडल (जैसे 175बी-पैरामीटर जीपीटी-3) बनाने की थी। डीपमाइंड ने कई आकारों और डेटा बजटों में 400 से अधिक मॉडलों को प्रशिक्षित किया, फिर एक निश्चित गणना (एफएलओपी) बजट के तहत मापदंडों और टोकन के एक फ़ंक्शन के रूप में नुकसान की भविष्यवाणी करने वाले वक्र फिट किए। उनका निष्कर्ष: पैरामीटर और प्रशिक्षण टोकन को एक साथ स्केल करना चाहिए, लगभग 1-से-1 अनुपात, प्रति पैरामीटर लगभग 20 टोकन प्रशिक्षण डेटा। इसे साबित करने के लिए, उन्होंने 1.4 ट्रिलियन टोकन पर 70बी-पैरामीटर मॉडल चिनचिला को प्रशिक्षित किया, जिसने समान गणना का उपयोग करने के बावजूद बहुत बड़े 280बी-पैरामीटर गोफर से बेहतर प्रदर्शन किया, क्योंकि इसे कहीं अधिक डेटा पर प्रशिक्षित किया गया था।
तकनीकी अंतर्दृष्टि
कानून एक पैरामीट्रिक हानि फ़ंक्शन एल (एन, डी) को फिट करने से आते हैं जहां एन पैरामीटर है और डी टोकन है, जिसमें इरेड्यूसबल-लॉस, मॉडल-आकार और डेटा-आकार की शर्तें शामिल हैं। गणना बाधा के अधीन हानि को कम करने से (गणना मोटे तौर पर एन गुणा डी के समानुपाती होती है) परिणाम मिलता है कि इष्टतम एन और डी दोनों समान घातांक के साथ गणना की शक्ति के रूप में बढ़ते हैं, इसलिए गणना-इष्टतम अनुपात प्रति पैरामीटर 20 टोकन के करीब रहता है।
सामरिक प्रभाव
गति और पैमाना
भाषा वर्कफ़्लो निरंतरता से समझौता किए बिना तेज़ी से आगे बढ़ सकता है।
पहुंच और पहुंच
यह सभी भाषाओं और संचार शैलियों तक पहुंच का विस्तार करता है।
स्पष्ट निर्णय
टीमें निर्णय लेने में अधिक समय व्यतीत कर सकती हैं जबकि स्वचालन पुनरावृत्ति को संभालता है।
चिनचिला स्केलिंग कानूनों का भविष्य
चिन्चिला ने क्षेत्र को पैरामीटर गणनाओं का पीछा करने से कहीं अधिक उच्च-गुणवत्ता वाले डेटा को फीड करने वाले मॉडल में स्थानांतरित कर दिया, और आधुनिक मॉडल अक्सर अनुमान को सस्ता बनाने के लिए 'गणना-इष्टतम' बिंदु से काफी आगे तक प्रशिक्षित होते हैं। जैसे-जैसे उच्च-गुणवत्ता वाला वेब टेक्स्ट दुर्लभ होता जा रहा है, स्केलिंग बनाए रखने के लिए डेटा क्यूरेशन, सिंथेटिक डेटा, एकाधिक युग और मल्टीमॉडल डेटा पर ध्यान दिया जा रहा है। मूल पाठ कायम है: डेटा और पैरामीटर संतुलित होने चाहिए, और केवल कच्चा आकार ही अब लक्ष्य नहीं है।
वास्तविक विश्व कार्यान्वयन
डीपमाइंड के 70बी-पैरामीटर चिनचिला ने कहीं अधिक डेटा पर प्रशिक्षण द्वारा, समान गणना का उपयोग करके बेंचमार्क पर 280बी गोफर को हराया
स्क्रैच मॉडल की योजना बनाते समय टीमों को प्रति पैरामीटर लगभग 20 प्रशिक्षण टोकन का बजट बनाने के लिए मार्गदर्शन करना
LLaMA जैसे छोटे, डेटा-समृद्ध मॉडल को उचित ठहराना, जो अनुमान के समय चलाने के लिए सस्ते हैं
यह अनुमान लगाना कि क्या एक नियोजित मॉडल 'प्रशिक्षित' है और अतिरिक्त मापदंडों की तुलना में अतिरिक्त डेटा से अधिक लाभान्वित होगा
जोखिम और रेलिंग
मतिभ्रम वाले तथ्य चुपचाप रिपोर्ट में प्रवेश कर सकते हैं, प्रवाह का समर्थन कर सकते हैं, या अनुसंधान आउटपुट का समर्थन कर सकते हैं।
त्वरित संवेदनशीलता समान अनुरोधों में असंगत परिणाम पैदा कर सकती है।
यदि पहुंच नियंत्रण कमजोर हैं तो संवेदनशील पाठ डेटा उजागर हो सकता है।
कार्यान्वयन रोडमैप
रोलआउट से पहले आउटपुट स्वरूप, टोन और गुणवत्ता मानकों को परिभाषित करें।
जब भी सटीकता मायने रखती है तो विश्वसनीय स्रोतों के साथ जमीनी प्रतिक्रियाएँ।
उच्च जोखिम वाले आउटपुट के लिए एक मानव समीक्षा चेकपॉइंट रखें।
विफलता पैटर्न को ट्रैक करें और संकेतों या वर्कफ़्लो को नियमित रूप से पुनः प्रशिक्षित करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Scaling Laws quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
तंत्रिका नेटवर्क के लिए स्केलिंग कानून
अक्सर पूछे जाने वाले प्रश्नों
What is Chinchilla Scaling Laws?
2022 में डीपमाइंड के चिनचिला स्केलिंग कानूनों से पता चला कि अधिकांश बड़े भाषा मॉडल को बुरी तरह से प्रशिक्षित किया गया था: एक निश्चित गणना बजट के लिए, आपको मॉडल आकार और प्रशिक्षण डेटा को लगभग समान अनुपात में स्केल करना चाहिए। यह मायने रखता है क्योंकि इसने 'इष्टतम' मॉडल आकार के अर्थ को फिर से परिभाषित किया और प्रयोगशालाओं द्वारा गणना करने के तरीके को फिर से आकार दिया।
चिनचिला स्केलिंग कानूनों का केंद्रीय निष्कर्ष क्या था?
चिनचिला ने दिखाया कि एक निश्चित गणना बजट के लिए, मापदंडों और प्रशिक्षण टोकन को एक साथ, लगभग 1 से 1 तक बढ़ना चाहिए।
चिनचिला ने सुझाव दिया कि प्रति पैरामीटर लगभग कितने प्रशिक्षण टोकन गणना-इष्टतम हैं?
गणना-इष्टतम अनुपात प्रत्येक मॉडल पैरामीटर के लिए लगभग 20 प्रशिक्षण टोकन पर काम करता है।
बहुत छोटा होने के बावजूद चिनचिला ने किस मॉडल से बेहतर प्रदर्शन किया?
70बी-पैरामीटर चिनचिला ने उसी गणना का उपयोग करके डीपमाइंड के अपने 280बी-पैरामीटर गोफर को हराया, क्योंकि यह कहीं अधिक डेटा पर प्रशिक्षित था।
चिनचिला ने उस समय GPT-3 जैसे मॉडलों के बारे में क्या संकेत दिया था?
उस युग के कई बड़े मॉडलों को प्रशिक्षित किया गया था, जिसका अर्थ है कि उन्होंने अपने पैरामीटर गणना के लिए बहुत अधिक डेटा के साथ बेहतर प्रदर्शन किया होगा।
मोटे तौर पर चिनचिला विश्लेषण में गणना का अनुमान कैसे लगाया गया था?
प्रशिक्षण गणना (एफएलओपी) प्रशिक्षण टोकन की संख्या से गुणा किए गए मापदंडों की संख्या के लगभग आनुपातिक है।