ज्ञान आसवन
ज्ञान आसवन एक छोटे 'छात्र' मॉडल को एक बड़े, सटीक 'शिक्षक' मॉडल की नकल करने के लिए प्रशिक्षित करता है।
सिंहावलोकन
It matters because it shrinks powerful models so they run cheaply on phones and servers while keeping much of the accuracy.
गहरा गोता
बड़े मॉडल सटीक होते हैं लेकिन तैनात करने में धीमे और महंगे होते हैं। ज्ञान आसवन छात्र को केवल हार्ड लेबल के बजाय शिक्षक के आउटपुट से सीखने के द्वारा उनकी क्षमता को एक कॉम्पैक्ट मॉडल में स्थानांतरित करता है। हिंटन और सहकर्मियों की मुख्य अंतर्दृष्टि यह है कि एक शिक्षक का पूर्ण संभाव्यता वितरण 'अंधकारपूर्ण ज्ञान' रखता है: यहां तक कि जब वह 'कुत्ते' की भविष्यवाणी करता है, तो 'भेड़िया' बनाम 'कार' की सापेक्ष संभावनाओं से पता चलता है कि शिक्षक समानताएं कैसे देखता है। तापमान के साथ इन संभावनाओं को नरम करने से वह संरचना उजागर हो जाती है, और छात्र को इसका मिलान करने के लिए प्रशिक्षित किया जाता है, अक्सर वास्तविक लेबल के साथ। परिणाम एक छोटा, तेज़ मॉडल है जो अकेले लेबल पर प्रशिक्षित मॉडल से बेहतर सामान्यीकरण करता है। डिस्टिलबर्ट और टाइनीबर्ट प्रसिद्ध डिस्टिल्ड भाषा मॉडल हैं।
तकनीकी अंतर्दृष्टि
क्लासिक हानि वास्तविक लेबल पर एक मानक क्रॉस-एन्ट्रॉपी के साथ एक आसवन शब्द (छात्र और शिक्षक की नरम संभावनाओं के बीच केएल विचलन) को जोड़ती है। सॉफ्टनिंग सॉफ्टमैक्स में तापमान टी का उपयोग करता है: उच्च टी वितरण को समतल कर देता है जिससे छोटी अंतर-वर्ग समानताएं सीखने योग्य संकेत बन जाती हैं; आसवन प्रवणता को आम तौर पर टी-वर्ग द्वारा बढ़ाया जाता है। वेरिएंट आउटपुट से आगे जाते हैं: फीचर-आधारित आसवन मध्यवर्ती छिपी परतों से मेल खाता है, और संबंध-आधारित आसवन उदाहरणों के बीच संबंधों से मेल खाता है।
सामरिक प्रभाव
लागत और बजट
वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।
स्पष्ट निर्णय
तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।
गुणवत्ता नियंत्रण
बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।
ज्ञान आसवन का भविष्य
शिपिंग कुशल मॉडलों में आसवन अब एक मानक कदम है और आज के छोटे, सक्षम खुले मॉडलों की लहर का केंद्र है। एक तेजी से बढ़ती प्रवृत्ति बड़े भाषा मॉडल से अनुक्रम-स्तरीय आसवन है, जहां एक मजबूत मॉडल छोटे छात्रों को पढ़ाने के लिए प्रशिक्षण डेटा या तर्क निशान (विचार श्रृंखला सहित) उत्पन्न करता है, सिंथेटिक डेटा के साथ लाइन को धुंधला करता है। परिमाणीकरण और काट-छाँट के साथ कड़ी जोड़ी, अधिक ऑन-डिवाइस परिनियोजन, और मालिकाना मॉडल से आसवन करते समय लाइसेंसिंग और गुणवत्ता के बारे में चल रही बहस की अपेक्षा करें, जिनके आउटपुट एक प्रतियोगी के प्रशिक्षण संकेत बन जाते हैं।
वास्तविक विश्व कार्यान्वयन
डिस्टिलबर्ट तेजी से अनुमान लगाने के लिए अपनी अधिकांश भाषा समझ को बरकरार रखते हुए बीईआरटी को लगभग 40% कम मापदंडों पर संपीड़ित करता है।
एक बड़े विज़न मॉडल को छोटा करना ताकि एक इमेज क्लासिफायरियर स्मार्टफोन कैमरा ऐप पर वास्तविक समय में चल सके।
एक बड़े मॉडल के विचार-श्रृंखला के तर्क को एक छोटे मॉडल में वितरित करना ताकि वह गणित या कोडिंग प्रश्नों का अधिक सस्ते में उत्तर दे सके।
मॉडलों के एक समूह को एक ही छात्र में संपीड़ित करना ताकि उत्पादन सेवा लागत और विलंबता बिना अधिक सटीकता हानि के कम हो जाए।
जोखिम और रेलिंग
एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।
बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।
जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।
कार्यान्वयन रोडमैप
कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।
यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।
त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।
स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Knowledge Distillation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
एआई ज्ञान प्रबंधन
अक्सर पूछे जाने वाले प्रश्नों
What is Knowledge Distillation?
ज्ञान आसवन एक छोटे 'छात्र' मॉडल को एक बड़े, सटीक 'शिक्षक' मॉडल की नकल करने के लिए प्रशिक्षित करता है। यह मायने रखता है क्योंकि यह शक्तिशाली मॉडलों को छोटा करता है ताकि वे अधिक सटीकता बनाए रखते हुए फोन और सर्वर पर सस्ते में चल सकें।
ज्ञान आसवन का लक्ष्य क्या है?
आसवन एक बड़े शिक्षक की क्षमता को एक कॉम्पैक्ट, तेज़ छात्र मॉडल में स्थानांतरित करता है।
शिक्षक के 'अंधकारमय ज्ञान' से क्या अभिप्राय है?
शिक्षक के पूर्ण संभाव्यता वितरण में अंधेरा ज्ञान संरचना है, जैसे कि 'भेड़िया' 'कुत्ते' के समान है, न कि केवल शीर्ष उत्तर।
आसवन में तापमान (T) की क्या भूमिका होती है?
एक उच्च तापमान संभाव्यता वितरण को समतल कर देता है, जिससे सापेक्ष समानताएं प्रकट होती हैं जो छात्र को सीखनी चाहिए।
क्लासिक आसवन हानि किन दो घटकों को जोड़ती है?
छात्र जमीनी सच्चाई लेबल (क्रॉस-एन्ट्रॉपी) को फिट करते हुए शिक्षक के नरम वितरण (केएल शब्द) से मेल खाता है।
आसुत भाषा मॉडल का उदाहरण कौन सा है?
डिस्टिलबर्ट, बीईआरटी से डिस्टिल्ड एक प्रसिद्ध मॉडल है, जो बहुत कम मापदंडों के साथ सबसे अधिक प्रदर्शन बरकरार रखता है।