तकनीकी गाइड

ज्ञान आसवन

ज्ञान आसवन एक छोटे 'छात्र' मॉडल को एक बड़े, सटीक 'शिक्षक' मॉडल की नकल करने के लिए प्रशिक्षित करता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It matters because it shrinks powerful models so they run cheaply on phones and servers while keeping much of the accuracy.

गहरा गोता

बड़े मॉडल सटीक होते हैं लेकिन तैनात करने में धीमे और महंगे होते हैं। ज्ञान आसवन छात्र को केवल हार्ड लेबल के बजाय शिक्षक के आउटपुट से सीखने के द्वारा उनकी क्षमता को एक कॉम्पैक्ट मॉडल में स्थानांतरित करता है। हिंटन और सहकर्मियों की मुख्य अंतर्दृष्टि यह है कि एक शिक्षक का पूर्ण संभाव्यता वितरण 'अंधकारपूर्ण ज्ञान' रखता है: यहां तक ​​​​कि जब वह 'कुत्ते' की भविष्यवाणी करता है, तो 'भेड़िया' बनाम 'कार' की सापेक्ष संभावनाओं से पता चलता है कि शिक्षक समानताएं कैसे देखता है। तापमान के साथ इन संभावनाओं को नरम करने से वह संरचना उजागर हो जाती है, और छात्र को इसका मिलान करने के लिए प्रशिक्षित किया जाता है, अक्सर वास्तविक लेबल के साथ। परिणाम एक छोटा, तेज़ मॉडल है जो अकेले लेबल पर प्रशिक्षित मॉडल से बेहतर सामान्यीकरण करता है। डिस्टिलबर्ट और टाइनीबर्ट प्रसिद्ध डिस्टिल्ड भाषा मॉडल हैं।

तकनीकी अंतर्दृष्टि

क्लासिक हानि वास्तविक लेबल पर एक मानक क्रॉस-एन्ट्रॉपी के साथ एक आसवन शब्द (छात्र और शिक्षक की नरम संभावनाओं के बीच केएल विचलन) को जोड़ती है। सॉफ्टनिंग सॉफ्टमैक्स में तापमान टी का उपयोग करता है: उच्च टी वितरण को समतल कर देता है जिससे छोटी अंतर-वर्ग समानताएं सीखने योग्य संकेत बन जाती हैं; आसवन प्रवणता को आम तौर पर टी-वर्ग द्वारा बढ़ाया जाता है। वेरिएंट आउटपुट से आगे जाते हैं: फीचर-आधारित आसवन मध्यवर्ती छिपी परतों से मेल खाता है, और संबंध-आधारित आसवन उदाहरणों के बीच संबंधों से मेल खाता है।

सामरिक प्रभाव

लागत और बजट

वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।

स्पष्ट निर्णय

तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।

गुणवत्ता नियंत्रण

बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।

ज्ञान आसवन का भविष्य

शिपिंग कुशल मॉडलों में आसवन अब एक मानक कदम है और आज के छोटे, सक्षम खुले मॉडलों की लहर का केंद्र है। एक तेजी से बढ़ती प्रवृत्ति बड़े भाषा मॉडल से अनुक्रम-स्तरीय आसवन है, जहां एक मजबूत मॉडल छोटे छात्रों को पढ़ाने के लिए प्रशिक्षण डेटा या तर्क निशान (विचार श्रृंखला सहित) उत्पन्न करता है, सिंथेटिक डेटा के साथ लाइन को धुंधला करता है। परिमाणीकरण और काट-छाँट के साथ कड़ी जोड़ी, अधिक ऑन-डिवाइस परिनियोजन, और मालिकाना मॉडल से आसवन करते समय लाइसेंसिंग और गुणवत्ता के बारे में चल रही बहस की अपेक्षा करें, जिनके आउटपुट एक प्रतियोगी के प्रशिक्षण संकेत बन जाते हैं।

वास्तविक विश्व कार्यान्वयन

डिस्टिलबर्ट तेजी से अनुमान लगाने के लिए अपनी अधिकांश भाषा समझ को बरकरार रखते हुए बीईआरटी को लगभग 40% कम मापदंडों पर संपीड़ित करता है।

एक बड़े विज़न मॉडल को छोटा करना ताकि एक इमेज क्लासिफायरियर स्मार्टफोन कैमरा ऐप पर वास्तविक समय में चल सके।

एक बड़े मॉडल के विचार-श्रृंखला के तर्क को एक छोटे मॉडल में वितरित करना ताकि वह गणित या कोडिंग प्रश्नों का अधिक सस्ते में उत्तर दे सके।

मॉडलों के एक समूह को एक ही छात्र में संपीड़ित करना ताकि उत्पादन सेवा लागत और विलंबता बिना अधिक सटीकता हानि के कम हो जाए।

जोखिम और रेलिंग

एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।

बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।

जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।

कार्यान्वयन रोडमैप

1

कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।

2

यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।

3

त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।

4

स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Knowledge Distillation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is Knowledge Distillation?

ज्ञान आसवन एक छोटे 'छात्र' मॉडल को एक बड़े, सटीक 'शिक्षक' मॉडल की नकल करने के लिए प्रशिक्षित करता है। यह मायने रखता है क्योंकि यह शक्तिशाली मॉडलों को छोटा करता है ताकि वे अधिक सटीकता बनाए रखते हुए फोन और सर्वर पर सस्ते में चल सकें।

ज्ञान आसवन का लक्ष्य क्या है?

आसवन एक बड़े शिक्षक की क्षमता को एक कॉम्पैक्ट, तेज़ छात्र मॉडल में स्थानांतरित करता है।

शिक्षक के 'अंधकारमय ज्ञान' से क्या अभिप्राय है?

शिक्षक के पूर्ण संभाव्यता वितरण में अंधेरा ज्ञान संरचना है, जैसे कि 'भेड़िया' 'कुत्ते' के समान है, न कि केवल शीर्ष उत्तर।

आसवन में तापमान (T) की क्या भूमिका होती है?

एक उच्च तापमान संभाव्यता वितरण को समतल कर देता है, जिससे सापेक्ष समानताएं प्रकट होती हैं जो छात्र को सीखनी चाहिए।

क्लासिक आसवन हानि किन दो घटकों को जोड़ती है?

छात्र जमीनी सच्चाई लेबल (क्रॉस-एन्ट्रॉपी) को फिट करते हुए शिक्षक के नरम वितरण (केएल शब्द) से मेल खाता है।

आसुत भाषा मॉडल का उदाहरण कौन सा है?

डिस्टिलबर्ट, बीईआरटी से डिस्टिल्ड एक प्रसिद्ध मॉडल है, जो बहुत कम मापदंडों के साथ सबसे अधिक प्रदर्शन बरकरार रखता है।