टेंसर कोर
टेन्सर कोर आधुनिक NVIDIA GPU के अंदर विशेष हार्डवेयर इकाइयाँ हैं जो मैट्रिक्स मल्टीप्ल-एंड-एक्यूमुलेट ऑपरेशन को बहुत तेजी से निष्पादित करती हैं।
सिंहावलोकन
They are the main reason a single GPU can train and run large neural networks orders of magnitude faster than general-purpose compute would allow.
गहरा गोता
2017 में वोल्टा आर्किटेक्चर के साथ पेश किया गया, टेन्सर कोर समर्पित सर्किट हैं जो मानक CUDA कोर पर एक समय में प्रत्येक गुणा करने के बजाय एक ही ऑपरेशन में एक छोटे मैट्रिक्स गुणन और एक जोड़ (डी = ए एक्स बी + सी) की गणना करते हैं। चूँकि वस्तुतः तंत्रिका नेटवर्क की प्रत्येक परत मैट्रिक्स गुणन तक कम हो जाती है, यह उस गणित से मेल खाता है जिसकी वास्तव में AI को आवश्यकता होती है। प्रत्येक जीपीयू पीढ़ी ने जो कुछ भी संभाला उसका विस्तार किया: वोल्टा ने 4x4 एफपी 16 टाइलें बनाईं, जबकि बाद में एम्पीयर, हॉपर और ब्लैकवेल आर्किटेक्चर ने टीएफ 32, बीएफ 16, आईएनटी 8, एफपी 8 और एफपी 4 जैसे कम-सटीक प्रारूप जोड़े। कम परिशुद्धता का अर्थ है प्रति घड़ी अधिक संख्याएँ संसाधित करना, सटीकता को स्वीकार्य रखते हुए प्रशिक्षण और अनुमान के लिए थ्रूपुट को नाटकीय रूप से बढ़ाना।
तकनीकी अंतर्दृष्टि
एक टेन्सर कोर दो छोटे मैट्रिक्स को गुणा करता है और परिणाम को एक फ़्यूज्ड चरण में जमा करता है, इस तथ्य का फायदा उठाते हुए कि समान इनपुट मान कई आउटपुट तत्वों में पुन: उपयोग किए जाते हैं। यह आम तौर पर कम परिशुद्धता (एफपी16, बीएफ16, या एफपी8) में इनपुट पढ़ता है लेकिन राउंडिंग त्रुटि को सीमित करने के लिए उच्च परिशुद्धता (अक्सर एफपी32) में चल रहे योग को जमा करता है। cuBLAS और cuDNN जैसी सॉफ़्टवेयर लाइब्रेरी और PyTorch जैसे फ़्रेमवर्क, इन छोटे ब्लॉकों में बड़े मैट्रिक्स को स्वचालित रूप से टाइल करते हैं ताकि मॉडल को मैन्युअल कोडिंग के बिना स्पीडअप मिल सके।
सामरिक प्रभाव
लागत और बजट
वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।
स्पष्ट निर्णय
तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।
गुणवत्ता नियंत्रण
बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।
टेंसर कोर का भविष्य
टेन्सर कोर हमेशा से कम परिशुद्धता की ओर बढ़ते रहते हैं: हॉपर ने एफपी 8 जोड़ा और ब्लैकवेल ने हार्डवेयर-प्रबंधित स्केलिंग के साथ 4-बिट एफपी 4 पेश किया, जो अनुमान-भारी वर्कलोड के लिए प्रत्येक चरण में थ्रूपुट को लगभग दोगुना कर देता है। स्पार्सिटी (शून्य भार को छोड़कर) के लिए कड़े समर्थन की अपेक्षा करें, माइक्रोस्केलिंग प्रारूप जो संख्याओं के छोटे ब्लॉकों में स्केल कारकों को जोड़ते हैं, और मेमोरी सिस्टम के साथ गहन एकीकरण करते हैं ताकि कोर खिलाए रहें। जैसे-जैसे मॉडल बढ़ते हैं, मैट्रिक्स इंजन, कच्ची घड़ी की गति नहीं, एआई हार्डवेयर प्रदर्शन के लिए केंद्रीय युद्ध का मैदान बना हुआ है।
वास्तविक विश्व कार्यान्वयन
जीपीटी-शैली ट्रांसफार्मर जैसे बड़े भाषा मॉडल का प्रशिक्षण, जहां बीएफ16 या एफपी8 में टेन्सर कोर पर प्रति चरण अरबों मैट्रिक्स गुणन चलते हैं।
प्रति जीपीयू अधिक उपयोगकर्ताओं को सेवा प्रदान करने के लिए INT8 या FP8 परिमाणीकरण का उपयोग करके चैटबॉट और छवि जनरेटर के लिए वास्तविक समय अनुमान चलाना।
वीडियो गेम में NVIDIA DLSS को तेज करना, जहां एक तंत्रिका नेटवर्क प्रत्येक फ्रेम में टेन्सर कोर का उपयोग करके कम-रिज़ॉल्यूशन फ़्रेम को बढ़ाता है।
प्रोटीन-फोल्डिंग (अल्फाफोल्ड) और मौसम मॉडल जैसे वैज्ञानिक कंप्यूटिंग को तेज करना जिन्हें मैट्रिक्स-भारी तंत्रिका कार्यभार के रूप में पुन: तैयार किया गया है।
जोखिम और रेलिंग
एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।
बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।
जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।
कार्यान्वयन रोडमैप
कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।
यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।
त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।
स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tensor Cores quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
बड़े मॉडलों के लिए टेन्सर समांतरता
अक्सर पूछे जाने वाले प्रश्नों
What is Tensor Cores?
टेन्सर कोर आधुनिक NVIDIA GPU के अंदर विशेष हार्डवेयर इकाइयाँ हैं जो मैट्रिक्स मल्टीप्ल-एंड-एक्यूमुलेट ऑपरेशन को बहुत तेजी से निष्पादित करती हैं। वे मुख्य कारण हैं कि एक एकल जीपीयू बड़े तंत्रिका नेटवर्क को प्रशिक्षित कर सकता है और सामान्य प्रयोजन की गणना की तुलना में अधिक तेजी से चला सकता है।
टेन्सर कोर किस मुख्य गणितीय ऑपरेशन को गति देने के लिए विशेष रूप से डिज़ाइन किए गए हैं?
टेन्सर कोर एक चरण में फ़्यूज्ड मैट्रिक्स गुणन प्लस संचय करते हैं, जो वास्तव में वह ऑपरेशन है जो तंत्रिका नेटवर्क परतों पर हावी होता है।
किस NVIDIA GPU आर्किटेक्चर ने सबसे पहले Tensor Cores पेश किया?
Tensor Cores ने 2017 में वोल्टा आर्किटेक्चर के साथ शुरुआत की, जिसकी शुरुआत FP16 4x4 मैट्रिक्स ऑपरेशन से हुई।
टेन्सर कोर अक्सर एफपी16 या एफपी8 जैसी कम परिशुद्धता का उपयोग क्यों करते हैं?
प्रति संख्या कम बिट्स का उपयोग करने का मतलब है कि प्रत्येक चक्र में हार्डवेयर के माध्यम से अधिक मान प्रवाहित होते हैं, केवल एक छोटी, आमतौर पर सहनीय, सटीकता की हानि के साथ गति में काफी वृद्धि होती है।
सटीकता को संरक्षित करने के लिए, टेन्सर कोर आमतौर पर रनिंग योग (संचय) के लिए किस परिशुद्धता का उपयोग करते हैं?
इनपुट कम परिशुद्धता वाले हो सकते हैं, लेकिन संचायक आमतौर पर राउंडिंग त्रुटियों के निर्माण को सीमित करने के लिए FP32 जैसी उच्च परिशुद्धता में चलता है।
PyTorch जैसे रोजमर्रा के AI फ्रेमवर्क Tensor Cores का उपयोग कैसे करते हैं?
अंतर्निहित लाइब्रेरीज़ बड़े मैट्रिक्स संचालन को स्वचालित रूप से टेन्सर-कोर-आकार की टाइलों में तोड़ देती हैं, इसलिए फ्रेमवर्क को मैन्युअल कोडिंग के बिना स्पीडअप मिलता है।