तकनीकी गाइड

टेंसर कोर

टेन्सर कोर आधुनिक NVIDIA GPU के अंदर विशेष हार्डवेयर इकाइयाँ हैं जो मैट्रिक्स मल्टीप्ल-एंड-एक्यूमुलेट ऑपरेशन को बहुत तेजी से निष्पादित करती हैं।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

They are the main reason a single GPU can train and run large neural networks orders of magnitude faster than general-purpose compute would allow.

गहरा गोता

2017 में वोल्टा आर्किटेक्चर के साथ पेश किया गया, टेन्सर कोर समर्पित सर्किट हैं जो मानक CUDA कोर पर एक समय में प्रत्येक गुणा करने के बजाय एक ही ऑपरेशन में एक छोटे मैट्रिक्स गुणन और एक जोड़ (डी = ए एक्स बी + सी) की गणना करते हैं। चूँकि वस्तुतः तंत्रिका नेटवर्क की प्रत्येक परत मैट्रिक्स गुणन तक कम हो जाती है, यह उस गणित से मेल खाता है जिसकी वास्तव में AI को आवश्यकता होती है। प्रत्येक जीपीयू पीढ़ी ने जो कुछ भी संभाला उसका विस्तार किया: वोल्टा ने 4x4 एफपी 16 टाइलें बनाईं, जबकि बाद में एम्पीयर, हॉपर और ब्लैकवेल आर्किटेक्चर ने टीएफ 32, बीएफ 16, आईएनटी 8, एफपी 8 और एफपी 4 जैसे कम-सटीक प्रारूप जोड़े। कम परिशुद्धता का अर्थ है प्रति घड़ी अधिक संख्याएँ संसाधित करना, सटीकता को स्वीकार्य रखते हुए प्रशिक्षण और अनुमान के लिए थ्रूपुट को नाटकीय रूप से बढ़ाना।

तकनीकी अंतर्दृष्टि

एक टेन्सर कोर दो छोटे मैट्रिक्स को गुणा करता है और परिणाम को एक फ़्यूज्ड चरण में जमा करता है, इस तथ्य का फायदा उठाते हुए कि समान इनपुट मान कई आउटपुट तत्वों में पुन: उपयोग किए जाते हैं। यह आम तौर पर कम परिशुद्धता (एफपी16, बीएफ16, या एफपी8) में इनपुट पढ़ता है लेकिन राउंडिंग त्रुटि को सीमित करने के लिए उच्च परिशुद्धता (अक्सर एफपी32) में चल रहे योग को जमा करता है। cuBLAS और cuDNN जैसी सॉफ़्टवेयर लाइब्रेरी और PyTorch जैसे फ़्रेमवर्क, इन छोटे ब्लॉकों में बड़े मैट्रिक्स को स्वचालित रूप से टाइल करते हैं ताकि मॉडल को मैन्युअल कोडिंग के बिना स्पीडअप मिल सके।

सामरिक प्रभाव

लागत और बजट

वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।

स्पष्ट निर्णय

तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।

गुणवत्ता नियंत्रण

बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।

टेंसर कोर का भविष्य

टेन्सर कोर हमेशा से कम परिशुद्धता की ओर बढ़ते रहते हैं: हॉपर ने एफपी 8 जोड़ा और ब्लैकवेल ने हार्डवेयर-प्रबंधित स्केलिंग के साथ 4-बिट एफपी 4 पेश किया, जो अनुमान-भारी वर्कलोड के लिए प्रत्येक चरण में थ्रूपुट को लगभग दोगुना कर देता है। स्पार्सिटी (शून्य भार को छोड़कर) के लिए कड़े समर्थन की अपेक्षा करें, माइक्रोस्केलिंग प्रारूप जो संख्याओं के छोटे ब्लॉकों में स्केल कारकों को जोड़ते हैं, और मेमोरी सिस्टम के साथ गहन एकीकरण करते हैं ताकि कोर खिलाए रहें। जैसे-जैसे मॉडल बढ़ते हैं, मैट्रिक्स इंजन, कच्ची घड़ी की गति नहीं, एआई हार्डवेयर प्रदर्शन के लिए केंद्रीय युद्ध का मैदान बना हुआ है।

वास्तविक विश्व कार्यान्वयन

जीपीटी-शैली ट्रांसफार्मर जैसे बड़े भाषा मॉडल का प्रशिक्षण, जहां बीएफ16 या एफपी8 में टेन्सर कोर पर प्रति चरण अरबों मैट्रिक्स गुणन चलते हैं।

प्रति जीपीयू अधिक उपयोगकर्ताओं को सेवा प्रदान करने के लिए INT8 या FP8 परिमाणीकरण का उपयोग करके चैटबॉट और छवि जनरेटर के लिए वास्तविक समय अनुमान चलाना।

वीडियो गेम में NVIDIA DLSS को तेज करना, जहां एक तंत्रिका नेटवर्क प्रत्येक फ्रेम में टेन्सर कोर का उपयोग करके कम-रिज़ॉल्यूशन फ़्रेम को बढ़ाता है।

प्रोटीन-फोल्डिंग (अल्फाफोल्ड) और मौसम मॉडल जैसे वैज्ञानिक कंप्यूटिंग को तेज करना जिन्हें मैट्रिक्स-भारी तंत्रिका कार्यभार के रूप में पुन: तैयार किया गया है।

जोखिम और रेलिंग

एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।

बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।

जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।

कार्यान्वयन रोडमैप

1

कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।

2

यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।

3

त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।

4

स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tensor Cores quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

बड़े मॉडलों के लिए टेन्सर समांतरता

अक्सर पूछे जाने वाले प्रश्नों

What is Tensor Cores?

टेन्सर कोर आधुनिक NVIDIA GPU के अंदर विशेष हार्डवेयर इकाइयाँ हैं जो मैट्रिक्स मल्टीप्ल-एंड-एक्यूमुलेट ऑपरेशन को बहुत तेजी से निष्पादित करती हैं। वे मुख्य कारण हैं कि एक एकल जीपीयू बड़े तंत्रिका नेटवर्क को प्रशिक्षित कर सकता है और सामान्य प्रयोजन की गणना की तुलना में अधिक तेजी से चला सकता है।

टेन्सर कोर किस मुख्य गणितीय ऑपरेशन को गति देने के लिए विशेष रूप से डिज़ाइन किए गए हैं?

टेन्सर कोर एक चरण में फ़्यूज्ड मैट्रिक्स गुणन प्लस संचय करते हैं, जो वास्तव में वह ऑपरेशन है जो तंत्रिका नेटवर्क परतों पर हावी होता है।

किस NVIDIA GPU आर्किटेक्चर ने सबसे पहले Tensor Cores पेश किया?

Tensor Cores ने 2017 में वोल्टा आर्किटेक्चर के साथ शुरुआत की, जिसकी शुरुआत FP16 4x4 मैट्रिक्स ऑपरेशन से हुई।

टेन्सर कोर अक्सर एफपी16 या एफपी8 जैसी कम परिशुद्धता का उपयोग क्यों करते हैं?

प्रति संख्या कम बिट्स का उपयोग करने का मतलब है कि प्रत्येक चक्र में हार्डवेयर के माध्यम से अधिक मान प्रवाहित होते हैं, केवल एक छोटी, आमतौर पर सहनीय, सटीकता की हानि के साथ गति में काफी वृद्धि होती है।

सटीकता को संरक्षित करने के लिए, टेन्सर कोर आमतौर पर रनिंग योग (संचय) के लिए किस परिशुद्धता का उपयोग करते हैं?

इनपुट कम परिशुद्धता वाले हो सकते हैं, लेकिन संचायक आमतौर पर राउंडिंग त्रुटियों के निर्माण को सीमित करने के लिए FP32 जैसी उच्च परिशुद्धता में चलता है।

PyTorch जैसे रोजमर्रा के AI फ्रेमवर्क Tensor Cores का उपयोग कैसे करते हैं?

अंतर्निहित लाइब्रेरीज़ बड़े मैट्रिक्स संचालन को स्वचालित रूप से टेन्सर-कोर-आकार की टाइलों में तोड़ देती हैं, इसलिए फ्रेमवर्क को मैन्युअल कोडिंग के बिना स्पीडअप मिलता है।