बड़े मॉडलों के लिए टेन्सर समांतरता
एक एकल तंत्रिका-नेटवर्क परत के अंदर गणित को कई जीपीयू में विभाजित करने का एक तरीका ताकि एक डिवाइस के लिए बहुत बड़ा मॉडल अभी भी चल सके।
सिंहावलोकन
It matters because frontier models have hundreds of billions of parameters that no single GPU can hold or compute fast enough alone.
गहरा गोता
टेन्सर पैरेललिज्म (जिसे इंट्रा-लेयर मॉडल पैरेललिज्म भी कहा जाता है) अलग-अलग डिवाइस पर पूरी परतें लगाने के बजाय जीपीयू में अलग-अलग वेट मैट्रिसेस को विभाजित करता है। एक ट्रांसफार्मर में, बड़े मैट्रिक्स गुणन-ध्यान अनुमान और फ़ीड-फ़ॉरवर्ड एमएलपी-विभाजित होते हैं: उदाहरण के लिए, एमएलपी का पहला वजन मैट्रिक्स कॉलम द्वारा और दूसरा पंक्तियों द्वारा विभाजित होता है, इसलिए प्रत्येक जीपीयू एक स्लाइस की गणना करता है और एक ऑल-रिड्यूस परिणामों को जोड़ता है। ध्यान सभी पक्षों पर बंटा हुआ है, प्रत्येक जीपीयू एक सबसेट को संभालता है। क्योंकि प्रत्येक जीपीयू प्रत्येक परत का एक हिस्सा एक साथ करता है, टेंसर समानता प्रति-जीपीयू मेमोरी को कम करती है और गणना को गति देती है, लेकिन यह प्रत्येक परत जीपीयू के बीच लगातार, उच्च-बैंडविड्थ संचार की मांग करती है। यही कारण है कि यह आम तौर पर एनवीलिंक द्वारा जुड़े नोड के भीतर सीमित होता है, और बहुत बड़े प्रशिक्षण और सेवारत नौकरियों के लिए पाइपलाइन और डेटा समानता के साथ संयुक्त होता है।
तकनीकी अंतर्दृष्टि
मेगेट्रॉन-एलएम द्वारा लोकप्रिय ट्रिक, विभाजन आयामों को चुन रही है ताकि संचार न्यूनतम हो। पहले एमएलपी मैट्रिक्स को कॉलम-वार विभाजित करने से प्रत्येक जीपीयू बिना किसी सिंक के स्थानीय रूप से गैर-रैखिकता लागू कर सकता है; दूसरी पंक्ति को अलग-अलग विभाजित करने का मतलब है कि आउटपुट को केवल आंशिक परिणामों को कम करने के लिए एक ऑल-रिड्यूस की आवश्यकता है। इस प्रकार प्रत्येक परत में लगभग दो ऑल-रिड्यूस (आगे) और दो (पीछे) होते हैं। क्योंकि ये सामूहिकता हर परत में होती है, विलंबता हावी होती है - इसलिए टेंसर समानता धीमे इंटर-नोड नेटवर्क के बजाय एनवीलिंक जैसे तेज़ इंट्रा-नोड लिंक के पीछे रहती है।
सामरिक प्रभाव
लागत और बजट
वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।
स्पष्ट निर्णय
तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।
गुणवत्ता नियंत्रण
बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।
बड़े मॉडलों के लिए टेन्सर समानांतरवाद का भविष्य
टेन्सर समांतरता मूलभूत बनी हुई है, लेकिन इसे तेजी से '3डी समांतरता' (टेंसर + पाइपलाइन + डेटा) में मिश्रित किया जाता है और मिश्रण-विशेषज्ञ मॉडल के लिए विशेषज्ञ समांतरता के साथ जोड़ा जाता है। मेगेट्रॉन-एलएम, डीपस्पीड और वीएलएलएम जैसे फ्रेमवर्क शार्डिंग को स्वचालित करते हैं। जैसे-जैसे GPU इंटरकनेक्ट (NVLink, NVSwitch) और ऑप्टिकल फैब्रिक तेज़ होते जाते हैं, नोड-सीमा सीमा शिथिल होती जाती है, जिससे व्यापक टेंसर-समानांतर समूहों की अनुमति मिलती है। बेहतर ऑटो-समानांतरीकरण की अपेक्षा करें जो किसी दिए गए क्लस्टर टोपोलॉजी के लिए संचार को कम करने के लिए शार्ड आयाम और समूह आकार चुनता है।
वास्तविक विश्व कार्यान्वयन
मेगेट्रॉन-एलएम का उपयोग करके एक एनवीलिंक-कनेक्टेड नोड में 8 जीपीयू में प्रत्येक परत के वजन मैट्रिक्स को विभाजित करके 175बी-पैरामीटर मॉडल का प्रशिक्षण।
vLLM में Tensor_parallel_size=4 के साथ 70B-पैरामीटर चैट मॉडल पेश करना ताकि वज़न चार GPU में फिट हो और वास्तविक समय में प्रतिक्रिया दे सके।
ट्रांसफॉर्मर का ध्यान जीपीयू में विभाजित करना ताकि प्रत्येक डिवाइस एक सबसेट की गणना कर सके, फिर अगली परत के लिए आउटपुट को संयोजित कर सके।
बड़े जीपीयू क्लस्टर पर ट्रिलियन-पैरामीटर मॉडल को प्रशिक्षित करने के लिए नोड्स के भीतर टेंसर समानता और नोड्स में पाइपलाइन समानता का संयोजन।
जोखिम और रेलिंग
एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।
बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।
जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।
कार्यान्वयन रोडमैप
कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।
यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।
त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।
स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tensor Parallelism for Large Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
मॉडल और पाइपलाइन समानता
अक्सर पूछे जाने वाले प्रश्नों
What is Tensor Parallelism for Large Models?
एक एकल तंत्रिका-नेटवर्क परत के अंदर गणित को कई जीपीयू में विभाजित करने का एक तरीका ताकि एक डिवाइस के लिए बहुत बड़ा मॉडल अभी भी चल सके। यह मायने रखता है क्योंकि फ्रंटियर मॉडल में सैकड़ों अरब पैरामीटर होते हैं जिन्हें कोई भी जीपीयू अकेले पकड़ या तेज़ गति से गणना नहीं कर सकता है।
टेन्सर समांतरता जीपीयू में क्या विभाजित करती है?
टेन्सर (इंट्रा-लेयर) समानता एक परत के अंदर वजन मैट्रिक्स को विभाजित करती है, इसलिए प्रत्येक जीपीयू एक ही परत के हिस्से की गणना करता है - पाइपलाइन समानता से अलग, जो पूरी परतों को अलग-अलग जीपीयू पर रखता है।
मेगेट्रॉन-शैली एमएलपी विभाजन में, संचार को कम करने के लिए दो वजन मैट्रिक्स को कैसे विभाजित किया जाता है?
पहले मैट्रिक्स को कॉलम द्वारा विभाजित करने से प्रत्येक जीपीयू स्थानीय रूप से गैर-रैखिकता लागू कर सकता है; पंक्तियों द्वारा दूसरे को विभाजित करने का अर्थ है आंशिक आउटपुट के योग को एक एकल-कम करना - सिंक्रनाइज़ेशन को कम करना।
टेन्सर समानता को आमतौर पर एक ही नोड के भीतर क्यों रखा जाता है?
प्रत्येक परत सामूहिक संचार (ऑल-रिड्यूस) को ट्रिगर करती है, इसलिए भारी, विलंबता-संवेदनशील ट्रैफ़िक धीमे इंटर-नोड नेटवर्क के बजाय एनवीलिंक जैसे तेज़ इंट्रा-नोड लिंक की मांग करता है।
टेंसर समानता के तहत ध्यान तंत्र को आम तौर पर कैसे समानांतर किया जाता है?
ध्यान शीर्ष स्वतंत्र हैं, इसलिए उन्हें जीपीयू में वितरित किया जाता है - प्रत्येक डिवाइस कुछ शीर्षों की गणना करता है और आउटपुट संयुक्त होते हैं।
कौन सा सामूहिक ऑपरेशन आमतौर पर टेन्सर समानता में आंशिक परिणामों को जोड़ता है?
प्रत्येक जीपीयू पर गणना किए गए आंशिक आउटपुट को ऑल-रिड्यूस करें ताकि वे परत के परिणाम पर सहमत हों; ऐसा आगे और पीछे के मार्ग में प्रति परत कई बार होता है।