तकनीकी गाइड

बड़े मॉडलों के लिए टेन्सर समांतरता

एक एकल तंत्रिका-नेटवर्क परत के अंदर गणित को कई जीपीयू में विभाजित करने का एक तरीका ताकि एक डिवाइस के लिए बहुत बड़ा मॉडल अभी भी चल सके।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It matters because frontier models have hundreds of billions of parameters that no single GPU can hold or compute fast enough alone.

गहरा गोता

टेन्सर पैरेललिज्म (जिसे इंट्रा-लेयर मॉडल पैरेललिज्म भी कहा जाता है) अलग-अलग डिवाइस पर पूरी परतें लगाने के बजाय जीपीयू में अलग-अलग वेट मैट्रिसेस को विभाजित करता है। एक ट्रांसफार्मर में, बड़े मैट्रिक्स गुणन-ध्यान अनुमान और फ़ीड-फ़ॉरवर्ड एमएलपी-विभाजित होते हैं: उदाहरण के लिए, एमएलपी का पहला वजन मैट्रिक्स कॉलम द्वारा और दूसरा पंक्तियों द्वारा विभाजित होता है, इसलिए प्रत्येक जीपीयू एक स्लाइस की गणना करता है और एक ऑल-रिड्यूस परिणामों को जोड़ता है। ध्यान सभी पक्षों पर बंटा हुआ है, प्रत्येक जीपीयू एक सबसेट को संभालता है। क्योंकि प्रत्येक जीपीयू प्रत्येक परत का एक हिस्सा एक साथ करता है, टेंसर समानता प्रति-जीपीयू मेमोरी को कम करती है और गणना को गति देती है, लेकिन यह प्रत्येक परत जीपीयू के बीच लगातार, उच्च-बैंडविड्थ संचार की मांग करती है। यही कारण है कि यह आम तौर पर एनवीलिंक द्वारा जुड़े नोड के भीतर सीमित होता है, और बहुत बड़े प्रशिक्षण और सेवारत नौकरियों के लिए पाइपलाइन और डेटा समानता के साथ संयुक्त होता है।

तकनीकी अंतर्दृष्टि

मेगेट्रॉन-एलएम द्वारा लोकप्रिय ट्रिक, विभाजन आयामों को चुन रही है ताकि संचार न्यूनतम हो। पहले एमएलपी मैट्रिक्स को कॉलम-वार विभाजित करने से प्रत्येक जीपीयू बिना किसी सिंक के स्थानीय रूप से गैर-रैखिकता लागू कर सकता है; दूसरी पंक्ति को अलग-अलग विभाजित करने का मतलब है कि आउटपुट को केवल आंशिक परिणामों को कम करने के लिए एक ऑल-रिड्यूस की आवश्यकता है। इस प्रकार प्रत्येक परत में लगभग दो ऑल-रिड्यूस (आगे) और दो (पीछे) होते हैं। क्योंकि ये सामूहिकता हर परत में होती है, विलंबता हावी होती है - इसलिए टेंसर समानता धीमे इंटर-नोड नेटवर्क के बजाय एनवीलिंक जैसे तेज़ इंट्रा-नोड लिंक के पीछे रहती है।

सामरिक प्रभाव

लागत और बजट

वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।

स्पष्ट निर्णय

तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।

गुणवत्ता नियंत्रण

बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।

बड़े मॉडलों के लिए टेन्सर समानांतरवाद का भविष्य

टेन्सर समांतरता मूलभूत बनी हुई है, लेकिन इसे तेजी से '3डी समांतरता' (टेंसर + पाइपलाइन + डेटा) में मिश्रित किया जाता है और मिश्रण-विशेषज्ञ मॉडल के लिए विशेषज्ञ समांतरता के साथ जोड़ा जाता है। मेगेट्रॉन-एलएम, डीपस्पीड और वीएलएलएम जैसे फ्रेमवर्क शार्डिंग को स्वचालित करते हैं। जैसे-जैसे GPU इंटरकनेक्ट (NVLink, NVSwitch) और ऑप्टिकल फैब्रिक तेज़ होते जाते हैं, नोड-सीमा सीमा शिथिल होती जाती है, जिससे व्यापक टेंसर-समानांतर समूहों की अनुमति मिलती है। बेहतर ऑटो-समानांतरीकरण की अपेक्षा करें जो किसी दिए गए क्लस्टर टोपोलॉजी के लिए संचार को कम करने के लिए शार्ड आयाम और समूह आकार चुनता है।

वास्तविक विश्व कार्यान्वयन

मेगेट्रॉन-एलएम का उपयोग करके एक एनवीलिंक-कनेक्टेड नोड में 8 जीपीयू में प्रत्येक परत के वजन मैट्रिक्स को विभाजित करके 175बी-पैरामीटर मॉडल का प्रशिक्षण।

vLLM में Tensor_parallel_size=4 के साथ 70B-पैरामीटर चैट मॉडल पेश करना ताकि वज़न चार GPU में फिट हो और वास्तविक समय में प्रतिक्रिया दे सके।

ट्रांसफॉर्मर का ध्यान जीपीयू में विभाजित करना ताकि प्रत्येक डिवाइस एक सबसेट की गणना कर सके, फिर अगली परत के लिए आउटपुट को संयोजित कर सके।

बड़े जीपीयू क्लस्टर पर ट्रिलियन-पैरामीटर मॉडल को प्रशिक्षित करने के लिए नोड्स के भीतर टेंसर समानता और नोड्स में पाइपलाइन समानता का संयोजन।

जोखिम और रेलिंग

एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।

बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।

जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।

कार्यान्वयन रोडमैप

1

कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।

2

यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।

3

त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।

4

स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tensor Parallelism for Large Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

मॉडल और पाइपलाइन समानता

अक्सर पूछे जाने वाले प्रश्नों

What is Tensor Parallelism for Large Models?

एक एकल तंत्रिका-नेटवर्क परत के अंदर गणित को कई जीपीयू में विभाजित करने का एक तरीका ताकि एक डिवाइस के लिए बहुत बड़ा मॉडल अभी भी चल सके। यह मायने रखता है क्योंकि फ्रंटियर मॉडल में सैकड़ों अरब पैरामीटर होते हैं जिन्हें कोई भी जीपीयू अकेले पकड़ या तेज़ गति से गणना नहीं कर सकता है।

टेन्सर समांतरता जीपीयू में क्या विभाजित करती है?

टेन्सर (इंट्रा-लेयर) समानता एक परत के अंदर वजन मैट्रिक्स को विभाजित करती है, इसलिए प्रत्येक जीपीयू एक ही परत के हिस्से की गणना करता है - पाइपलाइन समानता से अलग, जो पूरी परतों को अलग-अलग जीपीयू पर रखता है।

मेगेट्रॉन-शैली एमएलपी विभाजन में, संचार को कम करने के लिए दो वजन मैट्रिक्स को कैसे विभाजित किया जाता है?

पहले मैट्रिक्स को कॉलम द्वारा विभाजित करने से प्रत्येक जीपीयू स्थानीय रूप से गैर-रैखिकता लागू कर सकता है; पंक्तियों द्वारा दूसरे को विभाजित करने का अर्थ है आंशिक आउटपुट के योग को एक एकल-कम करना - सिंक्रनाइज़ेशन को कम करना।

टेन्सर समानता को आमतौर पर एक ही नोड के भीतर क्यों रखा जाता है?

प्रत्येक परत सामूहिक संचार (ऑल-रिड्यूस) को ट्रिगर करती है, इसलिए भारी, विलंबता-संवेदनशील ट्रैफ़िक धीमे इंटर-नोड नेटवर्क के बजाय एनवीलिंक जैसे तेज़ इंट्रा-नोड लिंक की मांग करता है।

टेंसर समानता के तहत ध्यान तंत्र को आम तौर पर कैसे समानांतर किया जाता है?

ध्यान शीर्ष स्वतंत्र हैं, इसलिए उन्हें जीपीयू में वितरित किया जाता है - प्रत्येक डिवाइस कुछ शीर्षों की गणना करता है और आउटपुट संयुक्त होते हैं।

कौन सा सामूहिक ऑपरेशन आमतौर पर टेन्सर समानता में आंशिक परिणामों को जोड़ता है?

प्रत्येक जीपीयू पर गणना किए गए आंशिक आउटपुट को ऑल-रिड्यूस करें ताकि वे परत के परिणाम पर सहमत हों; ऐसा आगे और पीछे के मार्ग में प्रति परत कई बार होता है।