पूरी तरह से साझा डेटा समानांतर
फुल्ली शेयर्ड डेटा पैरेलल (एफएसडीपी) एक वितरित प्रशिक्षण तकनीक है जो एक मॉडल के मापदंडों, ग्रेडिएंट्स और ऑप्टिमाइज़र राज्यों को कई जीपीयू में विभाजित करती है ताकि प्रत्येक डिवाइस में केवल एक स्लाइस हो।
सिंहावलोकन
यह हार्डवेयर पर विशाल मॉडल का प्रशिक्षण संभव बनाता है जो कभी भी पूरे मॉडल को एक GPU की मेमोरी में फिट नहीं कर सकता है।
गहरा गोता
पारंपरिक डेटा समानता प्रत्येक जीपीयू पर मॉडल की एक पूरी प्रतिलिपि रखती है, जो मेमोरी को बर्बाद करती है और मॉडल आकार को कैप करती है। FSDP, Meta के PyTorch द्वारा लोकप्रिय और Microsoft के ZeRO से प्रेरित, इसके बजाय सभी डिवाइसों में तीन चीज़ों को विभाजित करता है: पैरामीटर, ग्रेडिएंट और ऑप्टिमाइज़र स्थिति। फॉरवर्ड पास के दौरान, प्रत्येक जीपीयू अस्थायी रूप से उस परत के लिए पूर्ण भार इकट्ठा करता है जिसकी वह ऑल-गैदर के माध्यम से गणना कर रहा है, गणना चलाता है, फिर एकत्रित कॉपी को तुरंत मुक्त कर देता है। बैकवर्ड पास समान रूप से काम करता है, इसके बाद एक रिड्यूस-स्कैटर होता है जो ग्रेडिएंट स्लाइस को उनके अपने जीपीयू में वापस वितरित करता है। क्योंकि प्रत्येक डिवाइस केवल मॉडल के एक अंश को स्थायी रूप से संग्रहीत करता है, मेमोरी उपयोग जीपीयू की संख्या के साथ लगभग रैखिक रूप से गिरता है, जिससे टीमों को दसियों या सैकड़ों अरबों मापदंडों के साथ मॉडल को प्रशिक्षित करने की सुविधा मिलती है।
तकनीकी अंतर्दृष्टि
एफएसडीपी मेमोरी बचत के लिए अतिरिक्त संचार का व्यापार करता है। प्रत्येक परत के वजन को उपयोग से ठीक पहले मांग के आधार पर पुनर्निर्माण किया जाता है और ठीक बाद में हटा दिया जाता है, जबकि ग्रेडिएंट को कम-स्कैटर के साथ संयोजित और विभाजित किया जाता है। वर्तमान परत के चलने के दौरान अगली परत के मापदंडों को प्रीफ़ेच करके संचार को गणना के साथ ओवरलैप किया जा सकता है, जिससे नेटवर्क विलंबता का अधिकांश भाग छिप जाता है। शार्डिंग ग्रैन्युलैरिटी (रैपिंग पॉलिसी) को ट्यून करना संचार ओवरहेड के विरुद्ध मेमोरी फ़ुटप्रिंट को संतुलित करता है।
सामरिक प्रभाव
लागत और बजट
वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।
स्पष्ट निर्णय
तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।
गुणवत्ता नियंत्रण
बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।
पूरी तरह से साझा डेटा समानांतर का भविष्य
FSDP खुले बड़े-मॉडल प्रशिक्षण के लिए डिफ़ॉल्ट बन रहा है, PyTorch में FSDP2 प्रयोज्यता और प्रति-पैरामीटर शार्डिंग में सुधार कर रहा है। ट्रिलियन-पैरामीटर मॉडल के लिए टेंसर और पाइपलाइन समानता के साथ सख्त एकीकरण, मिश्रित परिशुद्धता और एफपी8 के लिए बेहतर समर्थन और स्मार्ट स्वचालित रैपिंग की अपेक्षा करें जो आपके लिए शार्डिंग सीमाएं चुनता है। जैसे-जैसे NVLink और InfiniBand जैसे इंटर-जीपीयू इंटरकनेक्ट तेज़ होते जाते हैं, शार्डिंग की संचार लागत कम होती जाती है, जिससे यह बड़े पैमाने पर व्यावहारिक हो जाती है।
वास्तविक विश्व कार्यान्वयन
8 जीपीयू में 70-बिलियन-पैरामीटर लामा मॉडल को फाइन-ट्यूनिंग करना जो व्यक्तिगत रूप से पूरा वजन नहीं पकड़ सकता है।
सैकड़ों त्वरक में ऑप्टिमाइज़र राज्यों (जो एडम के साथ मेमोरी पर हावी हैं) को शार्प करके एआई प्रयोगशालाओं में बड़े भाषा मॉडल को पूर्व-प्रशिक्षित करना।
प्रमुख 80 जीबी जीपीयू खरीदे बिना विश्वविद्यालय क्लस्टर पर विज़न ट्रांसफार्मर को प्रशिक्षित करने के लिए शोधकर्ता PyTorch के FSDP रैपर का उपयोग कर रहे हैं।
एफएसडीपी को मिश्रित-परिशुद्धता bfloat16 के साथ जोड़कर मेमोरी को लगभग आधा कर दिया गया है और मल्टीमॉडल मॉडल पर प्रशिक्षण थ्रूपुट को गति दी गई है।
जोखिम और रेलिंग
एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।
बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।
जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।
कार्यान्वयन रोडमैप
कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।
यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।
त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।
स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Fully Sharded Data Parallel quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
डेटा समांतरता
अक्सर पूछे जाने वाले प्रश्नों
पूरी तरह से शार्डेड डेटा समानांतर क्या है?
फुल्ली शेयर्ड डेटा पैरेलल (एफएसडीपी) एक वितरित प्रशिक्षण तकनीक है जो एक मॉडल के मापदंडों, ग्रेडिएंट्स और ऑप्टिमाइज़र राज्यों को कई जीपीयू में विभाजित करती है ताकि प्रत्येक डिवाइस में केवल एक स्लाइस हो। यह हार्डवेयर पर विशाल मॉडलों का प्रशिक्षण संभव बनाता है जो कभी भी पूरे मॉडल को एक जीपीयू की मेमोरी में फिट नहीं कर सकते।
एफएसडीपी जीपीयू पर क्या प्रभाव डालता है जो मानक डेटा समानता नहीं करता है?
एफएसडीपी सभी डिवाइसों में मॉडल के मापदंडों, ग्रेडिएंट्स और ऑप्टिमाइज़र स्थितियों को विभाजित करता है, जबकि मानक डेटा समानता प्रत्येक जीपीयू पर पूर्ण मॉडल को दोहराती है।
किसी परत की गणना करने से ठीक पहले उसके पूर्ण भार का पुनर्निर्माण करने के लिए एफएसडीपी किस सामूहिक ऑपरेशन का उपयोग करता है?
एक परत चलने से पहले, एफएसडीपी सभी शार्क से अस्थायी रूप से पूर्ण मापदंडों को इकट्ठा करने के लिए एक ऑल-इकट्ठा करता है, फिर बाद में उन्हें मुक्त कर देता है।
एफएसडीपी एक परत की गणना के तुरंत बाद एकत्रित पूर्ण वजन को मुक्त क्यों कर देता है?
केवल एक टुकड़े को स्थायी रूप से पकड़ना और क्षणिक रूप से पूरा वजन इकट्ठा करना, मेमोरी उपयोग को कम रखता है और मॉडल के एक अंश के लगभग आनुपातिक होता है।
एफएसडीपी काफी हद तक किस पूर्ववर्ती मेमोरी-ऑप्टिमाइज़ेशन दृष्टिकोण से प्रेरित था?
एफएसडीपी के पैरामीटर्स, ग्रेडिएंट्स और ऑप्टिमाइज़र स्थितियों की शार्डिंग डीपस्पीड लाइब्रेरी से Microsoft के ज़ीरो में पेश किए गए विचारों का बारीकी से अनुसरण करती है।
एफएसडीपी नेटवर्क विलंबता के अधिकांश भाग को भार एकत्रित करने से कैसे छुपाता है?
एफएसडीपी अगली परत के मापदंडों को प्रीफ़ेच करता है जबकि वर्तमान परत अभी भी कंप्यूटिंग कर रही है, उपयोगी कार्य के साथ सभी-संचार संचार को ओवरलैप कर रही है।