तकनीकी गाइड

इनफिनीबैंड और आरडीएमए नेटवर्किंग

InfiniBand एक हाई-स्पीड, लो-लेटेंसी इंटरकनेक्ट है जो AI क्लस्टर में सर्वर और GPU को जोड़ता है, और RDMA एक मशीन को CPU को शामिल किए बिना दूसरे की मेमोरी को पढ़ने या लिखने की सुविधा देता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

Together they are the plumbing that keeps thousands of GPUs fed with data during large-model training.

गहरा गोता

जब आप किसी मॉडल को हजारों जीपीयू में प्रशिक्षित करते हैं, तो नेटवर्क अक्सर बाधा बन जाता है, चिप्स नहीं। InfiniBand इस प्रयोजन के लिए बनाया गया एक स्विच्ड फैब्रिक है: यह प्रति सेकंड सैकड़ों गीगाबिट्स (NDR 400 Gb/s पर चलता है) और माइक्रोसेकंड-स्केल विलंबता में प्रति-लिंक बैंडविड्थ प्रदान करता है। इसकी प्रमुख चाल रिमोट डायरेक्ट मेमोरी एक्सेस (आरडीएमए) है, जो सामान्य टीसीपी/आईपी को धीमा करने वाले ऑपरेटिंग-सिस्टम कर्नेल और सीपीयू प्रतियों को दरकिनार करते हुए डेटा को सीधे दो नोड्स की मेमोरी के बीच ले जाती है। यह 'कर्नेल बाईपास' सीपीयू चक्र को मुक्त करता है और विलंबता को कम करता है। InfiniBand दोषरहित फैब्रिक के लिए हार्डवेयर प्रवाह नियंत्रण भी प्रदान करता है, और NVIDIA के क्वांटम स्विच और कनेक्टएक्स एडाप्टर AI सुपर कंप्यूटर पर हावी हैं। RoCE (RDMA ओवर कन्वर्ज्ड ईथरनेट) ईथरनेट नेटवर्क पर समान RDMA लाभ लाता है।

तकनीकी अंतर्दृष्टि

आरडीएमए क्रियाओं और कतार युग्मों के माध्यम से काम करता है। एक एप्लिकेशन कतार भेजने और प्राप्त करने के लिए कार्य अनुरोध पोस्ट करता है; नेटवर्क एडाप्टर (एचसीए) उन्हें पढ़ता है और डेटा को सीधे दूरस्थ होस्ट पर पूर्व-पंजीकृत, पिन किए गए मेमोरी क्षेत्रों में स्थानांतरित करता है। क्योंकि एनआईसी हार्डवेयर में स्थानांतरण को संभालता है और ओएस कर्नेल को बायपास किया जाता है, शून्य डेटा प्रतियां होती हैं और बल्क ट्रांसफर के लिए कोई प्रति-पैकेट सीपीयू बाधित नहीं होता है। InfiniBand का लिंक-लेयर क्रेडिट-आधारित प्रवाह नियंत्रण बफर ओवरफ़्लो को रोकता है, जिससे कपड़े बिना किसी पुनर्संचरण तूफान के हानिरहित हो जाता है।

सामरिक प्रभाव

लागत और बजट

वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।

स्पष्ट निर्णय

तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।

गुणवत्ता नियंत्रण

बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।

InfiniBand और RDMA नेटवर्किंग का भविष्य

बैंडविड्थ चढ़ती रहती है: XDR InfiniBand प्रति लिंक 800 Gb/s का लक्ष्य रखता है, रोडमैप 1.6 Tb/s तक का है। प्रतिस्पर्धा तेज हो रही है क्योंकि अल्ट्रा ईथरनेट कंसोर्टियम ईथरनेट डिजाइन करता है जो एआई वर्कलोड के लिए इनफिनीबैंड से मेल खाता है, और इन-नेटवर्क कंप्यूटिंग (शार्प) सामूहिक गणित को स्वयं स्विच में लोड करता है। जैसे-जैसे फ्रंटियर मॉडल बढ़ते हैं, सख्त जीपीयू-टू-नेटवर्क एकीकरण, बिजली कटौती के लिए ऑप्टिकल इंटरकनेक्ट और सैकड़ों हजारों त्वरक के समूहों तक फैले फैब्रिक की अपेक्षा करें।

वास्तविक विश्व कार्यान्वयन

एआई सुपरकंप्यूटर में हजारों जीपीयू को कनेक्ट करना ताकि वितरित प्रशिक्षण के दौरान माइक्रोसेकंड में नोड्स के बीच ग्रेडिएंट डेटा स्थानांतरित हो सके

सीपीयू ओवरहेड के बिना वितरित फ़ाइल सिस्टम और डेटाबेस को तेज करने के लिए एक सर्वर को दूसरे की मेमोरी को सीधे पढ़ने (आरडीएमए) देना

GPU क्लस्टर में मॉडल भार को सिंक्रनाइज़ करने के लिए InfiniBand पर NCCL ऑल-रिड्यूस ऑपरेशन चलाना

मौजूदा ईथरनेट डेटा-सेंटर नेटवर्क में आरडीएमए-शैली कम-विलंबता स्थानांतरण लाने के लिए आरओसीई का उपयोग करना

जोखिम और रेलिंग

एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।

बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।

जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।

कार्यान्वयन रोडमैप

1

कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।

2

यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।

3

त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।

4

स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the InfiniBand and RDMA Networking quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

फ़ीचर इंजीनियरिंग पाइपलाइन और डेटा वर्जनिंग

अक्सर पूछे जाने वाले प्रश्नों

What is InfiniBand and RDMA Networking?

InfiniBand एक हाई-स्पीड, लो-लेटेंसी इंटरकनेक्ट है जो AI क्लस्टर में सर्वर और GPU को जोड़ता है, और RDMA एक मशीन को CPU को शामिल किए बिना दूसरे की मेमोरी को पढ़ने या लिखने की सुविधा देता है। साथ में वे प्लंबिंग हैं जो बड़े-मॉडल प्रशिक्षण के दौरान हजारों जीपीयू को डेटा से भरे रखते हैं।

आरडीएमए मूलतः एक कंप्यूटर को क्या करने की अनुमति देता है?

रिमोट डायरेक्ट मेमोरी एक्सेस ओएस कर्नेल और सीपीयू प्रतियों को दरकिनार करते हुए डेटा को सीधे दो नोड्स की मेमोरी के बीच ले जाता है, जो विलंबता को कम करता है और सीपीयू चक्र को मुक्त करता है।

InfiniBand सामान्य TCP/IP नेटवर्किंग की तुलना में बहुत कम विलंबता क्यों प्राप्त करता है?

InfiniBand एडेप्टर हार्डवेयर में पिन की गई मेमोरी से सीधे/से डेटा स्थानांतरित करते हैं और ओएस कर्नेल को बायपास करते हैं, जिससे प्रति-पैकेट सीपीयू व्यवधान और डेटा प्रतियां समाप्त हो जाती हैं।

NDR InfiniBand लगभग कितनी प्रति-लिंक बैंडविड्थ प्रदान करता है?

NDR (नेक्स्ट डेटा रेट) InfiniBand प्रति लिंक 400 Gb/s पर चलता है, XDR अगली पीढ़ी में 800 Gb/s का लक्ष्य रखता है।

आरडीएमए में, 'क्यू जोड़े' का उपयोग किसके लिए किया जाता है?

एप्लिकेशन कतारें (कतार जोड़े) भेजने और प्राप्त करने के लिए कार्य अनुरोध पोस्ट करते हैं; होस्ट चैनल एडाप्टर उन्हें पढ़ता है और सीधे मेमोरी ट्रांसफर करता है।

आरओसीई क्या है?

RoCE का अर्थ कन्वर्ज्ड ईथरनेट पर RDMA है, जो मूल InfiniBand के बजाय मानक ईथरनेट फैब्रिक पर कम-विलंबता, कर्नेल-बाईपास स्थानांतरण की अनुमति देता है।