InfiniBand اور RDMA نیٹ ورکنگ
InfiniBand ایک تیز رفتار، کم لیٹنسی انٹرکنیکٹ ہے جو AI کلسٹرز میں سرورز اور GPUs کو جوڑتا ہے، اور RDMA ایک مشین کو CPU کو شامل کیے بغیر دوسری مشین کو پڑھنے یا لکھنے دیتا ہے۔
جائزہ
Together they are the plumbing that keeps thousands of GPUs fed with data during large-model training.
گہرا غوطہ
جب آپ ہزاروں GPUs میں ایک ماڈل کو تربیت دیتے ہیں، تو نیٹ ورک اکثر رکاوٹ بن جاتا ہے، چپس نہیں۔ InfiniBand ایک سوئچڈ فیبرک ہے جس کے مقصد سے بنایا گیا ہے: یہ سینکڑوں گیگا بٹس فی سیکنڈ میں فی لنک بینڈوتھ پیش کرتا ہے (NDR 400 Gb/s پر چلتا ہے) اور مائیکرو سیکنڈ اسکیل لیٹنسی۔ اس کی کلیدی چال ریموٹ ڈائریکٹ میموری ایکسیس (RDMA) ہے، جو ڈیٹا کو براہ راست دو نوڈس کی میموری کے درمیان منتقل کرتی ہے، آپریٹنگ سسٹم کرنل اور CPU کاپیوں کو نظرانداز کرتے ہوئے جو عام TCP/IP کو سست کرتی ہے۔ یہ 'کرنل بائی پاس' CPU سائیکلوں کو آزاد کرتا ہے اور تاخیر کو کم کرتا ہے۔ InfiniBand بغیر کسی نقصان کے تانے بانے کے لیے ہارڈویئر فلو کنٹرول بھی فراہم کرتا ہے، اور NVIDIA کے Quantum سوئچ کے علاوہ ConnectX اڈاپٹر AI سپر کمپیوٹرز پر حاوی ہیں۔ RoCE (آر ڈی ایم اے اوور کنورجڈ ایتھرنیٹ) ایتھرنیٹ نیٹ ورکس کے لیے اسی طرح کے RDMA فوائد لاتا ہے۔
تکنیکی بصیرت
RDMA فعل اور قطار کے جوڑوں کے ذریعے کام کرتا ہے۔ ایک درخواست قطار بھیجنے اور وصول کرنے کے لیے کام کی درخواستیں پوسٹ کرتی ہے۔ نیٹ ورک اڈاپٹر (HCA) انہیں پڑھتا ہے اور ڈیٹا کو براہ راست پہلے سے رجسٹرڈ، ریموٹ ہوسٹ پر پن کی ہوئی میموری والے علاقوں میں منتقل کرتا ہے۔ چونکہ NIC ہارڈ ویئر میں منتقلی کو ہینڈل کرتا ہے اور OS کرنل کو نظرانداز کیا جاتا ہے، اس لیے ڈیٹا کی صفر کاپیاں ہیں اور بلک ٹرانسفر کے لیے کوئی فی پیکٹ CPU مداخلت نہیں کرتا۔ InfiniBand کا لنک لیئر کریڈٹ پر مبنی بہاؤ کنٹرول بفر اوور فلو کو روکتا ہے، جس سے تانے بانے کو دوبارہ منتقلی کے طوفانوں کے بغیر نقصان سے بچاتا ہے۔
اسٹریٹجک اثر
لاگت اور بجٹ
فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔
واضح فیصلے
تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔
کوالٹی کنٹرول
انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔
انفینی بینڈ اور آر ڈی ایم اے نیٹ ورکنگ کا مستقبل
بینڈوڈتھ چڑھتی رہتی ہے: XDR InfiniBand کا ہدف 800 Gb/s فی لنک ہے، روڈ میپس کے ساتھ 1.6 Tb/s کی طرف۔ الٹرا ایتھرنیٹ کنسورشیم ایتھرنیٹ کو ڈیزائن کرتا ہے جو کہ AI کام کے بوجھ کے لیے InfiniBand سے مماثل ہے، اور ان نیٹ ورک کمپیوٹنگ (SHARP) کے طور پر سوئچز میں اجتماعی ریاضی کو آف لوڈ کرنے کے ساتھ مقابلے میں شدت آتی جا رہی ہے۔ سخت جی پی یو ٹو نیٹ ورک انضمام، پاور کو کم کرنے کے لیے آپٹیکل انٹر کنیکٹس، اور فرنٹیئر ماڈلز کے بڑھنے کے ساتھ ساتھ لاکھوں ایکسلریٹروں کے کلسٹرز تک پھیلے ہوئے کپڑے کی توقع کریں۔
حقیقی دنیا کا نفاذ
ایک AI سپر کمپیوٹر میں ہزاروں GPUs کو جوڑنا تاکہ تقسیم شدہ تربیت کے دوران مائیکرو سیکنڈ میں نوڈس کے درمیان گریڈینٹ ڈیٹا منتقل ہو جائے۔
تقسیم شدہ فائل سسٹمز اور ڈیٹا بیس کو بغیر CPU کے اوور ہیڈ کے تیز کرنے کے لیے ایک سرور کو دوسرے کی میموری کو براہ راست پڑھنے دینا
پورے GPU کلسٹر میں ماڈل کے وزن کو ہم آہنگ کرنے کے لیے InfiniBand پر NCCL کے آل ریڈو آپریشنز چلانا
موجودہ ایتھرنیٹ ڈیٹا سینٹر نیٹ ورکس پر RDMA طرز کی کم تاخیر کی منتقلی لانے کے لیے RoCE کا استعمال
خطرات اور گارڈریلز
ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔
بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔
سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔
نفاذ کا روڈ میپ
نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔
حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔
غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔
اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the InfiniBand and RDMA Networking quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
فیچر انجینئرنگ پائپ لائنز اور ڈیٹا ورژننگ
اکثر پوچھے گئے سوالات
What is InfiniBand and RDMA Networking?
InfiniBand ایک تیز رفتار، کم لیٹنسی انٹرکنیکٹ ہے جو AI کلسٹرز میں سرورز اور GPUs کو جوڑتا ہے، اور RDMA ایک مشین کو CPU کو شامل کیے بغیر دوسری مشین کو پڑھنے یا لکھنے دیتا ہے۔ وہ ایک ساتھ مل کر وہ پلمبنگ ہیں جو بڑے ماڈل کی تربیت کے دوران ہزاروں GPUs کو ڈیٹا فراہم کرتی ہے۔
RDMA بنیادی طور پر ایک کمپیوٹر کو کیا کرنے دیتا ہے؟
ریموٹ ڈائریکٹ میموری ایکسس ڈیٹا کو دو نوڈس کی میموری کے درمیان سیدھا منتقل کرتا ہے، OS کرنل اور CPU کاپیوں کو نظرانداز کرتے ہوئے، جو تاخیر کو کم کرتا ہے اور CPU سائیکلوں کو آزاد کرتا ہے۔
InfiniBand عام TCP/IP نیٹ ورکنگ سے بہت کم تاخیر کیوں حاصل کرتا ہے؟
InfiniBand اڈاپٹر ڈیٹا کو براہ راست ہارڈ ویئر میں پن کی گئی میموری میں منتقل کرتے ہیں اور OS کرنل کو نظرانداز کرتے ہیں، فی پیکٹ CPU رکاوٹوں اور ڈیٹا کاپیوں کو ختم کرتے ہیں۔
NDR InfiniBand تقریباً کیا فی لنک بینڈوتھ فراہم کرتا ہے؟
NDR (اگلا ڈیٹا ریٹ) InfiniBand 400 Gb/s فی لنک پر چلتا ہے، XDR اگلی نسل میں 800 Gb/s کو نشانہ بناتا ہے۔
RDMA میں، 'قطار کے جوڑے' کس کے لیے استعمال ہوتے ہیں؟
درخواستیں قطار بھیجنے اور وصول کرنے کے لیے کام کی درخواستوں کے بعد (قطار کے جوڑے)؛ میزبان چینل اڈاپٹر انہیں پڑھتا ہے اور براہ راست میموری کی منتقلی کرتا ہے۔
RoCE کیا ہے؟
RoCE کا مطلب ہے RDMA اوور کنورجڈ ایتھرنیٹ، مقامی InfiniBand کی بجائے معیاری ایتھرنیٹ فیبرکس پر کم تاخیر، کرنل بائی پاس منتقلی کی اجازت دیتا ہے۔