ٹیکنیکل گائیڈ

ماڈل اور پائپ لائن متوازی

جب ایک ماڈل ایک GPU پر فٹ ہونے کے لیے بہت بڑا ہوتا ہے، تو ماڈل اور پائپ لائن کی ہم آہنگی ماڈل کو خود ہی آلات پر تقسیم کرتی ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

This is what makes training giant language models with hundreds of billions of parameters physically possible.

گہرا غوطہ

ماڈل متوازی ایک ماڈل کو متعدد GPUs میں تقسیم کرتا ہے لہذا کسی بھی ڈیوائس کو تمام وزن رکھنے کی ضرورت نہیں ہے۔ دو اہم ذائقے ہیں۔ ٹینسر (انٹرا لیئر) متوازی ریاضی کو ایک پرت کے اندر تقسیم کرتا ہے، جیسے GPUs میں ایک بڑے میٹرکس ضرب کو کاٹنا جو آؤٹ پٹ کے ہر حصے کی گنتی کرتا ہے۔ پائپ لائن (انٹر لیئر) متوازی مختلف GPUs کو لگاتار مختلف پرتوں کو تفویض کرتی ہے، لہذا پرت بلاک 1 GPU 0 پر رہتا ہے، GPU 1 پر بلاک 2، اور اسی طرح، ایکٹیویشنز کے ساتھ اسمبلی لائن کی طرح آگے بڑھتا ہے۔ بولی پائپ لائننگ کے ساتھ چیلنج 'بلبلا' ہے: جب کہ GPU 0 پہلے بیچ پر کام کرتا ہے، نیچے کی طرف GPUs بیکار رہتے ہیں۔ پائپ لائننگ ہر بیچ کو مائیکرو بیچوں میں تقسیم کرتی ہے تاکہ تمام مراحل مصروف رہیں، ڈرامائی طور پر استعمال میں بہتری آئے۔

تکنیکی بصیرت

ٹینسر کی ہم آہنگی (جیسا کہ NVIDIA Megatron-LM میں ہے) وزن میٹرکس کو کالم- یا قطار وار تقسیم کرتا ہے اور ایک تیز NVLink نوڈ کے اندر مواصلات کو برقرار رکھتے ہوئے، جزوی نتائج کو دوبارہ جوڑنے کے لیے آل کم کا استعمال کرتا ہے۔ پائپ لائن کی ہم آہنگی (GPipe، PipeDream) بیچ کو مائیکرو بیچوں میں تقسیم کرتی ہے جو ایک سٹگرڈ شیڈول میں مراحل سے گزرتی ہے، بیکار 'ببل' وقت کو سکڑتی ہے۔ دونوں کو اکثر ایک ساتھ پرتوں میں رکھا جاتا ہے، ایک نوڈ کے اندر ٹینسر کی متوازی اور نوڈس میں پائپ لائن کی ہم آہنگی کے ساتھ۔

اسٹریٹجک اثر

لاگت اور بجٹ

فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔

واضح فیصلے

تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔

کوالٹی کنٹرول

انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔

ماڈل اور پائپ لائن متوازی کا مستقبل

کمپیوٹ اور کمیونیکیشن کو متوازن کرنے کے لیے پروفائلنگ اور سرچ کا استعمال کرتے ہوئے، فریم ورکس تیزی سے یہ فیصلہ کرنے کے مشکل مسئلے کو خودکار بناتا ہے کہ ماڈل کو کس طرح ڈیوائسز میں تقسیم کیا جائے۔ ٹینسر، پائپ لائن، اور ڈیٹا متوازی (3D متوازی) کے سخت انضمام کی توقع کریں، پائپ لائن کے بلبلوں کو تقریباً ختم کرنے کے لیے بہتر مائیکرو بیچ شیڈولنگ، اور تیز تر آپس میں جڑے ہوئے ہارڈ ویئر کی توقع ہے تاکہ چپس پر ایک ہی پرت کو تقسیم کرنا ہمیشہ سے بڑے ماڈلز کے لیے سستا اور زیادہ معمول بن جاتا ہے۔

حقیقی دنیا کا نفاذ

NVIDIA Megatron-LM کے ساتھ GPT طرز کے ماڈلز کی تربیت، جو ہر ٹرانسفارمر پرت کی توجہ اور فیڈ فارورڈ میٹرکس کو GPUs میں ٹینسر متوازی کے ذریعے تقسیم کرتا ہے۔

GPipe کا استعمال ایک دیو ہیکل وژن یا لینگویج ماڈل کی مختلف تہوں کو الگ ایکسلریٹرز پر رکھنے کے لیے جبکہ مائیکرو بیچنگ انہیں مصروف رکھتی ہے۔

ڈیپ اسپیڈ کا پائپ لائن انجن ملٹی سو بلین پیرامیٹر ماڈل کو کئی نوڈس میں مراحل میں تقسیم کرتا ہے۔

ایک واحد 8-GPU سرور کے اندر ٹینسر متوازی کو یکجا کرنا پائپ لائن کے متوازی کے ساتھ ایک سے زیادہ سرورز پر پھیلا ہوا ماڈل کو تربیت دینے کے لیے ایک مشین کے لیے بہت بڑا ہے۔

خطرات اور گارڈریلز

ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔

بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔

سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔

نفاذ کا روڈ میپ

1

نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔

2

حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔

3

غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔

4

اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model and Pipeline Parallelism quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

بڑے ماڈلز کے لیے ٹینسر متوازی

اکثر پوچھے گئے سوالات

What is Model and Pipeline Parallelism?

جب ایک ماڈل ایک GPU پر فٹ ہونے کے لیے بہت بڑا ہوتا ہے، تو ماڈل اور پائپ لائن کی ہم آہنگی ماڈل کو خود ہی آلات پر تقسیم کرتی ہے۔ یہی وہ چیز ہے جس کی وجہ سے سیکڑوں اربوں پیرامیٹرز کے ساتھ دیوہیکل زبان کے ماڈلز کی تربیت جسمانی طور پر ممکن ہوتی ہے۔

ماڈل اور پائپ لائن کی ہم آہنگی کونسا بنیادی مسئلہ حل کرتی ہے؟

ماڈل اور پائپ لائن کی متوازی تقسیم ماڈل کو خود ہی آلات پر تقسیم کرتی ہے، جس سے کسی ایک GPU سے کہیں زیادہ بڑے نیٹ ورکس کی تربیت کو قابل بنایا جا سکتا ہے۔

ٹینسر (انٹرا لیئر) متوازی تقسیم کیسے کام کرتی ہے؟

ٹینسر متوازی حساب کو ایک پرت میں تقسیم کرتا ہے، مثال کے طور پر ایک بڑے وزن والے میٹرکس کو تقسیم کرنا تاکہ ہر GPU آؤٹ پٹ کے حصے کی گنتی کرے۔

بولی پائپ لائن کے متوازی میں 'بلبلا' کیا ہے؟

پائپ لائن کے ابتدائی مرحلے میں، نیچے دھارے کے مراحل میں ابھی تک کوئی ان پٹ نہیں ہے اور وہ بیکار بیٹھے ہیں، GPU کا وقت ضائع کرتے ہیں۔ اس بیکار خلا کو بلبلا کہا جاتا ہے۔

پائپ لائن متوازی بلبلے کو کیسے کم کرتی ہے؟

ایک بیچ کو مائیکرو بیچز میں تقسیم کرنے سے متعدد مائیکرو بیچز بیک وقت مختلف مراحل پر قبضہ کر سکتے ہیں، تمام GPUs کو مصروف رکھتے ہیں اور وقت کو سکڑتے ہیں۔

ٹینسر متوازی کو عام طور پر ایک نوڈ کے اندر کیوں رکھا جاتا ہے؟

جزوی میٹرکس کے نتائج کو دوبارہ جوڑنے کے لیے ٹینسر متوازی کثرت سے بات چیت کرتا ہے، اس لیے اسے NVLink کے اوپر ایک نوڈ کے اندر جہاں انٹرکنیکٹ بینڈوتھ سب سے زیادہ ہے وہاں رکھا جاتا ہے۔