ٹیکنیکل گائیڈ

بڑے ماڈلز کے لیے ٹینسر متوازی

متعدد GPUs میں ایک واحد نیورل نیٹ ورک پرت کے اندر ریاضی کو تقسیم کرنے کا ایک طریقہ تاکہ ایک ڈیوائس کے لیے بہت بڑا ماڈل اب بھی چل سکے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It matters because frontier models have hundreds of billions of parameters that no single GPU can hold or compute fast enough alone.

گہرا غوطہ

ٹینسر متوازی (جسے انٹرا لیئر ماڈل متوازی بھی کہا جاتا ہے) الگ الگ ڈیوائسز پر پوری تہوں کو لگانے کے بجائے GPUs میں انفرادی وزن کے میٹرکس کو شارڈ کرتا ہے۔ ایک ٹرانسفارمر میں، بڑے میٹرکس کی ضربیں — توجہ دینے کے تخمینے اور فیڈ فارورڈ MLP — کو تقسیم کیا جاتا ہے: مثال کے طور پر، MLP کا پہلا وزن میٹرکس کالموں کے ذریعے اور دوسرا قطاروں کے ذریعے تقسیم کیا جاتا ہے، اس لیے ہر GPU ایک سلائس کی گنتی کرتا ہے اور ایک واحد آل-ریڈوس نتائج کو یکجا کرتا ہے۔ ہر جی پی یو سب سیٹ کو سنبھالنے کے ساتھ، توجہ سروں پر تقسیم ہوتی ہے۔ چونکہ ہر GPU بیک وقت ہر پرت کا حصہ کرتا ہے، اس لیے ٹینسر کی ہم آہنگی فی GPU میموری کو کم کرتی ہے اور کمپیوٹ کو تیز کرتی ہے، لیکن یہ ہر پرت کے درمیان GPUs کے درمیان بار بار، اعلی بینڈوتھ مواصلت کا مطالبہ کرتا ہے۔ یہی وجہ ہے کہ یہ عام طور پر NVLink کے ذریعے جڑے ہوئے نوڈ کے اندر ہی محدود ہوتا ہے، اور بہت بڑی تربیت اور پیش کرنے والی ملازمتوں کے لیے پائپ لائن اور ڈیٹا کی ہم آہنگی کے ساتھ مل جاتا ہے۔

تکنیکی بصیرت

یہ چال، جسے Megatron-LM نے مقبول بنایا ہے، تقسیم کے طول و عرض کا انتخاب کر رہا ہے تاکہ بات چیت کم سے کم ہو۔ پہلے ایم ایل پی میٹرکس کالم کے حساب سے تقسیم کرنے سے ہر GPU بغیر کسی مطابقت پذیری کے مقامی طور پر نان لائنیرٹی کو لاگو کرنے دیتا ہے۔ دوسری قطار کے حساب سے تقسیم کرنے کا مطلب ہے کہ آؤٹ پٹ کو جزوی نتائج کے لیے صرف ایک تمام کمی کی ضرورت ہے۔ اس طرح ہر پرت تقریباً دو آل کمی (آگے) اور دو (پسماندہ) ہوتی ہے۔ چونکہ یہ اجتماعات ہر پرت میں ہوتے ہیں، اس لیے تاخیر کا غلبہ ہوتا ہے—لہٰذا ٹینسر کی ہم آہنگی تیز رفتار انٹرا نوڈ لنکس کے پیچھے رہتی ہے جیسے NVLink سست انٹر-نوڈ نیٹ ورکس کے بجائے۔

اسٹریٹجک اثر

لاگت اور بجٹ

فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔

واضح فیصلے

تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔

کوالٹی کنٹرول

انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔

بڑے ماڈلز کے لیے ٹینسر متوازی کا مستقبل

ٹینسر کی ہم آہنگی بنیادی طور پر برقرار ہے لیکن تیزی سے '3D متوازی' (ٹینسر + پائپ لائن + ڈیٹا) میں گھل مل جاتی ہے اور ماہرین کے مرکب کے ماڈلز کے ماہر متوازی کے ساتھ مل جاتی ہے۔ Megatron-LM، DeepSpeed، اور vLLM جیسے فریم ورک شارڈنگ کو خودکار بناتے ہیں۔ جیسا کہ GPU آپس میں جڑتا ہے (NVLink، NVSwitch) اور آپٹیکل فیبرکس تیزی سے ہوتے ہیں، نوڈ کی حد میں نرمی آتی ہے، جس سے وسیع ٹینسر-متوازی گروپس بن سکتے ہیں۔ زیادہ ہوشیار خودکار متوازی کی توقع کریں جو دی گئی کلسٹر ٹوپولوجی کے لیے کمیونیکیشن کو کم کرنے کے لیے شارڈ ڈائمینشنز اور گروپ سائز چنتا ہے۔

حقیقی دنیا کا نفاذ

Megatron-LM کا استعمال کرتے ہوئے ایک NVLink سے منسلک نوڈ میں 8 GPUs میں ہر پرت کے وزن کے میٹرکس کو شارڈنگ کرکے 175B-پیرامیٹر ماڈل کو تربیت دینا۔

tensor_parallel_size=4 کے ساتھ vLLM میں 70B-پیرامیٹر چیٹ ماڈل پیش کرنا تاکہ وزن چار GPUs میں فٹ ہو اور حقیقی وقت میں جواب دیں۔

ٹرانسفارمر کی توجہ کو تقسیم کرنا GPUs پر ہوتا ہے لہذا ہر آلہ ایک سب سیٹ کی گنتی کرتا ہے، پھر اگلی پرت کے لیے آؤٹ پٹ کو جوڑتا ہے۔

بڑے GPU کلسٹرز پر ٹریلین پیرامیٹر ماڈلز کو تربیت دینے کے لیے نوڈس کے اندر ٹینسر کی ہم آہنگی اور نوڈس میں پائپ لائن کی ہم آہنگی کو یکجا کرنا۔

خطرات اور گارڈریلز

ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔

بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔

سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔

نفاذ کا روڈ میپ

1

نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔

2

حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔

3

غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔

4

اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tensor Parallelism for Large Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

ماڈل اور پائپ لائن متوازی

اکثر پوچھے گئے سوالات

What is Tensor Parallelism for Large Models?

متعدد GPUs میں ایک واحد نیورل نیٹ ورک پرت کے اندر ریاضی کو تقسیم کرنے کا ایک طریقہ تاکہ ایک ڈیوائس کے لیے بہت بڑا ماڈل اب بھی چل سکے۔ اس سے فرق پڑتا ہے کیونکہ فرنٹیئر ماڈلز میں سیکڑوں اربوں پیرامیٹرز ہوتے ہیں جنہیں کوئی بھی GPU اکیلے اتنی تیزی سے پکڑ یا حساب نہیں کرسکتا۔

GPUs میں ٹینسر متوازی کیا تقسیم ہوتا ہے؟

ٹینسر (انٹرا لیئر) متوازی ایک پرت کے اندر وزن کی پیمائش کو کم کرتا ہے، لہذا ہر GPU ایک ہی پرت کے کچھ حصے کی گنتی کرتا ہے جو کہ پائپ لائن کے متوازی سے مختلف ہے، جو مختلف GPUs پر پوری تہوں کو رکھتا ہے۔

Megatron طرز کے MLP تقسیم میں، مواصلات کو کم سے کم کرنے کے لیے دو ویٹ میٹرکس کو کیسے تقسیم کیا جاتا ہے؟

پہلے میٹرکس کو کالموں کے ذریعے تقسیم کرنے سے ہر GPU مقامی طور پر نان لائنیرٹی کا اطلاق کر سکتا ہے۔ قطاروں کے ذریعے دوسرے کو تقسیم کرنے کا مطلب ہے کہ ایک واحد آل کم کر کے جزوی آؤٹ پٹس کو کم سے کم کرنا۔

ٹینسر متوازی کو عام طور پر ایک نوڈ کے اندر کیوں رکھا جاتا ہے؟

ہر پرت اجتماعی مواصلات کو متحرک کرتی ہے (تمام کم کر دیتی ہے)، اس لیے بھاری، تاخیر سے حساس ٹریفک سست انٹر نوڈ نیٹ ورکس کی بجائے NVLink جیسے تیز انٹرا نوڈ لنکس کا مطالبہ کرتی ہے۔

ٹینسر متوازی کے تحت توجہ کا طریقہ کار عام طور پر کیسے متوازی ہوتا ہے؟

توجہ کے سر آزاد ہیں، اس لیے وہ پورے GPUs میں تقسیم کیے جاتے ہیں—ہر آلہ کچھ سروں کی گنتی کرتا ہے اور آؤٹ پٹس کو ملایا جاتا ہے۔

کون سا اجتماعی آپریشن عام طور پر ٹینسر کے متوازی میں جزوی نتائج کو یکجا کرتا ہے؟

ہر GPU پر شمار ہونے والے جزوی آؤٹ پٹس کو تمام کم کریں تاکہ وہ پرت کے نتیجے پر متفق ہوں۔ یہ فارورڈ اور بیکورڈ پاسز میں فی پرت متعدد بار ہوتا ہے۔