ایم او ای سرونگ کے لیے ماہر متوازی
ماہرین کی ہم آہنگی ایک مرکب-آف-ماہرین ماڈل کے بہت سے فیڈ فارورڈ 'ماہرین' کو مختلف GPUs میں تقسیم کرتی ہے لہذا ہر آلہ پیرامیٹرز کا صرف ایک ٹکڑا رکھتا ہے۔
جائزہ
It is the key to serving trillion-parameter MoE models cheaply, since only a few experts run per token.
گہرا غوطہ
ایک مکسچر آف ایکسپرٹس (MoE) پرت ایک بڑے فیڈ فارورڈ نیٹ ورک کی جگہ بہت سے چھوٹے (ماہرین) کے علاوہ ایک راؤٹر لے لیتی ہے جو ٹاپ-k (اکثر 1 یا 2) ماہرین کو فی ٹوکن چنتا ہے۔ ماہر متوازی (EP) مختلف ماہرین کو مختلف GPUs پر رکھتا ہے۔ تخمینہ کے مطابق، راؤٹر فیصلہ کرتا ہے کہ ہر ٹوکن کو کن ماہرین کی ضرورت ہے، پھر ایک آل ٹو آل کمیونیکیشن مرحلہ اپنے منتخب ماہرین کو رکھنے والے GPUs کے ٹوکنز کو شفل کرتا ہے، FFN چلاتا ہے، اور نتائج کو واپس بدل دیتا ہے۔ یہ ایک ماڈل کے پاس بہت زیادہ کل پیرامیٹرز (ویرل) رکھتا ہے جبکہ فی ٹوکن صرف ایک چھوٹا سا حصہ (کم FLOPs) کو چالو کرتا ہے۔ Mixtral 8x7B، DeepSeek-V3، اور GPT-OSS جیسے ماڈل اسے استعمال کرتے ہیں۔ سخت حصے ماہرین کے درمیان بوجھ میں توازن رکھتے ہیں اور دو مہنگے آل ٹو آل ہاپس فی پرت ہیں۔
تکنیکی بصیرت
بنیادی میکینک ہر MoE پرت کے دو آل ٹو آل اجتماعات ہیں: ڈسپیچ (اپنے ماہرین کو ٹوکن بھیجیں) اور یکجا کریں (آؤٹ پٹ واپس جمع کریں)۔ چونکہ روٹنگ ڈیٹا پر منحصر ہے، اس لیے ہر ماہر کو مارنے والے ٹوکن کی تعداد مختلف ہوتی ہے، جس کی وجہ سے بوجھ میں عدم توازن پیدا ہوتا ہے اور 'اسٹرگلرز'۔ سرونگ سسٹمز GEMMs (میٹرکس ضرب) کو یکساں رکھنے کے لیے صلاحیت کے عوامل، ماہر بفرز، اور ٹوکن ڈراپنگ یا پیڈنگ کا اضافہ کرتے ہیں، اور اکثر تاخیر کو چھپانے کے لیے ماہر حساب کے ساتھ آل ٹو آل مواصلات کو اوورلیپ کرتے ہیں۔
اسٹریٹجک اثر
لاگت اور بجٹ
فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔
واضح فیصلے
تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔
کوالٹی کنٹرول
انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔
ایم او ای سرونگ کے لیے ماہر متوازی کا مستقبل
روٹنگ اور ہارڈ ویئر کے سخت مشترکہ ڈیزائن کی توقع کریں: فیوزڈ ڈسپیچ-کمپیوٹ-کمبائن کرنل، گروپ کردہ GEMMs جو بہت سے ماہرین کو بیچتے ہیں، اور NVLink/InfiniBand سے آگاہی سب کے لیے۔ ڈیپ سیک کی معاون نقصان سے پاک توازن اور نوڈ لمیٹڈ روٹنگ جیسی تکنیک کراس نوڈ ٹریفک کو کم کرتی ہیں۔ متفرق سرونگ 'ماہر' GPUs کو توجہ مرکوز کرنے والے GPUs سے الگ کر دے گی، اور بہترین ٹاپ-k کے ساتھ زیادہ ماہر شمار (سینکڑوں) فی ٹوکن لاگت کو فلیٹ رکھتے ہوئے MoE کو انتہائی تفاوت کی طرف دھکیل دیں گے۔
حقیقی دنیا کا نفاذ
ہر ڈیوائس پر اپنے 8 میں سے 2-4 ماہرین رکھ کر 2-4 GPUs میں Mixtral 8x7B کی خدمت کرنا
DeepSeek-V3 نوڈ لمیٹڈ روٹنگ کا استعمال کرتے ہوئے ٹوکن کے ماہرین کتنے نوڈس پر محیط ہے، انٹر نوڈ کو آل ٹو آل کاٹ کر
ایک واحد 8-GPU نوڈ پر 200B+ اسپارس ماڈل کی میزبانی کرنے کے لیے vLLM یا SGLang ماہر-متوازی وضع کا استعمال
ایک ہائبرڈ EP+TP کی تعیناتی میں توجہ کی تہوں پر ٹینسر کے متوازی کے ساتھ ماہر ہم آہنگی کا امتزاج
خطرات اور گارڈریلز
ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔
بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔
سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔
نفاذ کا روڈ میپ
نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔
حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔
غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔
اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Expert Parallelism for MoE Serving quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
الگ الگ پری فل اور ڈی کوڈ سرونگ
اکثر پوچھے گئے سوالات
What is Expert Parallelism for MoE Serving?
ماہرین کی ہم آہنگی ایک مرکب-آف-ماہرین ماڈل کے بہت سے فیڈ فارورڈ 'ماہرین' کو مختلف GPUs میں تقسیم کرتی ہے لہذا ہر آلہ پیرامیٹرز کا صرف ایک ٹکڑا رکھتا ہے۔ یہ ٹریلین پیرامیٹر MoE ماڈل کو سستے طریقے سے پیش کرنے کی کلید ہے، کیونکہ صرف چند ماہرین فی ٹوکن چلاتے ہیں۔
ماہر متوازی GPUs میں کیا تقسیم کرتا ہے؟
ماہر متوازی مختلف GPUs پر مختلف ماہرین (ایک MoE پرت کے FFN ذیلی نیٹ ورک) کو رکھتا ہے، لہذا ہر آلہ ماہرین کا صرف ایک ذیلی سیٹ رکھتا ہے۔
مواصلت کا کون سا نمونہ ایم او ای ماہر کی ہم آہنگی میں مرکزی ہے؟
ہر MoE پرت کو اپنے ماہرین کو ٹوکن بھیجنے کے لیے عام طور پر ایک آل ٹو آل کی ضرورت ہوتی ہے اور آؤٹ پٹس کو واپس جوڑنے کے لیے ایک اور آل ٹو آل کی ضرورت ہوتی ہے۔
بھاری کل پیرامیٹرز کے باوجود MoE فی ٹوکن کمپیوٹ کو کم کیوں رکھتا ہے؟
ایک راؤٹر فی ٹوکن صرف ٹاپ-کے ماہرین (اکثر 1-2) کو چالو کرتا ہے، اس لیے FLOPs چھوٹے رہتے ہیں حالانکہ ماڈل میں کل بہت سے ماہرین ہوتے ہیں۔
کیا مسئلہ پیدا ہوتا ہے کیونکہ روٹنگ ڈیٹا پر منحصر ہے؟
چونکہ راؤٹر کے انتخاب کا انحصار ان پٹ پر ہوتا ہے، اس لیے کچھ ماہرین کو دوسروں کے مقابلے میں بہت زیادہ ٹوکن ملتے ہیں، جس سے بوجھ میں عدم توازن پیدا ہوتا ہے اور اسٹرگلرز۔
ماہر میٹرکس ضرب کو یکساں سائز میں رکھنے کے لیے ایک عام تکنیک کیا ہے؟
سرونگ اسٹیکس فی ماہر کی صلاحیت (زیادہ سے زیادہ ٹوکن کی گنتی) اور اس سے آگے پیڈ یا ڈراپ ٹوکن سیٹ کرتا ہے تاکہ ہر ماہر کے جی ای ایم ایم کی ایک متوقع شکل ہو۔