ٹیکنیکل گائیڈ

ماہرین کا مرکب

مکسچر آف ایکسپرٹس (MoE) ایک ماڈل ڈیزائن ہے جو ایک نیٹ ورک کو بہت سے خصوصی ذیلی نیٹ ورکس میں تقسیم کرتا ہے اور صرف چند فی ان پٹ کو فعال کرتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It lets models hold enormous knowledge while keeping each prediction fast and cheap.

گہرا غوطہ

ایک معیاری ٹرانسفارمر ہر ان پٹ کو ایک ہی گھنی تہوں کے ذریعے چلاتا ہے، لہذا ماڈل کو بہتر بنانے کا مطلب عام طور پر ہر حساب کو زیادہ مہنگا بنانا ہے۔ ماہرین کا مرکب اس لنک کو توڑ دیتا ہے۔ یہ بہت سے چھوٹے 'ماہر' نیٹ ورکس کے علاوہ ایک چھوٹے 'راؤٹر' کے ساتھ بڑی فیڈ فارورڈ پرت کی جگہ لے لیتا ہے جو یہ فیصلہ کرتا ہے کہ کون سے ماہرین ہر ٹوکن کو سنبھالتے ہیں۔ عام طور پر صرف ٹاپ 1 یا 2 ماہرین ہی فائر کرتے ہیں، اس لیے ایک ماڈل میں سینکڑوں بلین کل پیرامیٹرز ہو سکتے ہیں لیکن فی ٹوکن صرف ایک چھوٹا سا حصہ چالو کرتے ہیں۔ یہی وجہ ہے کہ Mixtral 8x7B جیسے ماڈلز اور GPT-4 کے پیچھے افواہ شدہ فن تعمیر متناسب طور پر زیادہ تخمینہ لاگت کے بغیر اعلیٰ معیار تک پہنچ جاتے ہیں۔ ٹریڈ آف پیچیدگی ہے: تمام ماہرین کو اب بھی یادداشت میں فٹ ہونا ضروری ہے، اور راؤٹر کچھ ماہرین کو غلط راستے سے ہٹا سکتا ہے یا اوورلوڈ کر سکتا ہے، لہذا تربیت میں محتاط توازن کی ضرورت ہوتی ہے۔

تکنیکی بصیرت

MoE کا دل گیٹنگ نیٹ ورک ہے، ایک چھوٹی سی سیکھی ہوئی پرت جو آنے والے ٹوکن کے لیے ہر ماہر کو اسکور کرتی ہے اور ٹوکن کو ٹاپ-k سب سے زیادہ اسکور کرنے والوں (اکثر k=1 یا 2) تک پہنچاتی ہے۔ راؤٹر کو چند پسندیدہ ماہرین کو سب کچھ بھیجنے سے روکنے کے لیے، تربیت میں ایک معاون 'لوڈ بیلنسنگ نقصان' شامل کیا جاتا ہے جو غیر مساوی استعمال پر جرمانہ عائد کرتا ہے۔ چونکہ صرف k ماہرین فی ٹوکن چلاتے ہیں، کمپیوٹ (FLOPs) تقریباً مستقل رہتا ہے یہاں تک کہ جب آپ مزید ماہرین شامل کرتے ہیں، تو کل پیرامیٹرز اور فی ٹوکن لاگت کا پیمانہ آزادانہ طور پر۔

اسٹریٹجک اثر

لاگت اور بجٹ

فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔

واضح فیصلے

تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔

کوالٹی کنٹرول

انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔

ماہرین کے مرکب کا مستقبل

MoE فرنٹیئر اسکیل ماڈلز کے لیے ایک ڈیفالٹ ٹول بن رہا ہے کیونکہ یہ صلاحیت کو لاگت سے دوگنا کرتا ہے۔ بہتر انداز والے ماہرین، زیادہ سیاق و سباق پر غور کرنے والے بہتر روٹنگ، اور محدود ہارڈ ویئر پر بہت بڑے ویرل ماڈلز پیش کرنے کے لیے بہتر تکنیکوں کی توقع کریں۔ تحقیق میموری کے مسئلے سے بھی نمٹ رہی ہے، کیوں کہ تمام ماہرین کو لوڈ کیا جانا چاہیے، اگرچہ کچھ ہی دوڑیں، ماہر آف لوڈنگ اور کوانٹائزیشن کے ذریعے۔ جیسا کہ Mixtral اور DeepSeek-MoE جیسے کھلے ماڈلز پختہ ہوتے ہیں، اسپرس آرکیٹیکچرز ممکنہ طور پر چھوٹے GPU بجٹ پر زیادہ موثر معاونین کو طاقت فراہم کریں گے۔

حقیقی دنیا کا نفاذ

Mixtral 8x7B 8 ماہرین کا استعمال کرتا ہے اور 2 فی ٹوکن کو چالو کرتا ہے، جس سے تقریباً 47B کل پیرامیٹرز ہوتے ہیں لیکن تیز، سستے تخمینے کے لیے فی ٹوکن صرف 13B فعال۔

DeepSeek اور Qwen بڑے MoE زبان کے ماڈل بھیجتے ہیں جو کم فی ٹوکن کمپیوٹ کے ساتھ چلتے ہوئے بینچ مارکس پر گھنے ماڈلز سے میل کھاتے ہیں۔

کلاؤڈ LLM فراہم کنندگان MoE استعمال کرتے ہیں لہذا ایک بہت بڑا ماڈل بہت سارے صارفین کو سستی خدمت کر سکتا ہے، کیونکہ ہر درخواست صرف چند ماہرین کو روشن کرتی ہے۔

Google کے پہلے والے سوئچ ٹرانسفارمر کو ٹریننگ کمپیوٹ کو قابل انتظام رکھنے کے لیے ٹاپ-1 روٹنگ کا استعمال کرتے ہوئے ایک ٹریلین سے زیادہ پیرامیٹرز تک سکیل کیا گیا۔

خطرات اور گارڈریلز

ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔

بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔

سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔

نفاذ کا روڈ میپ

1

نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔

2

حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔

3

غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔

4

اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture of Experts quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اکثر پوچھے گئے سوالات

What is Mixture of Experts?

مکسچر آف ایکسپرٹس (MoE) ایک ماڈل ڈیزائن ہے جو ایک نیٹ ورک کو بہت سے خصوصی ذیلی نیٹ ورکس میں تقسیم کرتا ہے اور صرف چند فی ان پٹ کو فعال کرتا ہے۔ یہ ہر پیشین گوئی کو تیز اور سستا رکھتے ہوئے ماڈلز کو بہت زیادہ علم رکھنے دیتا ہے۔

ماہرین کی پرت کے مرکب میں، کیا فیصلہ کرتا ہے کہ کون سے ماہرین دیئے گئے ٹوکن پر کارروائی کرتے ہیں؟

ایک چھوٹا گیٹنگ نیٹ ورک ہر ماہر کو ٹوکن کے لیے اسکور کرنا سیکھتا ہے اور اسے ٹاپ اسکور کرنے والوں تک لے جاتا ہے۔ روٹنگ سیکھی جاتی ہے، فکسڈ یا بے ترتیب نہیں۔

ایک ایم او ای ماڈل میں فی ٹوکن لاگت میں مماثل اضافے کے بغیر گھنے ماڈل سے کہیں زیادہ کل پیرامیٹرز کیوں ہو سکتے ہیں؟

چونکہ صرف ٹاپ-کے ماہرین فی ٹوکن فائر کرتے ہیں، فعال کمپیوٹ تقریباً مستقل رہتا ہے یہاں تک کہ پیرامیٹر کی کل تعداد مزید ماہرین کو شامل کرنے سے بڑھ جاتی ہے۔

ایم او ای ٹریننگ کے دوران لوڈ بیلنسنگ (معاون) کے نقصان سے کیا مسئلہ حل ہوتا ہے؟

توازن کے بغیر، روٹر مٹھی بھر ماہرین کی حمایت کرتا ہے۔ معاون نقصان ناہموار استعمال پر جرمانہ عائد کرتا ہے لہذا تمام ماہرین تربیت حاصل کرتے ہیں۔

Mixtral 8x7B اپنے 8 ماہرین میں سے 2 کو فی ٹوکن فعال کرتا ہے۔ اس کے کمپیوٹ بمقابلہ اس کے سائز کا کیا مطلب ہے؟

8 میں سے صرف 2 ماہرین کے فعال ہونے کے ساتھ، فعال پیرامیٹرز فی ٹوکن (~13B) کل ~47B سے بہت چھوٹے ہیں، جس سے تخمینہ لاگت کم ہوتی ہے۔

یکساں طور پر قابل گھنے ماڈلز کے مقابلے میں ایم او ای ماڈلز کا حقیقی منفی پہلو کون سا ہے؟

اگرچہ صرف چند ماہرین فی ٹوکن کی گنتی کرتے ہیں، ہر ماہر کے وزن کو میموری میں لوڈ کیا جانا چاہیے، جس سے MoE ماڈلز کو خدمت کرنے کے لیے میموری کی بھوک لگتی ہے۔