ٹیکنیکل گائیڈ

مکسٹرل اور اسپارس ماڈلز

Mixtral Mistral AI کا اوپن مکسچر آف ایکسپرٹس ماڈل ہے جو چھوٹے ماڈل کی رفتار پر بڑے ماڈل کا معیار فراہم کرتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

Sparse models like it activate only a fraction of their parameters per token, cutting compute without sacrificing capability.

گہرا غوطہ

Mixtral 8x7B، جو 2023 کے آخر میں Mistral AI کے ذریعے جاری کیا گیا، نے کھلے ماڈلز میں sparse mixture-of-experts (MoE) اپروچ کو مقبول بنایا۔ اس میں فی پرت آٹھ الگ الگ 'ماہر' فیڈ فارورڈ نیٹ ورکس ہیں، جن میں تقریباً 47 بلین کل پیرامیٹرز ہیں، لیکن ایک ہلکا پھلکا راؤٹر ہر ٹوکن کے لیے صرف دو ماہرین کا انتخاب کرتا ہے۔ نتیجتاً، فی ٹوکن تقریباً 13 بلین پیرامیٹرز ہی فعال ہیں، لہٰذا تخمینہ 13B گھنے ماڈل کی طرح تیزی سے چلتا ہے جبکہ اس سے کہیں زیادہ بڑے پیرامیٹر کے مقابلے معیار تک پہنچتا ہے۔ Mixtral بہت سے بینچ مارکس پر GPT-3.5 اور Llama 2 70B کو مماثل یا ہرا دیتا ہے جبکہ سروس تیز اور سستا ہے۔ Mistral نے بعد میں Mixtral 8x22B جاری کیا۔ یہ ماڈل کھلے عام اپاچی 2.0 کے تحت لائسنس یافتہ ہے، جو اوپن سورس کمیونٹی میں تیزی سے اپنانے اور فائن ٹیوننگ کو فروغ دیتا ہے۔

تکنیکی بصیرت

ایک ویرل MoE پرت میں، گھنے فیڈ فارورڈ بلاک کو N ماہر نیٹ ورکس کے علاوہ ایک چھوٹے گیٹنگ نیٹ ورک (روٹر) سے بدل دیا جاتا ہے۔ ہر ٹوکن کے لیے، راؤٹر اسکورز کی گنتی کرتا ہے اور ٹاپ-کے ماہرین کو چنتا ہے (Mixtral میں ٹاپ-2)، ٹوکن کو صرف ان کے ذریعے روٹ کرتا ہے۔ ان کے نتائج وزنی اور خلاصہ ہیں۔ چونکہ زیادہ تر ماہرین فی ٹوکن بیکار رہتے ہیں، اس لیے ماڈل میموری میں بہت سے پیرامیٹرز رکھتا ہے لیکن اس کے باوجود بہت کم گنتی کرتا ہے۔ تجارت بند: تمام ماہرین کو VRAM میں لوڈ کیا جانا چاہیے حالانکہ صرف کچھ ہی چلتے ہیں۔

اسٹریٹجک اثر

لاگت اور بجٹ

فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔

واضح فیصلے

تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔

کوالٹی کنٹرول

انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔

مکسٹرل اور اسپارس ماڈلز کا مستقبل

اسپارس ایم او ای اب فرنٹیئر اے آئی کا مرکزی مقام ہے۔ مزید کھلے MoE ریلیز، بہت سے چھوٹے ماہرین کے ساتھ بہتر روٹنگ، اور مشترکہ یا ہائبرڈ ماہر ڈیزائن کی توقع کریں جو کارکردگی کو مزید بہتر بناتے ہیں۔ جیسا کہ ماڈلز کا پیمانہ کھربوں کل پیرامیٹرز کی طرف ہوتا ہے، اسلاف کو سستی رکھنے کے لیے اہم لیور ہے۔ تحقیق ایم او ای کے کمزور دھبوں سے نمٹ رہی ہے، ماہرین میں بوجھ میں توازن، میموری اوور ہیڈ، اور تربیتی استحکام، جبکہ ہارڈ ویئر اور سرونگ اسٹیک خاص طور پر ماہر روٹنگ کے لیے تیزی سے بہتر ہو رہے ہیں۔

حقیقی دنیا کا نفاذ

بہت چھوٹے گھنے ماڈل کی قیمت اور رفتار پر اعلیٰ معیار کے چیٹ بوٹ کی خدمت کرنا

استعمال کی فیس کے بغیر تجارتی مصنوعات کے لیے Apache-2.0 لائسنس یافتہ ماڈل کی خود میزبانی کرنا

کوڈنگ، خلاصہ، یا کثیر لسانی کاموں کے لیے Mixtral پر انفرادی طرز عمل کو ٹھیک کرنا

سنگل ملٹی جی پی یو سرور پر تیز رفتار اندازہ چلانا جہاں 70B گھنے ماڈل بہت سست ہوگا۔

خطرات اور گارڈریلز

ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔

بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔

سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔

نفاذ کا روڈ میپ

1

نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔

2

حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔

3

غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔

4

اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixtral and Sparse Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

ماڈل اور پائپ لائن متوازی

اکثر پوچھے گئے سوالات

What is Mixtral and Sparse Models?

Mixtral Mistral AI کا اوپن مکسچر آف ایکسپرٹس ماڈل ہے جو چھوٹے ماڈل کی رفتار پر بڑے ماڈل کا معیار فراہم کرتا ہے۔ اس جیسے ویرل ماڈلز اپنے پیرامیٹرز کا صرف ایک حصہ فی ٹوکن چالو کرتے ہیں، صلاحیت کو قربان کیے بغیر کمپیوٹ کاٹتے ہیں۔

Mixtral 8x7B میں، کتنے ماہرین ہر انفرادی ٹوکن پر کارروائی کرتے ہیں؟

Mixtral ٹاپ-2 روٹنگ کا استعمال کرتا ہے: ایک روٹر ہر ٹوکن پر کارروائی کرنے کے لیے آٹھ میں سے دو ماہرین کا انتخاب کرتا ہے۔

کون سا جزو فیصلہ کرتا ہے کہ کن ماہرین کو ٹوکن بھیجا جائے؟

ایک چھوٹا گیٹنگ نیٹ ورک، جسے روٹر کہا جاتا ہے، ماہرین کو اسکور کرتا ہے اور منتخب کرتا ہے کہ کون سے ہر ٹوکن کو ہینڈل کرتا ہے۔

اگرچہ Mixtral 8x7B میں تقریباً 47B کل پیرامیٹرز ہیں، فی ٹوکن تقریباً کتنے فعال ہیں؟

چونکہ فی ٹوکن صرف دو ماہرین چلاتے ہیں، تقریباً 13 بلین پیرامیٹرز فعال ہیں، جو اسے بہت چھوٹے ماڈل کی رفتار دیتے ہیں۔

Mixtral جیسے Sparse MoE ماڈلز کا کلیدی تجارت کیا ہے؟

MoE کمپیوٹ فی ٹوکن بچاتا ہے لیکن پھر بھی تمام ماہرین کو VRAM میں رکھنے کی ضرورت ہے، جس سے میموری کی ضروریات میں اضافہ ہوتا ہے۔

کس لائسنس کے تحت Mistral AI نے Mixtral کو جاری کیا، کھلے عام اپنانے کے لیے؟

Mixtral کو اجازت دینے والے Apache 2.0 لائسنس کے تحت جاری کیا گیا تھا، مفت تجارتی استعمال اور فائن ٹیوننگ کی اجازت دیتا ہے۔