الدليل الفني

النماذج المختلطة والمتفرقة

Mixtral هو نموذج مزيج مفتوح من الخبراء من Mistral AI والذي يوفر جودة النموذج الكبير بسرعة النموذج الصغير.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

Sparse models like it activate only a fraction of their parameters per token, cutting compute without sacrificing capability.

الغوص العميق

قامت شركة Mixtral 8x7B، التي أطلقتها شركة Mistral AI في أواخر عام 2023، بنشر نهج الخليط المتناثر من الخبراء (MoE) في النماذج المفتوحة. يحتوي على ثماني شبكات تغذية للأمام "خبيرة" منفصلة لكل طبقة، مع حوالي 47 مليار معلمة إجمالية، لكن جهاز التوجيه خفيف الوزن يختار خبيرين فقط لكل رمز مميز. ونتيجة لذلك، هناك ما يقرب من 13 مليار معلمة فقط نشطة لكل رمز مميز، وبالتالي فإن الاستدلال يعمل بنفس سرعة نموذج كثيف 13B مع الوصول إلى جودة مماثلة للنماذج الأكبر بكثير. تطابق Mixtral أو تغلب على GPT-3.5 وLlama 2 70B في العديد من المعايير بينما كان أسرع وأرخص في الخدمة. أصدرت ميسترال لاحقًا Mixtral 8x22B. تم ترخيص النموذج بشكل مفتوح بموجب Apache 2.0، مما أدى إلى التبني السريع والضبط الدقيق في مجتمع المصادر المفتوحة.

البصيرة الفنية

في طبقة MoE المتفرقة، يتم استبدال كتلة التغذية الأمامية الكثيفة بشبكات متخصصة N بالإضافة إلى شبكة بوابة صغيرة (جهاز التوجيه). لكل رمز مميز، يحسب جهاز التوجيه النتائج ويختار أفضل الخبراء (أعلى 2 في Mixtral)، ويوجه الرمز المميز فقط من خلال هؤلاء. يتم ترجيح مخرجاتها وتلخيصها. نظرًا لأن معظم الخبراء يظلون خاملين لكل رمز مميز، فإن النموذج يحتفظ بالعديد من المعلمات في الذاكرة ولكنه يقوم بعمليات حسابية أقل بكثير. المقايضة: يجب تحميل جميع الخبراء في VRAM على الرغم من تشغيل بعضهم فقط.

التأثير الاستراتيجي

التكلفة والميزانية

تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.

قرارات أوضح

يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.

مراقبة الجودة

تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.

مستقبل النماذج المختلطة والمتفرقة

أصبحت وزارة التربية المتناثرة الآن مركزية بالنسبة للذكاء الاصطناعي الحدودي. توقع المزيد من إصدارات وزارة التربية والتعليم المفتوحة، والتوجيه الدقيق مع العديد من الخبراء الصغار، وتصميمات الخبراء المشتركة أو المختلطة التي تعمل على تحسين الكفاءة بشكل أكبر. مع توسع النماذج نحو تريليونات من المعلمات الإجمالية، فإن التناثر هو الرافعة الرئيسية لإبقاء الاستدلال في المتناول. تعالج الأبحاث نقاط الضعف في وزارة التعليم، وموازنة التحميل عبر الخبراء، وعبء الذاكرة، واستقرار التدريب، في حين يتم تحسين الأجهزة ومكدسات الخدمة بشكل متزايد خصيصًا لتوجيه الخبراء.

التنفيذ في العالم الحقيقي

تقديم روبوت دردشة عالي الجودة بتكلفة وسرعة نموذج أصغر بكثير

الاستضافة الذاتية لنموذج Apache-2.0 المرخص للمنتجات التجارية بدون رسوم استخدام

ضبط السلوكيات الفردية على Mixtral للبرمجة أو التلخيص أو المهام متعددة اللغات

تشغيل الاستدلال السريع على خادم واحد متعدد وحدات معالجة الرسومات حيث يكون النموذج ذو الكثافة 70 بايت بطيئًا للغاية

المخاطر والدرابزين

يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.

غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.

يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.

خارطة طريق التنفيذ

1

تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.

2

المعيار في ظل ظروف التحميل والبيانات الواقعية.

3

مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.

4

قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixtral and Sparse Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

نموذج وتوازي خطوط الأنابيب

الأسئلة المتداولة

What is Mixtral and Sparse Models?

Mixtral هو نموذج مزيج مفتوح من الخبراء من Mistral AI والذي يوفر جودة النموذج الكبير بسرعة النموذج الصغير. تعمل النماذج المتفرقة مثلها على تنشيط جزء صغير فقط من معلماتها لكل رمز مميز، مما يؤدي إلى قطع الحوسبة دون التضحية بالإمكانات.

في Mixtral 8x7B، كم عدد الخبراء الذين يعالجون كل رمز مميز على حدة؟

يستخدم Mixtral التوجيه من أعلى 2: يختار جهاز التوجيه اثنين من الخبراء الثمانية لمعالجة كل رمز مميز.

ما هو المكون الذي يقرر الخبراء الذين سيتم إرسال الرمز المميز إليهم؟

تقوم شبكة بوابة صغيرة، تسمى جهاز التوجيه، بتسجيل الخبراء واختيار الخبراء الذين يتعاملون مع كل رمز مميز.

على الرغم من أن Mixtral 8x7B يحتوي على إجمالي 47B من المعلمات تقريبًا، ما عدد المعلمات النشطة تقريبًا لكل رمز مميز؟

نظرًا لأن اثنين فقط من الخبراء يعملون لكل رمز، فإن ما يقرب من 13 مليار معلمة نشطة، مما يمنحها سرعة نموذج أصغر بكثير.

ما هي المفاضلة الرئيسية بين نماذج وزارة التربية والتعليم المتفرقة مثل Mixtral؟

تقوم وزارة التعليم بحفظ الحوسبة لكل رمز مميز ولكنها لا تزال تتطلب الاحتفاظ بجميع الخبراء في VRAM، مما يزيد من احتياجات الذاكرة.

بموجب أي ترخيص قامت شركة Mistral AI بإصدار Mixtral، مما أدى إلى التبني المفتوح؟

تم إصدار Mixtral بموجب ترخيص Apache 2.0 المسموح به، مما يسمح بالاستخدام التجاري المجاني والضبط الدقيق.