الدليل الفني

مزيج من الخبراء

مزيج الخبراء (MoE) هو تصميم نموذجي يقسم الشبكة إلى العديد من الشبكات الفرعية المتخصصة وينشط عدد قليل منها فقط لكل مدخل.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It lets models hold enormous knowledge while keeping each prediction fast and cheap.

الغوص العميق

يقوم المحول القياسي بتشغيل كل المدخلات من خلال نفس الطبقات الكثيفة، لذا فإن جعل النموذج أكثر ذكاءً يعني عادةً جعل كل عملية حسابية أكثر تكلفة. مزيج من الخبراء يكسر هذا الارتباط. فهو يستبدل طبقة التغذية الأمامية الكبيرة بالعديد من شبكات "الخبراء" الأصغر حجمًا بالإضافة إلى "جهاز توجيه" صغير يقرر أي الخبراء يتعامل مع كل رمز مميز. عادةً ما يتم إطلاق أفضل 1 أو 2 من الخبراء فقط، لذلك يمكن أن يحتوي النموذج على مئات المليارات من المعلمات الإجمالية ولكنه ينشط فقط جزءًا صغيرًا لكل رمز مميز. وهذا هو السبب وراء وصول نماذج مثل Mixtral 8x7B والهندسة المعمارية المشهورة وراء GPT-4 إلى جودة عالية دون تكلفة استدلال عالية نسبيًا. وتتمثل المقايضة في التعقيد: يجب أن يظل جميع الخبراء متناسبين مع الذاكرة، ويمكن لجهاز التوجيه أن يخطئ في توجيه بعض الخبراء أو يثقل كاهلهم، لذا يتطلب التدريب توازنًا دقيقًا.

البصيرة الفنية

قلب وزارة التعليم هو شبكة البوابات، وهي طبقة متعلمة صغيرة تسجل كل خبير للحصول على رمز مميز وارد وتوجه الرمز المميز إلى أعلى الدرجات (غالبًا k = 1 أو 2). لمنع جهاز التوجيه من إرسال كل شيء إلى عدد قليل من الخبراء المفضلين، يضيف التدريب "خسارة موازنة التحميل" الإضافية التي تعاقب الاستخدام غير المتكافئ. نظرًا لأن k الخبراء فقط هم الذين يعملون لكل رمز مميز، فإن الحوسبة (FLOPs) تظل ثابتة تقريبًا حتى عند إضافة المزيد من الخبراء، وبالتالي يتم قياس إجمالي المعلمات وتكلفة كل رمز بشكل مستقل.

التأثير الاستراتيجي

التكلفة والميزانية

تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.

قرارات أوضح

يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.

مراقبة الجودة

تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.

مستقبل خليط الخبراء

أصبحت وزارة التربية والتعليم أداة افتراضية للنماذج الحدودية لأنها تفصل بين القدرة والتكلفة. توقع خبراء أكثر دقة، وتوجيهًا أكثر ذكاءً يأخذ في الاعتبار المزيد من السياق، وتقنيات أفضل لخدمة نماذج متفرقة ضخمة على أجهزة محدودة. تعالج الأبحاث أيضًا مشكلة الذاكرة، حيث يجب تحميل جميع الخبراء على الرغم من تشغيل عدد قليل منهم، من خلال تفريغ الخبراء والتكميم. مع نضوج النماذج المفتوحة مثل Mixtral وDeepSeek-MoE، من المرجح أن تعمل البنى المتفرقة على تشغيل مساعدين أكثر كفاءة بميزانيات GPU الأصغر.

التنفيذ في العالم الحقيقي

يستخدم Mixtral 8x7B 8 خبراء وينشط 2 لكل رمز مميز، مما يوفر إجمالي 47 مليار معلمة تقريبًا ولكن فقط ~ 13 مليار نشط لكل رمز مميز لاستدلال أسرع وأرخص.

يقوم كل من DeepSeek وQwen بشحن نماذج لغة MoE الكبيرة التي تتطابق مع النماذج الكثيفة وفقًا للمعايير أثناء التشغيل باستخدام حوسبة أقل لكل رمز مميز.

يستخدم موفرو Cloud LLM وزارة التربية والتعليم بحيث يمكن لنموذج واحد ضخم أن يخدم العديد من المستخدمين بتكلفة معقولة، حيث أن كل طلب لا يضيء سوى عدد قليل من الخبراء.

تم توسيع نطاق Switch Transformer السابق لـ Google إلى أكثر من تريليون معلمة باستخدام التوجيه من أعلى 1 لإبقاء حوسبة التدريب قابلة للإدارة.

المخاطر والدرابزين

يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.

غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.

يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.

خارطة طريق التنفيذ

1

تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.

2

المعيار في ظل ظروف التحميل والبيانات الواقعية.

3

مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.

4

قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture of Experts quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

مزيج من خبراء LoRA

الأسئلة المتداولة

What is Mixture of Experts?

مزيج الخبراء (MoE) هو تصميم نموذجي يقسم الشبكة إلى العديد من الشبكات الفرعية المتخصصة وينشط عدد قليل منها فقط لكل مدخل. فهو يتيح للنماذج الاحتفاظ بمعرفة هائلة مع الحفاظ على كل تنبؤ سريع ورخيص.

في طبقة مزيج من الخبراء، ما الذي يقرر أي الخبراء يعالج رمزًا مميزًا معينًا؟

تتعلم شبكة بوابة صغيرة تسجيل كل خبير للرمز المميز وتوجيهه إلى الخبراء الذين حصلوا على أعلى الدرجات. يتم تعلم التوجيه، وليس ثابتًا أو عشوائيًا.

لماذا يمكن أن يحتوي نموذج MoE على معلمات إجمالية أكثر بكثير من النموذج الكثيف دون زيادة مطابقة في التكلفة لكل رمز مميز؟

نظرًا لأن خبراء Top-k فقط هم من يطلقون كل رمز مميز، فإن الحوسبة النشطة تظل ثابتة تقريبًا حتى مع نمو إجمالي عدد المعلمات عن طريق إضافة المزيد من الخبراء.

ما هي المشكلة التي تعالجها خسارة موازنة التحميل (المساعدة) أثناء تدريب وزارة التربية والتعليم؟

وبدون تحقيق التوازن، يميل جهاز التوجيه إلى تفضيل حفنة من الخبراء. تعاقب الخسارة الإضافية الاستخدام غير المتكافئ، لذلك يتم تدريب جميع الخبراء.

يقوم Mixtral 8x7B بتنشيط 2 من خبرائه الثمانية لكل رمز مميز. ماذا يعني هذا بشأن حسابه مقابل حجمه؟

مع وجود 2 خبراء فقط من أصل 8 خبراء نشطين، تكون المعلمات النشطة لكل رمز مميز (حوالي 13 مليار) أصغر بكثير من إجمالي 47 مليار تقريبًا، مما يقلل من تكلفة الاستدلال.

ما هو الجانب السلبي الحقيقي لنماذج MoE مقارنة بالنماذج الكثيفة ذات القدرة المتساوية؟

على الرغم من أن عددًا قليلاً فقط من الخبراء يقومون بالحساب لكل رمز، يجب تحميل أوزان كل خبير في الذاكرة، مما يجعل نماذج وزارة التعليم متعطشة للذاكرة لتقديم الخدمة.