الدليل الفني

التوازي بين الخبراء لخدمة وزارة التربية والتعليم

يعمل التوازي الخبير على تقسيم العديد من "خبراء" التغذية الأمامية لنموذج مزيج الخبراء عبر وحدات معالجة الرسومات المختلفة بحيث يحتفظ كل جهاز فقط بشريحة من المعلمات.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It is the key to serving trillion-parameter MoE models cheaply, since only a few experts run per token.

الغوص العميق

تحل طبقة خليط الخبراء (MoE) محل شبكة تغذية أمامية كبيرة واحدة مع العديد من الشبكات الأصغر (الخبراء) بالإضافة إلى جهاز توجيه يختار الخبراء الأعلى (غالبًا 1 أو 2) لكل رمز مميز. يضع توازي الخبراء (EP) خبراء مختلفين على وحدات معالجة الرسومات المختلفة. عند الاستدلال، يقرر جهاز التوجيه الخبراء الذين يحتاجهم كل رمز مميز، ثم تقوم خطوة الاتصال الشامل بتبديل الرموز المميزة إلى وحدات معالجة الرسومات التي تحتوي على الخبراء المختارين، وتشغيل FFN، وإعادة ترتيب النتائج عشوائيًا. يتيح ذلك للنموذج أن يحتوي على معلمات إجمالية ضخمة (متفرقة) مع تنشيط جزء صغير فقط لكل رمز مميز (تقلبات منخفضة). تستخدم نماذج مثل Mixtral 8x7B وDeepSeek-V3 وGPT-OSS هذا. تتمثل الأجزاء الصلبة في موازنة التحميل عبر الخبراء والقفزتين المكلفتين الشاملتين لكل طبقة.

البصيرة الفنية

الآلية الأساسية هي مجموعتان شاملتان لكل طبقة وزارة التربية والتعليم: الإرسال (إرسال الرموز المميزة إلى خبرائها) والجمع (جمع المخرجات مرة أخرى). ونظرًا لأن التوجيه يعتمد على البيانات، فإن عدد الرموز المميزة التي تصل إلى كل خبير يختلف، مما يتسبب في عدم توازن التحميل و"التباطؤ". تضيف أنظمة الخدمة عوامل السعة، والمخازن المؤقتة المتخصصة، وإسقاط الرمز المميز أو الحشو للحفاظ على GEMMs (مضاعفات المصفوفة) موحدة، وغالبًا ما تتداخل مع الاتصال الشامل مع حسابات الخبراء لإخفاء زمن الوصول.

التأثير الاستراتيجي

التكلفة والميزانية

تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.

قرارات أوضح

يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.

مراقبة الجودة

تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.

مستقبل التوازي بين الخبراء لخدمة وزارة التربية والتعليم

توقع تصميمًا مشتركًا أكثر إحكامًا للتوجيه والأجهزة: نواة مدمجة لحوسبة الإرسال والحوسبة، ووحدات GEMM المجمعة التي تجمع العديد من الخبراء، وNVLink/InfiniBand-aware الكل إلى الكل. تعمل تقنيات مثل موازنة DeepSeek الإضافية الخالية من الخسائر والتوجيه المحدود للعقد على تقليل حركة المرور عبر العقد. سيخصص العرض المقسم وحدات معالجة الرسومات "الخبراء" المنفصلة عن وحدات معالجة الرسومات الخاصة بالانتباه، كما أن أعداد الخبراء الأكبر (المئات) مع أعلى مستوى دقة ستدفع MoE نحو التناثر الشديد مع الحفاظ على تكلفة الرمز المميز ثابتة.

التنفيذ في العالم الحقيقي

خدمة Mixtral 8x7B عبر 2-4 وحدات معالجة رسوميات عن طريق وضع 2-4 من خبراءها الثمانية على كل جهاز

DeepSeek-V3 يستخدم التوجيه المحدود للعقدة لتحديد عدد العقد التي يغطيها خبراء الرمز المميز، مما يؤدي إلى قطع العقد البينية من الكل إلى الكل

استخدام الوضع المتوازي الخبير vLLM أو SGLang لاستضافة نموذج متفرق يزيد عن 200 جيجا بايت على عقدة واحدة مكونة من 8 وحدات معالجة رسومات

الجمع بين التوازي الخبير والتوازي الموتر على طبقات الانتباه في نشر EP+TP المختلط

المخاطر والدرابزين

يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.

غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.

يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.

خارطة طريق التنفيذ

1

تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.

2

المعيار في ظل ظروف التحميل والبيانات الواقعية.

3

مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.

4

قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Expert Parallelism for MoE Serving quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

خدمة التعبئة المسبقة وفك التشفير المفصلة

الأسئلة المتداولة

What is Expert Parallelism for MoE Serving?

يعمل التوازي الخبير على تقسيم العديد من "خبراء" التغذية الأمامية لنموذج مزيج الخبراء عبر وحدات معالجة الرسومات المختلفة بحيث يحتفظ كل جهاز فقط بشريحة من المعلمات. إنه المفتاح لخدمة نماذج وزارة البيئة ذات تريليون معلمة بتكلفة رخيصة، نظرًا لأن عددًا قليلاً فقط من الخبراء يعملون لكل رمز مميز.

ما الذي يوزعه التوازي الخبير عبر وحدات معالجة الرسومات؟

يضع توازي الخبراء خبراء مختلفين (شبكات FFN الفرعية لطبقة MoE) على وحدات معالجة رسومات مختلفة، بحيث يحمل كل جهاز مجموعة فرعية فقط من الخبراء.

ما هو نمط الاتصال الذي يعتبر أساسيًا في موازاة خبراء وزارة التربية والتعليم؟

تحتاج كل طبقة وزارة التعليم عادةً إلى الكل إلى الكل لإرسال الرموز المميزة إلى خبرائها وطبقة أخرى من الكل إلى الكل لدمج المخرجات مرة أخرى.

لماذا تحافظ وزارة التعليم على انخفاض الحوسبة لكل رمز على الرغم من المعلمات الإجمالية الضخمة؟

يقوم جهاز التوجيه بتنشيط الخبراء المتميزين فقط (غالبًا 1-2) لكل رمز مميز، لذلك تظل عمليات FLOP صغيرة على الرغم من أن النموذج يحتوي على العديد من الخبراء إجمالاً.

ما هي المشكلة التي تنشأ لأن التوجيه يعتمد على البيانات؟

نظرًا لأن اختيارات جهاز التوجيه تعتمد على الإدخال، يتلقى بعض الخبراء العديد من الرموز المميزة أكثر من غيرهم، مما يؤدي إلى عدم توازن التحميل والتشتت.

ما هي التقنية الشائعة للحفاظ على تضاعف حجم المصفوفة الخبيرة؟

تحدد مجموعات الخدمة سعة لكل خبير (الحد الأقصى لعدد الرموز المميزة) وتضع الرموز المميزة أو تسقطها بعد ذلك بحيث يكون لـ GEMM الخاص بكل خبير شكل يمكن التنبؤ به.