الدليل الفني

مجموعات تدريب DeepSpeed ​​وMegatron

تعد DeepSpeed (Microsoft) وMegatron-LM (NVIDIA) من البرامج التي تجعل نماذج التدريب التي تحتوي على مليارات المعلمات عبر آلاف وحدات معالجة الرسومات ممكنة بالفعل.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

Without them, today's frontier models simply could not fit in memory or finish training in a reasonable time.

الغوص العميق

من المستحيل تدريب نموذج كبير على وحدة معالجة رسومات واحدة لأن الأوزان والتدرجات وحالات المُحسِّن غير مناسبة. تقوم هذه الأكوام بتقسيم العمل عبر العديد من وحدات معالجة الرسومات. كانت Megatron-LM رائدة في التوازي الموتر، حيث تقوم بتقطيع مضاعفات المصفوفة الفردية داخل كل طبقة عبر وحدات معالجة الرسوميات، بالإضافة إلى توازي خطوط الأنابيب، الذي يضع طبقات مختلفة على وحدات معالجة رسوميات مختلفة. مساهمة DeepSpeed ​​المميزة هي ZeRO (Zero Redundancy Optimizer)، والتي تعمل على تقسيم حالات المُحسِّن والتدرجات والمعلمات عبر وحدات معالجة الرسومات بدلاً من تكرارها، مما يؤدي إلى قطع الذاكرة لكل وحدة معالجة رسومات بشكل كبير. غالبًا ما يتم الجمع بين الاثنين (Megatron-DeepSpeed) لتدريب نماذج مثل BLOOM-176B وMegatron-Turing NLG. كما أنها تضيف دقة مختلطة، وفحص التنشيط، والتفريغ إلى وحدة المعالجة المركزية (CPU) أو NVMe، لذا يتم تدريب النماذج الضخمة على أجهزة محدودة.

البصيرة الفنية

يحتوي Zero على ثلاث مراحل لزيادة توفير الذاكرة: حالات مُحسِّن أجزاء المرحلة الأولى، والمرحلة الثانية أيضًا تدرجات القطع، والمرحلة الثالثة تقسم المعلمات نفسها، وتجميعها عند الطلب أثناء التمريرات الأمامية والخلفية. بالاشتراك مع التوازي الموتر (داخل الطبقة) وتوازي خطوط الأنابيب (بين الطبقات)، يشكل هذا "توازيًا ثلاثي الأبعاد". يكمن التوتر الرئيسي في عبء الاتصالات: فكل تقسيم للجزء يضيف حركة مرور من وحدة معالجة الرسومات إلى وحدة معالجة الرسومات، لذلك يقوم المهندسون بضبط التقسيم للحفاظ على تشبع روابط NVLink وInfiniBand السريعة.

التأثير الاستراتيجي

التكلفة والميزانية

تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.

قرارات أوضح

يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.

مراقبة الجودة

تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.

مستقبل مجموعات تدريب DeepSpeed وMegatron

توقع تكاملًا أكثر إحكامًا مع FSDP الأصلي لـ PyTorch (توازي البيانات المقسمة بالكامل)، والذي استوعب العديد من أفكار Zero، مما أدى إلى عدم وضوح الخط الفاصل بين مجموعات الأبحاث والأطر الأساسية. تهدف الأساليب المعتمدة على المترجم ومخططات التوازي التلقائي إلى إزالة الضبط اليدوي. مع نمو مجموعات التدريب نحو مئات الآلاف من المسرعات، أصبح التسامح مع الأخطاء والقياس المرن والتواصل المتداخل مع العمليات الحسابية هي الحدود الهندسية المهيمنة، إلى جانب دعم الأجهزة الجديدة مثل NVIDIA Blackwell ورقائق التدريب المخصصة.

التنفيذ في العالم الحقيقي

تدريب نموذج BLOOM-176B المفتوح متعدد اللغات باستخدام مجموعة Megatron-DeepSpeed ​​المدمجة عبر مئات وحدات معالجة الرسومات.

Microsoft وNVIDIA يدربان نموذج Megatron-Turing NLG الذي يحتوي على 530 مليار معلمة مع التوازي ثلاثي الأبعاد.

يسمح تطبيق ZeRO-Offload للباحثين بضبط النماذج ذات المليارات من المعلمات على وحدة معالجة الرسومات لمحطة عمل واحدة عن طريق نقل حالات المُحسِّن إلى ذاكرة الوصول العشوائي لوحدة المعالجة المركزية.

استخدام فحص التنشيط في هذه الأكوام لملاءمة نوافذ السياق الأطول عن طريق إعادة حساب عمليات التنشيط بدلاً من تخزينها جميعًا.

المخاطر والدرابزين

يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.

غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.

يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.

خارطة طريق التنفيذ

1

تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.

2

المعيار في ظل ظروف التحميل والبيانات الواقعية.

3

مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.

4

قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DeepSpeed and Megatron Training Stacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

GPTQ وAWQ التكميم بعد التدريب

الأسئلة المتداولة

What is DeepSpeed and Megatron Training Stacks?

تعد DeepSpeed (Microsoft) وMegatron-LM (NVIDIA) من البرامج التي تجعل نماذج التدريب التي تحتوي على مليارات المعلمات عبر آلاف وحدات معالجة الرسومات ممكنة بالفعل. وبدونها، لن تتمكن النماذج الرائدة اليوم من استيعاب الذاكرة أو إنهاء التدريب في وقت معقول.

ما هو الغرض الأساسي من مُحسِّن DeepSpeed's ZeRO؟

تعمل تقنية ZeRO (Zero Redundancy Optimizer) على التخلص من تكرار الذاكرة عن طريق تقسيم حالات المحسن والتدرجات والمعلمات عبر وحدات معالجة الرسومات بدلاً من تكرارها على كل جهاز.

كيف يعمل توازي الموتر، كما كان رائدًا في Megatron-LM، على تقسيم النموذج؟

يعمل توازي الموتر على تقسيم العمليات الحسابية داخل طبقة واحدة (مثل ضرب مصفوفة كبيرة) عبر وحدات معالجة رسوميات متعددة، وهو ما يمثل تقسيمًا داخل الطبقة.

ما هي مرحلة Zero التي توفر أكبر قدر من التوفير في الذاكرة من خلال مشاركة معلمات النموذج نفسها أيضًا؟

معلمات أجزاء Zero Stage 3 بالإضافة إلى التدرجات وحالات المُحسِّن، وجمعها حسب الطلب، مما يوفر أكبر تقليل للذاكرة.

ما الذي يتم استبداله بـ "نقطة تفتيش التنشيط" لحفظ الذاكرة أثناء التدريب؟

تعمل نقاط تفتيش التنشيط على تخزين عدد أقل من عمليات التنشيط الوسيطة وإعادة حسابها أثناء الانتشار العكسي، مما يؤدي إلى استبدال العمليات الحسابية الإضافية بذاكرة منخفضة.

لماذا يُطلق على الجمع بين هذه التقنيات غالبًا اسم "التوازي ثلاثي الأبعاد"؟

يجمع التوازي ثلاثي الأبعاد بين ثلاث إستراتيجيات متعامدة: توازي البيانات، وتوازي الموتر (داخل الطبقة)، وتوازي خطوط الأنابيب (بين الطبقات).