الدليل الفني

مشاركة نقاط التفتيش والتدريب القابل للاستئناف

تقنيات لحفظ حالة تدريب النموذج في أجزاء (أجزاء) بحيث يمكن حفظ النماذج العملاقة وإعادة تحميلها دون الاختناق في الذاكرة أو حدود القرص، وبالتالي يمكن للتشغيل المتعطل أن يستأنف بالضبط من حيث توقف.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

Essential for any training job that runs for days or weeks across many GPUs.

الغوص العميق

تمثل نقطة تفتيش التدريب لقطة لكل ما يلزم للاستئناف: أوزان النماذج، وحالات المُحسِّن، وجدول معدل التعلم، وموضع أداة تحميل البيانات، وبذور مولد الأرقام العشوائية. بالنسبة للنماذج الكبيرة، يمكن أن يصل حجم هذه اللقطة إلى مئات الجيجابايت، وهي كبيرة جدًا بالنسبة لملف واحد أو ذاكرة جهاز واحد. تقوم عملية تقسيم نقاط التفتيش بتقسيم اللقطات عبر العديد من الملفات والعديد من الرتب، بحيث تكتب كل وحدة معالجة رسومات فقط شريحتها الخاصة بالتوازي. يقوم التدريب القابل للاستئناف بعد ذلك بإعادة تحميل تلك القطع واستعادة الحالة الكاملة بدقة. بدونها، سيتعين إعادة التشغيل لعدة أسابيع والذي يتعطل عند الساعة 200 من الصفر. أطر عمل مثل PyTorch Distributed Checkpoint، وDeepSpeed، وتنسيق أدوات الأمان المجزأة الخاصة بـ Hugging Face Hub، تجعل هذا الأمر روتينيًا.

البصيرة الفنية

تعمل المشاركة لأن التدريب الموزع يقوم بالفعل بتقسيم الأوزان وحالات المُحسِّن عبر الرتب (عبر البيانات أو الموتر أو موازية الصفر). تقوم كل رتبة بتسلسل القسم الخاص بها فقط، غالبًا إلى تنسيقات مثل أدوات الأمان التي تسمح بالتحميل البطيء المعين للذاكرة. يقوم ملف الفهرس بتعيين أسماء المعلمات إلى ملفات الجزء. للاستئناف بشكل حتمي، يستمر النظام أيضًا في حالات RNG، وعدد خطوات المحسن، وإزاحة أداة تحميل البيانات الدقيقة، بحيث تقوم إعادة التشغيل بإعادة إنتاج نفس تسلسل الدُفعات.

التأثير الاستراتيجي

التكلفة والميزانية

تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.

قرارات أوضح

يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.

مراقبة الجودة

تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.

مستقبل تقاسم نقاط التفتيش والتدريب القابل للاستئناف

تتحول نقاط التفتيش من حدث دوري لإيقاف العالم إلى شيء غير متزامن ومجاني تقريبًا. توقع المزيد من نقاط التفتيش المتداخلة في الذاكرة والتي تكتب الأجزاء في الخلفية أثناء استمرار التدريب، بالإضافة إلى نقاط التفتيش المرمزة والمكررة التي تنجو من فشل العقد الشائع على نطاق ألف وحدة معالجة رسومات. ستستضيف مخازن الكائنات السحابية وطبقات NVMe المحلية الأسرع الأجزاء، وستستمر التنسيقات القياسية مثل أدوات الأمان في تحسين التحميل الآمن والسريع والجزئي لاستئناف التدريب ونشر الاستدلال.

التنفيذ في العالم الحقيقي

يعمل النموذج الحدودي عبر آلاف وحدات معالجة الرسومات التي تحفظ تلقائيًا نقاط التفتيش المقسمة كل بضع مئات من الخطوات، بحيث لا تكلف العقدة الفاشلة سوى دقائق، وليس أيامًا.

يقوم Hugging Face بتوزيع نموذج مفتوح كبير على شكل أجزاء متعددة من أجهزة الأمان بالإضافة إلى ملف Index.json حتى يتمكن المستخدمون من تنزيله وتحميله قطعة تلو الأخرى.

باحث يستأنف الضبط الدقيق المتقطع الذي يستعيد زخم المحسن الدقيق وعدد الخطوات وموضع أداة تحميل البيانات للمتابعة بسلاسة.

تدريب فوري على وحدات معالجة الرسوميات السحابية الوقائية الرخيصة، حيث تسمح نقاط التفتيش المجزأة المتكررة للوظيفة بالبقاء على قيد الحياة عند إخلائها وإعادة جدولتها.

المخاطر والدرابزين

يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.

غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.

يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.

خارطة طريق التنفيذ

1

تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.

2

المعيار في ظل ظروف التحميل والبيانات الواقعية.

3

مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.

4

قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Checkpoint Sharding and Resumable Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

Slurm لمجموعات تدريب الذكاء الاصطناعي

الأسئلة المتداولة

What is Checkpoint Sharding and Resumable Training?

تقنيات لحفظ حالة تدريب النموذج في أجزاء (أجزاء) بحيث يمكن حفظ النماذج العملاقة وإعادة تحميلها دون الاختناق في الذاكرة أو حدود القرص، وبالتالي يمكن للتشغيل المتعطل أن يستأنف بالضبط من حيث توقف. ضروري لأي مهمة تدريبية تستمر لأيام أو أسابيع عبر العديد من وحدات معالجة الرسومات.

لماذا يتم تقسيم نقاط التفتيش ذات النماذج الكبيرة إلى أجزاء؟

نقاط التفتيش الضخمة (مئات الجيجابايت) غير عملية كملف واحد؛ يتيح التقسيم للعديد من الرتب كتابة شرائحها بشكل متوازٍ وتمكين التحميل المتعدد التعريف.

إلى جانب أوزان النموذج، ما الذي يجب أن تقوم نقطة التفتيش القابلة للاستئناف بحفظه عادةً؟

للاستئناف تمامًا، تقوم نقطة التفتيش بتخزين حالات المُحسِّن، وحالات مولد الأرقام العشوائية، وعدد الخطوات، والمكان الذي توقف فيه مُحمل البيانات.

ما هي الفائدة الرئيسية للتدريب القابل للاستئناف للوظائف الطويلة؟

باستخدام نقاط التحقق القابلة للاستئناف، يعيد التشغيل المتقطع تحميل آخر حالة محفوظة له ويستمر، بدلاً من إهدار أيام الحوسبة.

كيف تساهم كل رتبة GPU عادة في نقطة تفتيش مجزأة؟

نظرًا لأن التدريب الموزع يقسم النموذج عبر الرتب بالفعل، فإن كل رتبة تكتب شريحتها فقط، مما يجعل الحفظ متوازيًا وفعالاً في الذاكرة.

ما هو الدور الذي يلعبه ملف الفهرس في نقاط التفتيش المقسمة؟

يسجل الفهرس (على سبيل المثال، Index.json) الجزء الذي يحمل كل معلمة حتى تتمكن أدوات التحميل من جلب الأجزاء الصحيحة وإعادة تجميعها.