ضبط اللعب الذاتي
يعمل الضبط الذاتي على تحسين النموذج من خلال جعله يتنافس مع مخرجاته السابقة أو يتعلم منها، مما يؤدي إلى توليد إشارة التدريب الخاصة به.
نظرة عامة
It matters because it can push performance beyond the supervised data using little or no extra human labeling.
الغوص العميق
اللعب الذاتي له جذور عميقة في لعبة الذكاء الاصطناعي: لقد وصل AlphaGo Zero وAlphaZero إلى اللعب فوق طاقة البشر من خلال لعب ملايين الألعاب ضد أنفسهم، دون وجود سجلات ألعاب بشرية. وتظهر الروح نفسها الآن في الضبط الدقيق لنموذج اللغة. في SPIN (Self-Play fIne-tuNing)، يولد النموذج الحالي استجابات للمطالبات، ويدفع التدريب النموذج إلى تمييز الإجابات التي تم إنشاؤها عن الإجابات الأصلية المكتوبة بواسطة الإنسان، ويعامل نفسه على أنه اللاعب والخصم في نفس الوقت. ومع التكرارات المتعاقبة، يصبح "الخصم" (نقطة التفتيش السابقة) أقوى، لذلك يجب أن يستمر النموذج في التحسن، وسد الفجوة تدريجيًا مع التوزيع المستهدف. تكمن الجاذبية الكبيرة في كفاءة البيانات: حيث يمكن الضغط على مجموعة بيانات ثابتة خاضعة للإشراف لتحقيق المزيد من المكاسب دون جمع عروض توضيحية أو تفضيلات بشرية جديدة.
البصيرة الفنية
تقوم SPIN بإطار الضبط الدقيق كلعبة ثنائية اللاعبين مع خسارة بأسلوب DPO: يتم تدريب النموذج على تعيين احتمالية أعلى للاستجابات المرجعية البشرية مقارنةً بالاستجابات المولدة ذاتيًا من التكرار السابق. ونظرًا لأن نقطة التحقق السابقة توفر السلبيات، فإن الصعوبة تتدرج تلقائيًا مع تحسن النموذج. في أنظمة اللعب، يتم إقران اللعب الذاتي مع البحث (على سبيل المثال، MCTS) وشبكة القيمة، مما يؤدي إلى إنشاء منهج لا نهاية له من الخصوم الأصعب بشكل تدريجي دون بيانات خارجية.
التأثير الاستراتيجي
قرارات أوضح
يساعدك على فصل المطالبات الفنية الواضحة عن لغة التسويق.
التكلفة والميزانية
يمكنك طرح أسئلة تنفيذ أفضل قبل إنفاق المال أو الوقت.
الفريق وسير العمل
تتخذ الفرق ذات الفهم المشترك قرارات أفضل بشأن المنتجات والسياسات والتعلم.
مستقبل ضبط اللعب الذاتي
يعد اللعب الذاتي مرشحًا رائدًا لكسر جدار البيانات، نظرًا لأنه يصنع مناهجه الدراسية الخاصة به بدلاً من الاعتماد على التسميات البشرية النادرة. توقع النمو في المجالات التي يمكن التحقق منها مثل الرياضيات والتعليمات البرمجية وإثبات النظرية، حيث تقوم أدوات التحقق التلقائية بتقييم المحاولات التي يتم إنشاؤها ذاتيًا. تشمل المخاطر اختراق المكافأة وانهيار النموذج من التدريب على الكثير من المخرجات الاصطناعية، لذلك من المرجح أن تمزج الأنظمة المستقبلية اللعب الذاتي مع إشارات التأريض، وأجهزة التحقق، وردود الفعل الدورية من الإنسان أو العالم الحقيقي.
التنفيذ في العالم الحقيقي
يصل AlphaGo Zero وAlphaZero إلى لعبة Go والشطرنج والشوغي الخارقة بالكامل من خلال اللعب الذاتي بدون ألعاب بشرية
تعمل SPIN على تعزيز النتائج القياسية لـ LLM من خلال التمييز المتكرر بين مخرجاتها والإجابات المرجعية البشرية
تقوم نماذج الرياضيات والترميز بإنشاء محاولات للحلول، ثم التدريب على تلك التي تم التحقق منها بواسطة أدوات التحقق التلقائية أو اختبارات الوحدة
يقوم وكلاء التفاوض والحوار بتحسين الإستراتيجية من خلال اللعب بشكل متكرر على جانبي المحادثة ضد أنفسهم
المخاطر والدرابزين
قد تستخدم الفرق المختلفة نفس المصطلح بشكل مختلف، لذا حدد النطاق مبكرًا.
يمكن أن تبدو المعايير قوية بينما يكون الأداء في العالم الحقيقي غير متساوٍ.
غالبًا ما يؤدي تجاهل جودة البيانات وخطط التقييم إلى نتائج هشة.
خارطة طريق التنفيذ
ابدأ بتعريف لغة واضحة للنتيجة التي تحتاجها.
اختر مقياس نجاح واحد وحالة فشل واحدة قبل الاختبار.
قم بتشغيل برنامج تجريبي صغير يحتوي على بيانات تمثيلية، وليس مجموعة تجريبية مصقولة.
قم بالتوثيق حيث يساعد الضبط الذاتي للتشغيل الدقيق، وأين تكون الطرق الأبسط أفضل.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Self-Play Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
ضبط دقيق
الأسئلة المتداولة
What is Self-Play Fine-Tuning?
يعمل الضبط الذاتي على تحسين النموذج من خلال جعله يتنافس مع مخرجاته السابقة أو يتعلم منها، مما يؤدي إلى توليد إشارة التدريب الخاصة به. إنه أمر مهم لأنه يمكن أن يدفع الأداء إلى ما هو أبعد من البيانات الخاضعة للإشراف باستخدام القليل من العلامات البشرية الإضافية أو بدونها.
ما هو النظام الشهير الذي وصل إلى لعبة Superhuman Go Play باستخدام اللعب الذاتي فقط وبدون سجلات لعب بشرية؟
لقد تعلم برنامج AlphaGo Zero بالكامل من الألعاب التي لعبها ضد نفسه، بدءًا من اللعب العشوائي وتجاوز الإصدارات السابقة التي تم تدريبها على الألعاب البشرية.
في SPIN، ما هو دور "الخصم" الذي يجب على النموذج التغلب عليه؟
يتعامل SPIN مع الضبط الدقيق على أنه لعبة ذاتية اللعب حيث تكون المخرجات المولدة ذاتيًا للتكرار السابق بمثابة السلبيات التي يتعلم النموذج تجاوزها.
ما هي الميزة الرئيسية لكفاءة البيانات في الضبط الدقيق للتشغيل الذاتي؟
يقوم اللعب الذاتي بتصنيع إشارة التدريب الخاصة به، لذلك يمكن لمجموعة ثابتة خاضعة للإشراف أن تؤدي إلى مزيد من التحسينات دون جمع عروض توضيحية جديدة.
في الهدف التدريبي لـ SPIN، ما هو النموذج الذي تم دفعه للقيام به؟
يستخدم SPIN خسارة نمط DPO التي تكافئ الإجابات المرجعية البشرية المميزة (الإيجابية) عن الإجابات السابقة التي تم إنشاؤها ذاتيًا للنموذج (السلبية).
لماذا تزداد صعوبة ضبط اللعب الذاتي تلقائيًا مع التكرارات؟
ونظرًا لأن سلبيات كل تكرار تأتي من نموذج سابق أقوى، فإن النموذج يواجه تحديًا أصعب تدريجيًا بدون تصميم المنهج اليدوي.