تطبيع المكافأة المجمعة في RLHF
تعمل تسوية المكافآت المجمعة على توحيد مكافآت النموذج ضمن مجموعة من الاستجابات لنفس الموجه، مما يحول النتائج المزعجة إلى إشارة تدريب مستقرة.
نظرة عامة
It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.
الغوص العميق
في التعلم المعزز من ردود الفعل البشرية (RLHF)، يقوم النموذج بإنشاء استجابات ويقوم نموذج المكافأة بتسجيلها، لكن المكافآت الأولية تكون صاخبة وتختلف بشكل كبير عبر المطالبات. تعمل تسوية المكافآت المجمعة على إصلاح هذه المشكلة عن طريق أخذ عينات من مجموعة من الاستجابات المتعددة لنفس الموجه، ثم تسوية كل مكافأة عن طريق طرح متوسط المجموعة والقسمة على الانحراف المعياري للمجموعة. تصبح هذه النتيجة z هي الميزة. يعد هذا النهج أساسيًا في تحسين السياسة النسبية للمجموعة (GRPO)، الذي قدمته شركة DeepSeek، والتي اشتهرت بدعم منطق DeepSeek-R1. والأهم من ذلك، أن GRPO تلغي شبكة القيمة المنفصلة (الناقدة) التي تستخدمها PPO، نظرًا لأن متوسط المجموعة بمثابة خط الأساس. وهذا يجعل التدريب أبسط وأرخص وأكثر كفاءة في الذاكرة مع الحفاظ على إشارة التدرج جيدة الحجم.
البصيرة الفنية
بالنسبة لمجموعة من المخرجات ذات المكافآت r_1...r_G، الميزة هي A_i = (r_i − mean(r)) / std(r). تحصل الاستجابات الأفضل من متوسط مجموعتهم على ميزة إيجابية ويتم تعزيزها؛ يتم دفع الأسوأ من المتوسط إلى الأسفل. لأن المقارنة نسبية ضمن مقياس المكافأة المطلق الفوري، ويتم إلغاء الصعوبة لكل عاجل، مما يقلل التباين. تحافظ GRPO على هدف PPO المقطوع وعقوبة KL مقابل سياسة مرجعية لمنع النموذج من الانجراف بعيدًا.
التأثير الاستراتيجي
قرارات أوضح
يساعدك على فصل المطالبات الفنية الواضحة عن لغة التسويق.
التكلفة والميزانية
يمكنك طرح أسئلة تنفيذ أفضل قبل إنفاق المال أو الوقت.
الفريق وسير العمل
تتخذ الفرق ذات الفهم المشترك قرارات أفضل بشأن المنتجات والسياسات والتعلم.
مستقبل تطبيع المكافآت المجمعة في RLHF
ويعمل التطبيع المجمع على تغذية طفرة نماذج الاستدلال، حيث تتعلم النماذج من مكافآت يمكن التحقق منها مثل الإجابات الرياضية الصحيحة دون الحاجة إلى ناقد متعلم. تعمل الأبحاث على تحسينها: المناقشات حول ما إذا كان يجب القسمة على الانحراف المعياري، والتعامل مع المجموعات الصحيحة أو الخاطئة التي لا تنتج أي ميزة، وتوسيع نطاق حجم المجموعة. توقع أن تنتشر الأساليب المجمعة الخالية من النقد إلى استخدام الأدوات الوكيلة وتوليد الأكواد، حيث توفر أدوات التحقق التلقائي إشارات مكافأة وفيرة ورخيصة الثمن.
التنفيذ في العالم الحقيقي
تدريب نموذج الاستدلال الرياضي من خلال أخذ عينات من 16 حلاً لكل مشكلة ومكافأة أولئك الذين تزيد دقتهم عن متوسط المجموعة.
ضبط مدى فائدة برنامج الدردشة الآلية من خلال تطبيع نتائج نموذج المكافأة عبر العديد من ردود المرشحين على كل مطالبة مستخدم.
تحسين مساعد الترميز حيث يتم تسجيل كل حل تم اختباره من خلال ما إذا كان يجتاز اختبارات الوحدة، ثم يتم تطبيعه داخل المجموعة.
تقليل ذاكرة وحدة معالجة الرسومات في خط أنابيب RLHF عن طريق إسقاط شبكة الناقد PPO واستخدام متوسط المجموعة كخط أساسي بدلاً من ذلك.
المخاطر والدرابزين
قد تستخدم الفرق المختلفة نفس المصطلح بشكل مختلف، لذا حدد النطاق مبكرًا.
يمكن أن تبدو المعايير قوية بينما يكون الأداء في العالم الحقيقي غير متساوٍ.
غالبًا ما يؤدي تجاهل جودة البيانات وخطط التقييم إلى نتائج هشة.
خارطة طريق التنفيذ
ابدأ بتعريف لغة واضحة للنتيجة التي تحتاجها.
اختر مقياس نجاح واحد وحالة فشل واحدة قبل الاختبار.
قم بتشغيل برنامج تجريبي صغير يحتوي على بيانات تمثيلية، وليس مجموعة تجريبية مصقولة.
قم بالتوثيق حيث تساعد تسوية المكافآت المجمعة في RLHF وأين تكون الطرق الأبسط أفضل.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grouped Reward Normalization in RLHF quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
تطبيع الطول في تحسين التفضيلات
الأسئلة المتداولة
What is Grouped Reward Normalization in RLHF?
تعمل تسوية المكافآت المجمعة على توحيد مكافآت النموذج ضمن مجموعة من الاستجابات لنفس الموجه، مما يحول النتائج المزعجة إلى إشارة تدريب مستقرة. إنها الخدعة الأساسية وراء GRPO، الخوارزمية التي تدعم العديد من نماذج الاستدلال الحديثة.
في تطبيع المكافأة المجمعة، ما هي مكافأة كل استجابة مقارنة بها؟
يتم تحويل كل مكافأة إلى درجة z باستخدام المتوسط والانحراف المعياري لمجموعة الاستجابات لنفس الموجه.
ما هي الخوارزمية الأكثر ارتباطًا بتطبيع المكافآت المجمعة؟
تم تصميم GRPO، الذي قدمته DeepSeek والمستخدم في DeepSeek-R1، حول تسوية المكافآت داخل المجموعة.
ما هو مكون PPO القياسي الذي يزيله GRPO بشكل خاص؟
باستخدام متوسط المجموعة كخط أساسي، تقوم GRPO بإسقاط الناقد المتعلم، مما يوفر الذاكرة والحساب.
ماذا يحدث للاستجابة التي تكون مكافأتها أقل من متوسط مجموعتها؟
إن طرح متوسط المجموعة يجعل الاستجابات الأقل من المتوسط لها ميزة سلبية، مما يدفع السياسة بعيدًا عنها.
لماذا يؤدي التطبيع داخل المجموعة إلى تقليل تباين التدريب؟
ونظرًا لأن المقارنات نسبية داخل كل موجه، فإن الاختلافات في النطاق المطلق والصعوبة المباشرة تتلاشى.