نموذج مكافأة برادلي تيري
يعد نموذج برادلي-تيري طريقة إحصائية عمرها قرن من الزمان لتحويل المقارنات الزوجية (أ يدق ب) إلى درجات رقمية.
نظرة عامة
In modern AI it powers reward models that learn human preferences from 'which answer is better?' labels, the backbone of RLHF.
الغوص العميق
يفترض برادلي تيري، الذي تم تقديمه في عام 1952، أن كل عنصر لديه درجة قوة مخفية، واحتمال أن يتفوق العنصر "أ" على العنصر "ب" هو الوظيفة اللوجستية لفارق درجاتهم. في محاذاة الذكاء الاصطناعي، يتم تعيين هذا بدقة على بيانات التفضيل: يرى واضعو العلامات البشرية استجابتين نموذجيتين ويختاران الأفضل، بدلاً من إعطاء تقييمات مطلقة يصعب معايرتها. يتم تدريب نموذج المكافأة، وهو عادةً نموذج اللغة ذو رأس الإخراج العددي، بحيث تحصل الاستجابة التي يفضلها البشر على مكافأة عددية أعلى. الخسارة هي الاحتمالية اللوغاريتمية السلبية لاحتمالية برادلي-تيري: تعظيم اللوغاريتم السيني لـ (مكافأة المختار ناقص مكافأة المرفوضة). يقوم نموذج المكافأة الناتج بعد ذلك بتسجيل مخرجات عشوائية، مما يوفر إشارة مفادها أن خوارزميات التعلم المعزز مثل PPO تعمل على تحسينها لجعل النماذج أكثر فائدة ومواءمة.
البصيرة الفنية
خسارة التدريب للمقارنة هي ببساطة ناقص اللوغاريتم السيني لـ (r_chosen − r_rejected)، وبالتالي فإن النموذج يتعلم فقط الاختلافات النسبية. وهذا يعني أنه لا يمكن تحديد المكافآت إلا من خلال ثابت إضافي؛ المقياس المطلق تعسفي. نظرًا لأن المقارنات أسهل وأكثر اتساقًا بالنسبة للبشر من نتائج من 1 إلى 10، فإن بيانات برادلي-تيري أقل تشويشًا. أظهر تحسين التفضيل المباشر لاحقًا أنه يمكنك تخطي نموذج المكافأة المنفصل وتحسين هدف برادلي-تيري مباشرة في السياسة.
التأثير الاستراتيجي
قرارات أوضح
يساعدك على فصل المطالبات الفنية الواضحة عن لغة التسويق.
التكلفة والميزانية
يمكنك طرح أسئلة تنفيذ أفضل قبل إنفاق المال أو الوقت.
الفريق وسير العمل
تتخذ الفرق ذات الفهم المشترك قرارات أفضل بشأن المنتجات والسياسات والتعلم.
مستقبل نمذجة مكافأة برادلي تيري
يفترض برادلي تيري تصنيفًا واحدًا ثابتًا وتفضيلات متعدية، والتي تنهار عندما يختلف البشر أو تدور التفضيلات. تتجه الأبحاث نحو النماذج التي تلتقط توزيعات التفضيلات، والمكافآت متعددة الأبعاد (المساعدة، والسلامة، والصدق بشكل منفصل)، وأساليب مثل تعلم ناش من ردود الفعل البشرية التي تسقط افتراض النتيجة الواحدة. يقوم DPO وأشكاله المختلفة بشكل متزايد بدمج هدف برادلي-تيري مباشرة في التدريب على السياسات. توقع مخططات مقارنة أكثر ثراءً، بما في ذلك تصنيفات أكثر من عنصرين وتفضيلات مرجحة بالثقة، لتقليل اختراق المكافآت.
التنفيذ في العالم الحقيقي
تدريب نموذج المكافأة في RLHF الذي يصنف استجابتين لروبوتات الدردشة ويغذي الإشارة الأفضل والأسوأ لضبط PPO.
يقوم تحسين التفضيل المباشر بضبط النموذج مباشرة على أزواج الإجابات المختارة مقابل المرفوضة باستخدام فقدان السجل السيني لبرادلي-تيري.
ترتيب لاعبي الشطرنج أو الرياضات الإلكترونية عبر Elo، وهو رياضيًا قريب من نموذج برادلي-تيري فيما يتعلق بنتائج اللعبة.
إنشاء تصنيف لتوصيات المحتوى من خلال بيانات النقر "المستخدمون الذين يفضلون A على B" بدلاً من تقييمات النجوم المطلقة.
المخاطر والدرابزين
قد تستخدم الفرق المختلفة نفس المصطلح بشكل مختلف، لذا حدد النطاق مبكرًا.
يمكن أن تبدو المعايير قوية بينما يكون الأداء في العالم الحقيقي غير متساوٍ.
غالبًا ما يؤدي تجاهل جودة البيانات وخطط التقييم إلى نتائج هشة.
خارطة طريق التنفيذ
ابدأ بتعريف لغة واضحة للنتيجة التي تحتاجها.
اختر مقياس نجاح واحد وحالة فشل واحدة قبل الاختبار.
قم بتشغيل برنامج تجريبي صغير يحتوي على بيانات تمثيلية، وليس مجموعة تجريبية مصقولة.
قم بتوثيق المجالات التي تساعد فيها نماذج مكافآت برادلي-تيري والأماكن الأبسط التي تكون فيها الطرق أفضل.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Bradley-Terry Reward Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
نمذجة المكافأة
الأسئلة المتداولة
What is Bradley-Terry Reward Modeling?
يعد نموذج برادلي-تيري طريقة إحصائية عمرها قرن من الزمان لتحويل المقارنات الزوجية (أ يدق ب) إلى درجات رقمية. في الذكاء الاصطناعي الحديث، يتم تشغيل نماذج المكافأة التي تتعلم التفضيلات البشرية من خلال "أي إجابة أفضل؟" التسميات، العمود الفقري لـ RLHF.
ما الذي يحوله نموذج برادلي-تيري إلى درجات رقمية؟
يأخذ برادلي تيري مقارنات زوجية "أ يتفوق على ب" ويستنتج درجة قوة مخفية لكل عنصر، وهذا هو السبب في أنه يناسب تصنيف التفضيلات البشرية بشكل جيد.
في برادلي تيري، احتمال أن يتغلب A على B هو دالة على ماذا؟
يقوم النموذج بتعيين P(A يدق B) مساوية للفرق اللوجستي (السيني) بين درجات القوة المخفية لـ A وB.
لماذا لا يمكن تحديد مكافآت برادلي-تيري إلا من خلال ثابت إضافي؟
تستخدم خسارة التدريب فقط الفرق بين المكافآت المختارة والمرفوضة، لذا فإن تحويل جميع الدرجات بنفس الثابت يترك الخسارة دون تغيير؛ المقياس المطلق تعسفي.
ما هي الخسارة القياسية لمقارنة التفضيلات الفردية في نموذج المكافآت؟
يقلل احتمال السجل السلبي لبرادلي-تيري إلى ناقص السجل السيني لفارق المكافأة المختارة ناقص الرفض المرفوض، مما يدفع مكافأة الاستجابة المختارة إلى الأعلى.
ما هي الطريقة التي تتخطى نموذج المكافأة المنفصل من خلال تحسين هدف برادلي-تيري مباشرة على السياسة؟
يقوم DPO بإعادة صياغة هدف تفضيل Bradley-Terry بحيث يمكن تطبيقه مباشرة على نموذج السياسة، مما يزيل الحاجة إلى التدريب والاستعلام عن نموذج مكافأة مستقل.