دليل اللغة AI

نمذجة المكافأة

نموذج المكافأة عبارة عن شبكة عصبية مدربة على التنبؤ بمدى جودة استجابة الذكاء الاصطناعي، وتعمل كبديل آلي للحكم البشري.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It is the scoring engine that makes reinforcement learning from human feedback possible at scale.

الغوص العميق

تعمل نمذجة المكافآت على حل مشكلة عملية: لا يستطيع البشر تقييم كل واحد من ملايين المخرجات التي يولدها النموذج أثناء التدريب. وبدلاً من ذلك، يقوم القائمون على التصنيف بمقارنة مجموعة صغيرة من الاستجابات، وعادةً ما يختارون أي إجابتين لنفس الموجه هو الأفضل. يتم بعد ذلك تدريب نموذج المكافأة على هذه المقارنات لإخراج درجة عددية واحدة لأي زوج استجابة سريعة. الهدف التدريبي القياسي هو نموذج برادلي-تيري، الذي يحول التفضيلات الزوجية إلى احتمالية أن تتفوق إحدى الاستجابات على الأخرى. بمجرد التدريب، يمكن لنموذج المكافأة هذا تقييم مخرجات جديدة غير محدودة بتكلفة زهيدة، مما يوفر الإشارة التي تستخدمها الخوارزميات مثل PPO لتحسين نموذج اللغة. يتم أيضًا إعادة استخدام نماذج المكافأة في وقت الاستدلال لأخذ العينات الأفضل من N، حيث يتم إنشاء العديد من المرشحين وإرجاع المرشح الذي حصل على أعلى الدرجات.

البصيرة الفنية

عادةً ما يكون نموذج المكافأة هو نموذج اللغة الأساسية مع استبدال رأس التنبؤ بالرمز المميز بطبقة خطية واحدة تنبعث منها عددًا قياسيًا واحدًا. يزيد التدريب من احتمالية تسجيل الاستجابة المختارة بدرجة أعلى من الاستجابة المرفوضة: الخسارة = -log(sigmoid(r_chosen - r_rejected)). إن الفرق النسبي فقط هو الذي يهم، وبالتالي فإن المقياس المطلق اعتباطي. تتوقف الجودة على اتساق الملصق والتغطية الواسعة لأنماط الاستجابة.

التأثير الاستراتيجي

السرعة والحجم

يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.

الوصول والوصول

فهو يوسع الوصول عبر اللغات وأنماط الاتصال.

قرارات أوضح

يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.

مستقبل نمذجة المكافأة

تعالج الأبحاث أكبر نقاط الضعف في نماذج المكافآت: حيث يمكن "اختراقها" (تستغل النماذج مراوغات مثل تفضيل الطول)، كما أنها تنجرف خارج نطاق التوزيع مع تحسن السياسة. وتشمل الاتجاهات الواعدة نماذج مكافأة العمليات التي تسجل كل خطوة تفكير، والمجموعات وتقديرات عدم اليقين لمقاومة القرصنة، وعلامات التفضيل المولدة بواسطة الذكاء الاصطناعي (RLAIF)، ونماذج المكافآت التوليدية التي تنتج انتقادات ومبررات بدلاً من مجرد رقم مجرد.

التنفيذ في العالم الحقيقي

تشغيل RLHF للمساعدين مثل ChatGPT وClaude من خلال تسجيل استجابات المرشحين أثناء تدريب PPO

أخذ العينات الأفضل من N، حيث يقوم النموذج بإنشاء العديد من الإجابات ويقوم نموذج المكافأة باختيار الأفضل للمستخدم

"وحدات التحقق" الخاصة بالرياضيات والترميز أو نماذج المكافآت العملية التي تسجل خطوات تفكير متوسطة لتحسين حل المشكلات

ترتيب وتصفية بيانات التدريب الاصطناعية، مع الاحتفاظ فقط بالأجيال ذات الدرجات العالية لمزيد من الضبط

المخاطر والدرابزين

يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.

يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.

قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.

خارطة طريق التنفيذ

1

حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.

2

استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.

3

احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.

4

تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

نموذج مكافأة برادلي تيري

الأسئلة المتداولة

What is Reward Modeling?

نموذج المكافأة عبارة عن شبكة عصبية مدربة على التنبؤ بمدى جودة استجابة الذكاء الاصطناعي، وتعمل كبديل آلي للحكم البشري. إنه محرك التسجيل الذي يجعل التعلم المعزز من ردود الفعل البشرية ممكنًا على نطاق واسع.

ما هو الناتج الأساسي لنموذج المكافأة لزوج استجابة سريعة معين؟

يقوم نموذج المكافأة بتعيين موجه واستجابة لرقم عددي واحد يمثل الجودة المتوقعة أو التفضيل البشري.

ما نوع البيانات البشرية الأكثر استخدامًا لتدريب نماذج المكافآت؟

عادةً ما يقوم واضعو الملصقات بمقارنة استجابتين لنفس الموجه واختيار الأفضل؛ يقوم نموذج برادلي-تيري بتحويلها إلى مكافأة عددية.

ما الذي يتم تحسينه من خلال خسارة نموذج المكافأة القياسية؟

خسارة برادلي تيري، -log(sigmoid(r_chosen - r_rejected))، تهتم فقط بالترتيب النسبي، لذا فإن المقياس المطلق تعسفي.

ما هو "قرصنة المكافأة"؟

يحدث اختراق المكافأة عندما يجد النموذج اختصارات (مثل الطول المفرط أو الإطراء) التي يقدرها نموذج المكافأة غير المثالي بدرجة عالية ولكن البشر لا يفعلون ذلك.

كيف يتم اشتقاق نموذج المكافأة معماريا من نموذج اللغة؟

عادةً ما يعيد نموذج المكافأة استخدام العمود الفقري لـ LM ولكنه يستبدل الطبقة النهائية بطبقة تنتج مكافأة عددية واحدة.