دليل اللغة AI

نماذج مكافأة العملية

تسجل نماذج مكافأة العمليات (PRMs) كل خطوة فردية من تفكير الذكاء الاصطناعي بدلاً من مجرد الإجابة النهائية.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

This matters because it catches faulty logic mid-stream, making models more reliable at math, coding, and multi-step reasoning.

الغوص العميق

معظم نماذج المكافأة هي نماذج "نتائج": فهي تنظر إلى الإجابة النهائية وتحكم على ما إذا كانت صحيحة أم خاطئة. بدلاً من ذلك، يقوم نموذج مكافأة العملية بتصنيف كل خطوة في سلسلة من التفكير، مع تعيين درجة الجودة أو الصحة لكل سطر من الحل. المثال الشهير هو عمل OpenAI لعام 2023 بعنوان "دعونا نتحقق خطوة بخطوة"، حيث تفوق فريق PRM الذي تم تدريبه على مجموعة بيانات PRM800K (حوالي 800000 تصنيف على مستوى الخطوة البشرية على حلول الرياضيات) بشكل كبير على الإشراف على النتائج فقط على معيار MATH. الميزة هي أن الإجابة النهائية يمكن أن تكون صحيحة عن طريق الحظ في حين أن المنطق معطل، أو خاطئة على الرغم من أن معظم الخطوات صحيحة. من خلال مكافأة الخطوات المتوسطة الصحيحة، تقدم PRMs تعليقات أكثر كثافة وأكثر استهدافًا، مما يعمل على تحسين عملية التحقق (اختيار أفضل الحلول من بين العديد من الحلول التي تم أخذ عينات منها) والتدريب من خلال التعلم المعزز.

البصيرة الفنية

عادةً ما يكون PRM عبارة عن محول يقوم بإخراج درجة عددية بعد كل خطوة تفكير، غالبًا عند رمز محدد خاص. لاختيار إجابة نهائية من العديد من السلاسل التي تم أخذ عينات منها، يمكنك تجميع درجات الخطوات، عادةً عن طريق أخذ الحد الأدنى من احتمالية الخطوة (السلسلة تكون قوية فقط بقدر أضعف خطوتها) أو المنتج. يعد جمع تسميات الخطوات أمرًا مكلفًا، لذا فإن أساليب مثل Math-Shepherd تقوم بتسمية الخطوات تلقائيًا عبر عمليات إطلاق Monte Carlo، وتقدير قيمة الخطوة من خلال عدد المرات التي تؤدي فيها إلى الإجابات الصحيحة.

التأثير الاستراتيجي

السرعة والحجم

يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.

الوصول والوصول

فهو يوسع الوصول عبر اللغات وأنماط الاتصال.

قرارات أوضح

يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.

مستقبل نماذج مكافأة العمليات

تعتبر PRMs عنصرًا أساسيًا في عصر نموذج الاستدلال. توقع المزيد من وضع العلامات التلقائية على الخطوات لخفض تكاليف التعليقات التوضيحية البشرية، وآليات إدارة المخاطر التوليدية التي تنتقد الخطوات باللغة الطبيعية بدلاً من إصدار نتيجة مجردة، والتوسع إلى ما هو أبعد من الرياضيات إلى التعليمات البرمجية، واستخدام الأدوات الوكيلة، والتفكير العلمي. كما أنها تقترن بشكل طبيعي مع البحث الشجري وحساب وقت الاختبار، حيث يقوم المدقق بتوجيه الفروع التي سيتم توسيعها. يتمثل التحدي الرئيسي المفتوح في اختراق المكافأة: حيث تتعلم النماذج إنتاج خطوات تبدو جيدة بالنسبة إلى PRM دون أن تكون صحيحة حقًا.

التنفيذ في العالم الحقيقي

إعادة ترتيب العشرات من نماذج الحلول لمسألة منافسة صعبة في MATH حسب درجة الخطوة، ثم إعادة السلسلة التي حصلت على أعلى الدرجات.

توجيه البحث الشجري في نموذج الاستدلال، وتوسيع الحلول الجزئية فقط التي يبلغ معدل PRM خطواتها المتوسطة بشكل كبير.

وضع العلامات التلقائية على بيانات التدريب باستخدام عمليات إطلاق Monte Carlo بأسلوب Math-Shepherd، بحيث يمكن تدريب PRM بدون تعليقات توضيحية بشرية شاملة.

التحقق من إنشاء التعليمات البرمجية خطوة بخطوة، ووضع علامة على السطر المحدد الذي يختلف فيه منطق الوظيفة عن المواصفات.

المخاطر والدرابزين

يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.

يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.

قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.

خارطة طريق التنفيذ

1

حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.

2

استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.

3

احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.

4

تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Process Reward Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

نماذج مسودة فك التشفير التأملية

الأسئلة المتداولة

What is Process Reward Models?

تسجل نماذج مكافأة العمليات (PRMs) كل خطوة فردية من تفكير الذكاء الاصطناعي بدلاً من مجرد الإجابة النهائية. وهذا أمر مهم لأنه يكتشف المنطق الخاطئ في منتصف الطريق، مما يجعل النماذج أكثر موثوقية في الرياضيات والبرمجة والاستدلال متعدد الخطوات.

ما الذي يميز نموذج مكافأة العملية في المقام الأول عن نموذج مكافأة النتيجة؟

تقوم آلية PRM بتعيين درجة لكل خطوة في سلسلة الاستدلال، في حين أن نموذج النتائج يحكم فقط على النتيجة النهائية.

ما هي مجموعة البيانات المعروفة من تسميات الرياضيات على مستوى الخطوة البشرية المرتبطة بأبحاث PRM؟

يحتوي PRM800K، الذي تم إصداره مع OpenAI's "Let's Verify Step by Step"، على ما يقرب من 800000 ملصق على مستوى الخطوة في حلول الرياضيات.

لماذا يمكن أن تكون إشارة المكافأة الخاصة بالنتيجة فقط مضللة؟

يغفل تسجيل النتائج الحالات التي تكون فيها الإجابة صحيحة عن طريق الحظ أو خاطئة على الرغم من العمل المتوسط ​​الجيد، وهو ما يتم تسجيله على مستوى الخطوة.

ما الذي يستخدمه أسلوب Math-Shepherd لتسمية الخطوات تلقائيًا؟

تقوم Math-Shepherd بتقدير قيمة الخطوة عن طريق أخذ عينات من العديد من الإكمالات من تلك النقطة وقياس عدد المرات التي تصل فيها إلى الإجابة الصحيحة.

ما هي المخاطر ذات الصلة بشكل خاص عند تدريب النماذج ضد PRM؟

يمكن للنماذج أن تتعلم التلاعب بالمدقق، وتنتج خطوات تبدو معقولة وتحرز نتائج جيدة ولكنها ليست في الواقع تفكيرًا سليمًا.