الإشراف على العمليات للاستدلال الرياضي
يكافئ الإشراف على العملية النموذج مقابل كل خطوة صحيحة في سلسلة التفكير، وليس فقط الإجابة النهائية.
نظرة عامة
For math, where one wrong move ruins everything, grading the work itself produces far more reliable solvers.
الغوص العميق
تسجل معظم نماذج المكافآت الإجابة النهائية فقط (الإشراف على النتائج). يتيح ذلك للنموذج "أن يكون محظوظًا" - حيث يصل إلى الرقم الصحيح من خلال خطوات معيبة تؤدي إلى الإلغاء. بدلاً من ذلك، يقوم الإشراف على العمليات بتدريب نموذج مكافأة العملية (PRM) على تسميات بشرية أو الذكاء الاصطناعي التي تحدد كل خطوة وسيطة على أنها صحيحة أو غير صحيحة أو محايدة. أصدرت ورقة OpenAI لعام 2023 بعنوان "دعونا نتحقق خطوة بخطوة" PRM800K، وما يقرب من 800000 ملصق على مستوى الخطوة حول مشكلات MATH، وأظهرت أن أداة التحقق الخاضعة للإشراف على العملية قامت بحل 78% من مجموعة فرعية للاختبار مقابل خط أساس أضعف للنتائج فقط. يتم استخدام PRM للاستدلال لترتيب العديد من الحلول التي تم أخذ عينات منها، واختيار السلسلة ذات أعلى درجة دنيا للخطوة. كما أنه يقدم تعليقات قابلة للتفسير: يمكنك أن ترى بالضبط أين ينهار المنطق.
البصيرة الفنية
في وقت الاختبار، يقوم النموذج بأخذ عينات من العديد من الحلول المرشحة؛ يسجل PRM كل خطوة وعادةً ما تكون النتيجة الإجمالية للحل هي المنتج (أو الحد الأدنى) لاحتمالات الصحة لكل خطوة. ثم يقوم "الأفضل من بين N" باختيار السلسلة ذات أعلى الدرجات. ونظرًا لأن الرصيد يتم تعيينه محليًا، فإن إشارة التدريب تكون أكثر كثافة وأقل ضجيجًا من مكافأة نهاية التسلسل الفردية، مما يقلل من اختراق المكافأة حيث تؤدي الخطوات الخاطئة بالصدفة إلى الإجابات الصحيحة.
التأثير الاستراتيجي
السرعة والحجم
يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.
الوصول والوصول
فهو يوسع الوصول عبر اللغات وأنماط الاتصال.
قرارات أوضح
يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.
مستقبل الإشراف على العمليات للاستدلال الرياضي
يعد وضع العلامات اليدوية على الخطوات مكلفًا، لذا تتحول الأبحاث إلى الإشراف الآلي على العمليات - باستخدام عمليات إطلاق مونت كارلو (Math-Shepherd) لتقدير قيمة كل خطوة دون تسميات بشرية، أو استخدام نماذج أقوى للحكم على النماذج الأضعف. توقع أن تؤدي إدارة المخاطر (PRM) إلى تحسين التعلم المعزز، وليس مجرد إعادة الترتيب، وأن تنتشر إلى ما هو أبعد من الرياضيات إلى التعليمات البرمجية، والأدلة العلمية، والتخطيط الفعال متعدد الخطوات حيث تكون صحة مستوى الخطوة مهمة.
التنفيذ في العالم الحقيقي
مجموعة بيانات OpenAI's PRM800K: 800 ألف علامة على مستوى الخطوة البشرية تُستخدم لتدريب القائمين على التحقق على معيار MATH
Math-Shepherd: وضع علامة على صحة الخطوة تلقائيًا عبر عمليات نشر مونت كارلو لتجنب التعليقات التوضيحية البشرية المكلفة
إعادة ترتيب الأفضل من N: إنشاء 256 حلًا واختيار الحل الذي يسجل PRM أعلى النتائج في كل خطوة
أدوات التدريس التي تحدد السطر الدقيق في الحل الذي عمل عليه الطالب حيث يظهر الخطأ لأول مرة
المخاطر والدرابزين
يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.
يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.
قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.
خارطة طريق التنفيذ
حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.
استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.
احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.
تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Process Supervision for Math Reasoning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
استدلال سلسلة الفكر
الأسئلة المتداولة
What is Process Supervision for Math Reasoning?
يكافئ الإشراف على العملية النموذج مقابل كل خطوة صحيحة في سلسلة التفكير، وليس فقط الإجابة النهائية. بالنسبة للرياضيات، حيث تدمر خطوة واحدة خاطئة كل شيء، فإن تصنيف العمل نفسه ينتج عنه حلول أكثر موثوقية.
ما هو الفرق الرئيسي بين الإشراف على العملية والإشراف على النتائج؟
يوفر الإشراف على العملية إشارة مكافأة في كل خطوة تفكير، في حين أن الإشراف على النتائج يتحقق فقط من الإجابة النهائية.
لماذا يمكن أن يكون الإشراف على النتائج فقط مضللاً في مسائل الرياضيات؟
إن مكافأة الإجابة النهائية فقط تُنسب إلى الحلول "المحظوظة" حيث تؤدي الخطوات المتوسطة غير الصحيحة بالصدفة إلى النتيجة الصحيحة.
ما الذي أصدرته OpenAI جنبًا إلى جنب مع عمل "دعونا نتحقق خطوة بخطوة"؟
يحتوي PRM800K على ما يقرب من 800000 تعليق توضيحي بشري يشير إلى أن خطوات الاستدلال الفردية صحيحة أو غير صحيحة.
كيف يتم استخدام نموذج مكافأة العملية عادةً في وقت الاستدلال؟
يسجل PRM كل خطوة من العديد من الحلول المرشحة، مما يتيح اختيار الأفضل من سلسلة الاستدلال ذات أعلى الدرجات.
ما هو النهج الذي يقلل من الحاجة إلى ملصقات خطوة بشرية باهظة الثمن؟
تقوم Math-Shepherd بتقدير صحة الخطوات من خلال طرح الإكمالات وقياس عدد المرات التي تصل فيها إلى الإجابة الصحيحة، وتجنب التصنيف اليدوي.