数学推理过程监督
过程监督会奖励推理链中每一个正确步骤的模型,而不仅仅是最终答案。
概述
For math, where one wrong move ruins everything, grading the work itself produces far more reliable solvers.
深入探讨
大多数奖励模型仅对最终答案(结果监督)进行评分。这让模型“很幸运”——通过有缺陷的步骤达到正确的数字,但这些步骤会相互抵消。相反,流程监督在人类或人工智能标签上训练流程奖励模型(PRM),将每个中间步骤标记为正确、不正确或中性。 OpenAI 的 2023 年“让我们逐步验证”论文发布了 PRM800K,即数学问题的大约 800,000 个步骤级标签,并显示过程监督验证器解决了测试子集的 78%,而较弱的仅结果基线。 PRM 用于推理对许多采样解决方案进行排序,选择具有最高最小步骤分数的链。它还提供可解释的反馈:您可以准确地看到推理的错误之处。
技术洞察
在测试时,模型会采样许多候选解决方案; PRM 对每个步骤进行评分,解决方案的总体分数通常是每个步骤正确性概率的乘积(或最小值)。然后“Nest-of-N”选择得分最高的链。由于信用是在本地分配的,因此训练信号比单个序列结束奖励更密集且噪音更小,这减少了错误步骤同时产生正确答案的奖励黑客行为。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
数学推理过程监督的未来
手动步骤标记成本高昂,因此研究正在转向自动化过程监督——使用蒙特卡罗推出(Math-Shepherd)来估计每个步骤的值,而无需人工标记,或者让更强的模型判断较弱的步骤。期望 PRM 能够推动强化学习微调,而不仅仅是重新排名,并从数学扩展到代码、科学证明和代理多步骤规划,其中步骤级别的正确性很重要。
现实世界的实施
OpenAI 的 PRM800K 数据集:800K 人类步骤级标签,用于在 MATH 基准上训练验证者
Math-Shepherd:通过蒙特卡罗推出自动标记步骤正确性,以避免昂贵的人工注释
Best-of-N 重新排名:生成 256 个解决方案并选择每一步 PRM 得分最高的一个
辅导工具可以标记学生解决方案中首次出现错误的确切行
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Process Supervision for Math Reasoning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Process Supervision for Math Reasoning?
过程监督会奖励推理链中每一个正确步骤的模型,而不仅仅是最终答案。对于数学来说,一个错误的举动就会毁掉一切,对工作本身进行评分会产生更可靠的求解器。
过程监督和结果监督之间的主要区别是什么?
过程监督在每个推理步骤提供奖励信号,而结果监督仅检查最终答案。
为什么只注重结果的监督会对数学问题产生误导?
仅奖励最终答案会归功于“幸运”的解决方案,其中不正确的中间步骤恰好产生了正确的结果。
OpenAI 与“让我们逐步验证”一起发布了什么?
PRM800K 包含大约 800,000 个人工注释,将各个推理步骤标记为正确或错误。
在推理时通常如何使用过程奖励模型?
PRM 对许多候选解决方案的每一步进行评分,从而能够选择得分最高的推理链。
什么方法可以减少对昂贵的人工步骤标签的需求?
Math-Shepherd 通过推出完成结果并测量得出正确答案的频率来估计步骤的正确性,从而避免手动标记。