流程奖励模型
过程奖励模型(PRM)对人工智能推理的每个步骤进行评分,而不仅仅是最终答案。
概述
这很重要,因为它可以在中途捕获错误的逻辑,使模型在数学、编码和多步推理方面更加可靠。
深入探讨
大多数奖励模型都是“结果”模型:它们查看完成的答案并判断它是对还是错。相反,过程奖励模型对推理链中的每个步骤进行评分,为解决方案的每一行分配质量或正确性分数。著名的例子是 OpenAI 的 2023 年“让我们逐步验证”工作,其中在 PRM800K 数据集(数学解决方案上大约 800,000 个人类步骤级标签)上训练的 PRM 在 MATH 基准上的表现大大优于仅结果监督。这样做的好处是,最终的答案可能是靠运气而正确的,而推理却被打破了;或者,尽管大部分步骤都是正确的,但最终的答案可能是错误的。通过奖励正确的中间步骤,PRM 可以提供更密集、更有针对性的反馈,从而改善验证(选择许多样本解决方案中最好的)和通过强化学习进行的训练。
技术洞察
PRM 通常是一个转换器,它在每个推理步骤之后输出标量分数,通常在特殊的分隔符标记处。要从许多采样链中选择最终答案,您通常通过采用最小步骤概率(链的强度取决于其最弱的步骤)或乘积来汇总步骤分数。收集步骤标签的成本很高,因此 Math-Shepherd 之类的方法通过蒙特卡洛推出自动标记步骤,根据步骤产生正确答案的频率来估计步骤的价值。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
过程奖励模型的未来
PRM 是推理模型时代的核心。期望更多的自动步骤标记可以降低人工注释成本,生成式 PRM 可以用自然语言批评步骤而不是给出简单的分数,并且可以从数学扩展到代码、代理工具使用和科学推理。它们还自然地与树搜索和测试时计算配对,其中验证器指导扩展哪些分支。一个关键的公开挑战是奖励黑客:模型学习生成对 PRM 来说看起来不错的步骤,但实际上并不正确。
现实世界的实施
按步数对硬数学竞争问题的数十个采样解决方案进行重新排序,然后返回得分最高的链。
在推理模型中引导树搜索,仅扩展 PRM 评价较高的中间步骤的部分解决方案。
使用 Math-Shepherd 风格的 Monte Carlo 卷展自动标记训练数据,以便无需详尽的人工注释即可训练 PRM。
逐步验证代码生成,标记函数逻辑偏离规范的特定行。
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Process Reward Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
什么是过程奖励模型?
过程奖励模型(PRM)对人工智能推理的每个步骤进行评分,而不仅仅是最终答案。这很重要,因为它可以在中途捕获错误的逻辑,使模型在数学、编码和多步推理方面更加可靠。
过程奖励模型与结果奖励模型的主要区别是什么?
PRM 为推理链中的每一步打分,而结果模型仅判断最终结果。
哪个著名的人类步骤级数学标签数据集与 PRM 研究相关?
PRM800K 与 OpenAI 的“让我们逐步验证”一起发布,包含大约 800,000 个数学解决方案的步骤级标签。
为什么只注重结果的奖励信号会产生误导?
结果评分会漏掉一些情况,即尽管中间工作做得很好,但答案是靠运气正确或错误的,而步骤级评分会捕捉到这一点。
Math-Shepherd 方法使用什么来自动标记步骤?
Math-Shepherd 通过从该点采样许多完成情况并测量它们达到正确答案的频率来估计步骤的值。
针对 PRM 训练模型时,哪些风险特别相关?
模型可以学习与验证者博弈,产生看似合理的步骤,得分很高,但实际上并不是合理的推理。