基础知识指南

RLHF 中的分组奖励标准化

分组奖励标准化标准化了模型在对同一提示的一批响应中的奖励,将噪声分数转化为稳定的训练信号。

阅读时间:2分钟最后更新

概述

这是 GRPO 背后的核心技巧,GRPO 是为许多现代推理模型提供支持的算法。

深入探讨

在基于人类反馈的强化学习 (RLHF) 中,模型会生成响应,奖励模型会对它们进行评分,但原始奖励是嘈杂的,并且在不同提示之间差异很大。分组奖励标准化通过对同一提示的多个响应进行采样来解决此问题,然后通过减去组平均值并除以组的标准差来标准化每个奖励。这个 z 分数成为优势。该方法是 DeepSeek 推出的组相对策略优化 (GRPO) 的核心,该优化为 DeepSeek-R1 的推理提供了强大的支持。至关重要的是,GRPO 消除了 PPO 使用的单独价值网络(批评家),因为群体平均值充当基线。这使得训练更简单、更便宜、更节省内存,同时保持梯度信号的良好缩放。

技术洞察

对于一组具有奖励 r_1...r_G 的输出,优势为 A_i = (r_i −mean(r)) / std(r)。比小组平均水平更好的反应会获得积极的优势并得到强化;低于平均水平的则被推低。因为比较在提示内是相对的,所以绝对奖励规模和每个提示的难度相互抵消,从而减少了方差。 GRPO 将 PPO 的修剪目标和 KL 惩罚保留在参考策略上,以防止模型偏离太远。

战略影响

更清晰的判决

它可以帮助您将清晰的技术声明与营销语言分开。

成本与预算

在花费金钱或时间之前,您可以提出更好的实施问题。

团队与工作流程

具有共同理解的团队可以做出更好的产品、政策和学习决策。

RLHF 分组奖励标准化的未来

分组标准化正在推动推理模型的繁荣,其中模型可以从可验证的奖励(例如正确的数学答案)中学习,而无需博学的批评家。研究正在完善它:关于是否除以标准差、处理产生零优势的全正确或全错误组以及缩放组大小的争论。预计分组的、无批评的方法将扩展到代理工具使用和代码生成,其中自动验证器提供廉价、丰富的奖励信号。

现实世界的实施

通过对每个问题的 16 个解决方案进行抽样来训练数学推理模型,并对高于小组平均正确率的解决方案进行奖励。

通过标准化每个用户提示的多个候选回复的奖励模型分数来微调聊天机器人的帮助性。

改进编码助手,根据每个采样解决方案是否通过单元测试对其进行评分,然后在组内进行标准化。

通过删除 PPO 批评者网络并使用组平均值作为基线来减少 RLHF 管道中的 GPU 内存。

风险与防护栏

不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。

基准测试可能看起来很强大,但实际性能却参差不齐。

忽视数据质量和评估计划通常会产生脆弱的结果。

实施路线图

1

从您需要的结果的简单语言定义开始。

2

在测试之前选择一种成功指标和一种失败条件。

3

使用代表性数据运行小型试点,而不是完善的演示集。

4

记录 RLHF 中的分组奖励标准化在哪些方面有帮助以及在哪些方面更简单的方法更好。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped Reward Normalization in RLHF quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

偏好优化中的长度标准化

常见问题

什么是 RLHF 中的分组奖励标准化?

分组奖励标准化标准化了模型在对同一提示的一批响应中的奖励,将噪声分数转化为稳定的训练信号。这是 GRPO 背后的核心技巧,GRPO 是为许多现代推理模型提供支持的算法。

在分组奖励标准化中,每个响应的奖励与什么进行比较?

每个奖励都会使用同一提示的响应组的平均值和标准差转换为 z 分数。

哪种算法与分组奖励标准化最相关?

GRPO 由 DeepSeek 引入并在 DeepSeek-R1 中使用,它是围绕标准化群体内的奖励而构建的。

GRPO 特别消除了标准 PPO 的哪些组成部分?

通过使用组平均值作为基线,GRPO 丢弃了学习批评家,从而节省了内存和计算量。

如果响应的奖励低于其组的平均值,会发生什么情况?

减去群体均值会使低于平均水平的反应具有负面优势,从而使政策远离他们。

为什么组内标准化可以减少训练方差?

由于每个提示中的比较都是相对的,因此绝对规模和提示难度上的差异会被消除。