技术指南

集团相关政策优化

组相对策略优化 (GRPO) 是一种用于微调语言模型的强化学习方法,该方法根据同一提示的一组兄弟答案来判断每个答案,从而消除了 PPO 使用的单独价值网络。

阅读时间:2分钟最后更新

概述

It became famous as the core training trick behind DeepSeek's reasoning models.

深入探讨

GRPO 是策略梯度强化学习的一种变体,旨在使大型语言模型的 RL 微调更便宜、更稳定。标准 PPO 需要一个有学识的“批评家”(价值模型),其大小大致与政策本身一样大,以估计每个代币的好坏。 GRPO 完全消除了这个批评。对于每个提示,它都会对一组完成进行采样(例如 8-64),用奖励信号对它们进行评分,然后通过根据组的平均值和标准差标准化其奖励来计算每个完成的优势。高于平均水平的答案会得到强化,低于平均水平的答案会被抑制。 KL 散度项使模型接近参考策略。它由 DeepSeek 推出,为 DeepSeekMath 和 DeepSeek-R1 推理模型提供支持。

技术洞察

关键思想是用蒙特卡罗组基线替换 PPO 的学习值基线。对于一组具有奖励 r_i 的输出,每个优势为 A_i = (r_i -mean(r)) / std(r)。归一化分数乘以截断概率比,与 PPO 完全相同,并且针对冻结参考模型的 KL 惩罚可以抑制漂移。因为没有接受过训练的批评家,所以内存和计算量大约减半,并且按提示标准化提供了自然缩放的低方差优势。

战略影响

成本与预算

多年来,架构决策决定着性能和运营成本。

更清晰的判决

技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。

质量控制

更好的工程选择可以减少生产中的可靠性事故。

集团相关政策优化的未来

GRPO 已迅速成为训练开放推理模型的默认方法,实验室正在迭代其弱点。研究人员正在探索修复长度和难度偏差(例如 GRPO 博士)、令牌级别而非序列级别标准化,以及删除或重塑 KL 术语。期望与可验证的奖励(数学、代码、工具使用)更紧密地集成,更好地处理稀疏信号,以及将群体基线与轻量级批评家相结合的混合体,以实现代理、多步骤任务。

现实世界的实施

训练 DeepSeek-R1 和 DeepSeekMath 使用基于规则的正确性奖励对数学问题进行长链思维推理

微调代码生成模型,其中每个采样解决方案根据是否通过单元测试进行评分,并且该组被标准化以挑选获胜者

开源 RLHF 管道(例如,在 TRL 和 verl 库中)使用 GRPO 来调整聊天模型,而无需支付单独的价值网络费用

通过对每个提示的多个响应进行采样并奖励相对于同龄人而言奖励模型评分最高的响应,改善指令遵循或安全行为

风险与防护栏

优化一项基准测试可以隐藏更广泛的系统弱点。

基础设施和维护成本常常被低估。

随着系统变得更加复杂,安全性和可观察性差距可能会扩大。

实施路线图

1

在实施之前定义延迟、质量和成本目标。

2

在实际负载和数据条件下进行基准测试。

3

仪器监控错误、漂移和用户影响。

4

在扩展之前准备回滚和事件响应路径。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

近端策略优化

常见问题

What is Group Relative Policy Optimization?

组相对策略优化 (GRPO) 是一种用于微调语言模型的强化学习方法,该方法根据同一提示的一组兄弟答案来判断每个答案,从而消除了 PPO 使用的单独价值网络。它作为 DeepSeek 推理模型背后的核心训练技巧而闻名。

GRPO 消除了 PPO 的哪些主要成分?

GRPO 的签名更改正在放弃 PPO 的学习值/批评模型,该模型通常与策略大小相同,从而节省大量内存和计算。

GRPO 如何计算给定完成的优势?

每次完成的优势是(奖励 - 组平均值)/组标准差,因此同一提示的答案组作为基线。

哪些车型让 GRPO 广为人知?

GRPO 由 DeepSeek 引入并普及,特别是在 DeepSeekMath 中以及作为 DeepSeek-R1 推理模型背后的 RL 引擎。

KL 散度项在 GRPO 中起什么作用?

针对参考(通常是强化学习前)模型的 KL 惩罚可以规范训练,从而使策略得到改进,而不会崩溃或陷入退化输出。

为什么 GRPO 对于训练数学或代码推理模型特别有吸引力?

对许多解决方案进行采样并通过自动正确性检查对其进行评分,与 GRPO 的群体归一化优势完美结合,无需批评家。