语言人工智能指南

近端策略优化

近端策略优化 (PPO) 是与根据人类反馈微调语言模型最相关的强化学习算法。

阅读时间:2分钟最后更新

概述

It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.

深入探讨

PPO 由 OpenAI 于 2017 年推出,并成为 InstructGPT 和 ChatGPT 等系统的 RLHF 背后的主力。策略梯度强化学习的核心挑战是单个过大的更新可能会导致性能崩溃。 PPO 通过“修剪替代目标”来解决这个问题:它衡量与旧政策相比,某项行动的可能性增加(或减少)了多少,将该比率乘以优势(该行动比预期好多少),并将该比率限制在一个较小的范围内,例如 0.8 到 1.2。这限制了策略每次更新可以移动的距离,保持学习稳定,同时仍然允许稳步改进。在语言模型 RLHF 中,“动作”是生成令牌或响应,奖励来自奖励模型,KL 散度惩罚可以防止模型偏离其原始行为太远。

技术洞察

PPO 最大化剪辑目标:min(ratio * Advantage, Clip(ratio, 1-eps, 1+eps) * Advantage),其中ratio 是新旧动作概率。通常使用广义优势估计和学习值(批评)网络来估计优势。在 RLHF 中,总奖励将奖励模型得分与针对参考策略的每个代币 KL 惩罚相结合,平衡奖励增益与保持接近原始模型。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

近端策略优化的未来

PPO 仍然很强大,但出了名的复杂:它需要一个单独的价值网络、仔细的超参数调整和大量的计算。更简单的替代方案正在普及,包括 DPO(根本没有 RL)和 GRPO,它通过估计采样响应组的优势来降低价值网络,并为最近的推理模型提供了动力。 PPO 将在政策探索真正有帮助的地方继续存在,但该领域正在积极地将其一些复杂性换成更便宜的方法。

现实世界的实施

通过 RLHF 微调 InstructGPT 和 ChatGPT 以遵循指令和人类偏好

训练游戏和机器人控制代理,PPO 在语言模型之前的原始领域

通过在 KL 约束下最大化奖励模型分数来减少毒性或提高帮助性

优化工具使用或多步骤代理行为,其中模型因正确完成任务而获得奖励

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Proximal Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

集团相关政策优化

常见问题

What is Proximal Policy Optimization?

近端策略优化 (PPO) 是与根据人类反馈微调语言模型最相关的强化学习算法。它以谨慎的小步骤改进政策,以避免困扰幼稚政策梯度方法的不稳定性。

PPO 的“裁剪”主要解决什么问题?

修剪概率比可以防止任何单个更新使策略移动得太远,这是策略梯度方法不稳定的主要来源。

在具有 PPO 的语言模型 RLHF 中,奖励信号通常来自哪里?

奖励模型为生成的响应提供标量奖励,因为让人类在强化学习期间对每个输出进行评分是不可行的。

KL 散度惩罚在基于 PPO 的 RLHF 中起什么作用?

针对原始(参考)策略的每个代币 KL 惩罚会阻止模型在追逐奖励时过于剧烈地改变其行为。

价值(批评)网络在 PPO 中的作用是什么?

PPO是一种演员批评家方法;价值网络估计预期奖励,从而实现优势估计(通常通过 GAE),从而减少方差。

PPO 的“优势”代表什么?

优势衡量所选行动相对于价值估计的好(或更差)程度,告诉政策要加强哪些行动。