技术指南

从人类反馈中强化学习

RLHF 是一种通过根据人类偏好进行训练,将原始语言模型转变为有用、礼貌的助手的技术。

阅读时间:2分钟最后更新

概述

It matters because it aligns model behavior with what people actually want, not just what is statistically likely.

深入探讨

预训练的语言模型可以预测合理的文本,但合理并不等于有帮助、诚实或安全。 RLHF 分阶段解决了这个问题。首先,监督微调教导模型遵循使用人工编写的示例答案的指令。接下来,人类会比较模型对同一提示的反应,并选择更好的一个;这些比较训练了一个单独的奖励模型,可以对任何响应进行评分。最后,通过强化学习对语言模型进行优化,以产生奖励模型评价较高的响应。惩罚可以防止它偏离原始模型太远,因此它可以保持流畅并且不会利用奖励模型的怪癖。 RLHF 是使 ChatGPT 风格的助手可用的核心。

技术洞察

奖励模型通常在具有 Bradley-Terry 风格损失的偏好对上进行训练,学习为人类偏好的答案提供更高的标量分数。然后使用 PPO(近端策略优化)更新策略,最大限度地提高奖励,同时针对参考模型的 KL 散度惩罚可防止过度优化和“奖励黑客”。由于 PPO 非常繁琐,因此 DPO(直接偏好优化)等新方法跳过了显式奖励模型和强化循环,直接从偏好对优化策略。

战略影响

成本与预算

多年来,架构决策决定着性能和运营成本。

更清晰的判决

技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。

质量控制

更好的工程选择可以减少生产中的可靠性事故。

根据人类反馈强化学习的未来

RLHF 正在简化并部分自动化。 DPO 和相关的直接偏好方法正在取代许多团队繁重的 PPO 流程,而 RLAIF 使用人工智能生成的反馈(如宪法人工智能)来降低标签成本。研究正在通过过程监督和辩论等技术来解决奖励黑客、注释者偏见以及判断长篇或专家回复的困难。期望能够融合人类和人工智能的反馈,获得比单一竖起大拇指更丰富的奖励信号,以及对谁提供偏好以及他们编码的价值进行日益严格的审查。

现实世界的实施

调整聊天助手,使其拒绝有害的请求,并提供有用的、结构良好的答案,而不仅仅是看似合理的文本。

根据人们的偏好对摘要对进行排名,以训练一个模型,该模型可以编写人们实际上认为有用的摘要。

通过奖励人类评估者认为尊重和安全的反应来减少有毒或有偏见的输出。

在首选答案与拒绝答案的数据集上使用 DPO 来调整开源模型,而无需运行完整的 PPO 循环。

风险与防护栏

优化一项基准测试可以隐藏更广泛的系统弱点。

基础设施和维护成本常常被低估。

随着系统变得更加复杂,安全性和可观察性差距可能会扩大。

实施路线图

1

在实施之前定义延迟、质量和成本目标。

2

在实际负载和数据条件下进行基准测试。

3

仪器监控错误、漂移和用户影响。

4

在扩展之前准备回滚和事件响应路径。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reinforcement Learning From Human Feedback quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常见问题

What is Reinforcement Learning From Human Feedback?

RLHF 是一种通过根据人类偏好进行训练,将原始语言模型转变为有用、礼貌的助手的技术。这很重要,因为它将模型行为与人们的实际想要的东西结合起来,而不仅仅是统计上可能的东西。

RLHF 对于语言模型的主要目的是什么?

RLHF 引导模型朝着人类喜欢的反应方向发展,使其更加有用、诚实和安全,而不仅仅是看似合理。

RLHF 中的奖励模型实际上是用来做什么的?

奖励模型根据人类偏好比较进行训练,以对响应进行评分,从而提供策略优化的信号。

为什么在 RL 步骤中使用针对原始模型的 KL 散度惩罚?

KL 惩罚使优化策略接近参考模型,防止奖励黑客和流畅性损失。

通常如何为奖励模型收集偏好数据?

注释者在成对比较中选择首选响应,通过 Bradley-Terry 式损失来训练奖励模型。

与经典的 RLHF 管道相比,DPO(直接偏好优化)有何优势?

DPO 直接从偏好中得出目标,避免了单独的奖励模型和繁琐的强化学习步骤。