语言人工智能指南

拒绝采样微调

拒绝采样微调 (RFT) 会生成许多候选答案,仅保留得分最高的答案,并根据这些获胜者重新训练模型。

阅读时间:2分钟最后更新

概述

It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.

深入探讨

拒绝采样微调(有时称为 N 最佳微调)是 Meta 的 Llama 2 和 Llama 3 等模型如何对齐的关键要素。方法很简单:对于每个提示,从当前模型中采样多个响应(例如 4 到 64),使用奖励模型或自动检查器对每个响应进行评分,然后丢弃(“拒绝”)除排名最高的输出之外的所有输出。幸存的高质量样本成为新的监督微调数据集,并使用普通的下一个令牌损失对模型进行训练。迭代地重复此循环会推动模型自行生成更好的答案。由于模型从自己过滤的输出中学习,RFT 避免了策略梯度 RL 的不稳定和调整难题,同时仍然利用奖励信号。

技术洞察

RFT 利用了这样一个事实:多次采样并保持最大奖励响应近似于从锐化的、更高质量的分布中进行挑选。通过标准交叉熵对这些获胜者进行训练,可以有效地将 N 中最佳行为提炼回模型的单样本输出中。对于数学或代码等可验证领域,“奖励”可以简单地是最终答案或单元测试是否通过,从而完全不需要学习奖励模型。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

拒绝采样微调的未来

RFT 是现代后训练的核心,通常在 PPO 和 DPO 等 RL 方法之前或与它一起使用。它的吸引力随着廉价的推理和强大的自动验证器而增长:随着模型在自我生成和自我检查方面变得更好,迭代拒绝采样支持合成数据和自我改进循环。期望与推理模型更紧密地集成,产生可验证的思想链,并持续研究如何在对模型自己的输出进行重复训练时避免奖励黑客和多样性崩溃。

现实世界的实施

通过对每个提示采样多个答案来调整 Llama 风格的模型,保持最高的奖励模型分数,然后对这些答案进行 SFT

通过生成许多解决方案并仅保留那些达到正确、可检查答案的解决方案来改进数学求解器

代码生成,仅当候选人通过单元测试时才保留候选人,然后用作训练数据

通过过滤模型自身的最佳自生成响应来构建合成指令数据集以用于下一轮训练

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rejection Sampling Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

QLoRA 和 4 位微调

常见问题

What is Rejection Sampling Fine-Tuning?

拒绝采样微调 (RFT) 会生成许多候选答案,仅保留得分最高的答案,并根据这些获胜者重新训练模型。这很重要,因为它使用简单的监督学习而不是复杂的强化学习来提供 RLHF 的大部分好处。

拒绝采样微调的核心思想是什么?

RFT 对多个响应进行采样,筛选出得分最高的响应,并对这些获胜者的模型进行微调。

在数学或代码等可验证领域,什么可以作为奖励?

对于可检查的任务,RFT 可以使用精确的正确性或通过单元测试,从而避免学习奖励模型。

哪个模型系列在对齐过程中使用拒绝采样而闻名?

Meta 描述了使用拒绝采样作为 Llama 2 和 Llama 3 模型的后训练方法的一部分。

为什么团队更喜欢 RFT 而不是像 PPO 这样的策略梯度强化学习?

RFT 在过滤样本上使用标准的下一个令牌损失进行重新训练,避免了策略梯度方法的调整困难和不稳定性。

对最大奖励样本进行有效训练有什么作用?

通过从最过滤的响应中学习,该模型在一代人中内化了更高质量的行为。