语言人工智能指南

直接偏好优化

直接偏好优化(DPO)是一种使语言模型与人类偏好保持一致的方法,无需训练单独的奖励模型或运行强化学习。

阅读时间:2分钟最后更新

概述

它将复杂的多级管道分解为单个稳定的训练损失。

深入探讨

Rafailov 和斯坦福大学的同事于 2023 年推出的 DPO 重新思考了我们如何教授人们喜欢的模型。传统方法(RLHF)根据人类比较训练奖励模型,然后使用强化学习来最大化奖励。 DPO 的关键见解是数学上的:RLHF 目标下的最优策略与奖励具有封闭形式的关系,因此您可以重新排列方程并直接在偏好对上优化语言模型。你给它一个提示、一个“选择”(首选)响应和一个“拒绝”响应,一个简单的分类式损失会推动模型,使所选答案相对更有可能。没有奖励模型,没有采样循环,没有奖励黑客。运行起来更简单、更稳定。

技术洞察

DPO 对偏好对使用二元交叉熵损失。它增加了所选响应相对于被拒绝响应的对数概率比,每个响应都是针对冻结的参考模型(通常是监督微调的起点)进行测量的。温度参数 beta 控制策略可能偏离该参考值的程度,隐式强制执行 RLHF 显式应用的 KL 约束。回报永远不会实现;它隐含在策略自身的对数概率中。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

直接偏好优化的未来

DPO 已成为默认的对齐方法,因为它便宜且可重复,并且它产生了一系列变体:IPO 修复了对近乎确定性偏好的过度拟合,KTO 从单个好或坏标签而不是对中学习,ORPO 将偏好学习折叠到没有参考模型的微调中。预计将继续致力于将 DPO 与保单数据和长度/质量去偏差相结合,从而缩小与完整在线 RLHF 的剩余差距。

现实世界的实施

微调开放权重聊天模型,例如 Zephyr 以及许多 Llama 和 Mistral 衍生品,这些模型与偏好数据集上的 DPO 保持一致

使用配对减少有害或无益的输出,其中“选择”安全、有用的答案而不是有问题的答案

使用开发人员评分的比较,教导编码助理更喜欢正确的、有详细记录的解决方案,而不是有缺陷的解决方案

调整摘要风格,使模型更喜欢简洁、忠实的摘要,而不是冗长或幻觉的摘要

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Direct Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

比值比偏好优化

常见问题

什么是直接偏好优化?

直接偏好优化(DPO)是一种使语言模型与人类偏好保持一致的方法,无需训练单独的奖励模型或运行强化学习。它将复杂的多级管道分解为单个稳定的训练损失。

与传统的 RLHF 相比,DPO 消除了什么?

DPO 的主要优点是去除了显式奖励模型和 RL 采样循环,而是直接在偏好对上优化策略。

单个 DPO 训练示例包含哪些数据?

DPO 在偏好对上进行训练:一个提示加上一个首选(“选择”)和一个不喜欢(“拒绝”)响应。

参考模型在 DPO 中发挥什么作用?

冻结参考(通常是 SFT 模型)锚定损失; beta 参数控制训练后的策略可以偏离它多远。

在DPO中,“奖励”体现在哪里?

DPO 的推导表明奖励隐含在策略和参考之间的对数概率比中,因此不需要显式的奖励模型。

DPO 中的 beta(温度)参数控制什么?

Beta 控制隐式 KL 约束:较高的 Beta 使策略更接近参考值,较低的 Beta 允许更大的偏差。