迭代 DPO 和在线偏好调整
迭代 DPO 通过生成新的响应、对它们进行排名以及每轮对这些新的对进行调整,反复将语言模型与人类或人工智能的偏好保持一致。
概述
It matters because static, one-shot preference data goes stale, while iterating keeps the training signal on-policy and the model improving.
深入探讨
直接偏好优化 (DPO) 跳过训练单独的奖励模型:给定一对首选和拒绝的响应,它使用源自 RLHF 目标的简单分类式损失直接调整策略,以提高所选答案相对于被拒绝答案的可能性。问题是普通 DPO 在固定的、通常脱离策略的数据集上进行训练,因此模型可能会过度拟合旧的比较。迭代(在线)DPO 闭合循环:当前模型对新响应进行采样,法官(人类或强大的 AI/奖励模型)标记哪个更好,然后您对这些新数据运行另一轮 DPO。重复几次此操作会产生一个跟踪模型实际行为的移动目标,通常可以匹配或击败基于 PPO 的 RLHF,但复杂性要低得多。
技术洞察
DPO 的损失使用参考模型(通常是 SFT 检查点)和类似温度的 beta 来控制偏差,有效地编码等于策略概率和参考概率之间的对数比的隐式奖励。上线很重要,因为从当前政策中采样的偏好数据保持分布状态,从而减少了困扰线下 DPO 的分布变化。每次迭代都会重新生成补全,重新标记偏好,并可选择刷新参考模型,因此梯度始终反映当前的弱点。
战略影响
更清晰的判决
它可以帮助您将清晰的技术声明与营销语言分开。
成本与预算
在花费金钱或时间之前,您可以提出更好的实施问题。
团队与工作流程
具有共同理解的团队可以做出更好的产品、政策和学习决策。
迭代 DPO 和在线偏好调整的未来
预计偏好调整将变得越来越自动化和连续,人工智能法官和奖励模型可大规模提供标签,因此迭代循环的运行成本较低。 KTO、IPO 和长度控制或自我奖励 DPO 等变体正在改进损失,以遏制冗长和奖励黑客行为。更广泛的趋势是将生成、判断和更新更紧密地集成到管道中,不断调整前沿模型,减少每一步的人工标记。
现实世界的实施
在多轮中调整聊天助手,每次都会对新回复进行采样并对它们重新排名以提高帮助性
自我奖励设置,模型生成并判断自己的响应对以引导更好的偏好数据
建立原始质量后,通过在后续迭代中添加长度控制的 DPO 来减少答案的冗长
领域适应,例如根据测试结果判断的新生成的解决方案对迭代调整编码模型
风险与防护栏
不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。
基准测试可能看起来很强大,但实际性能却参差不齐。
忽视数据质量和评估计划通常会产生脆弱的结果。
实施路线图
从您需要的结果的简单语言定义开始。
在测试之前选择一种成功指标和一种失败条件。
使用代表性数据运行小型试点,而不是完善的演示集。
记录迭代 DPO 和在线偏好调整在哪些方面有帮助以及在哪些方面更简单的方法更好。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Iterative DPO and Online Preference Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Iterative DPO and Online Preference Tuning?
迭代 DPO 通过生成新的响应、对它们进行排名以及每轮对这些新的对进行调整,反复将语言模型与人类或人工智能的偏好保持一致。这很重要,因为静态的一次性偏好数据会变得陈旧,而迭代可以保持训练信号符合策略并且模型得到改进。
DPO 避免了传统 RLHF (PPO) 要求的哪些内容?
DPO 直接从偏好对优化策略,消除了基于 PPO 的 RLHF 使用的单独奖励模型和 RL 循环。
为什么迭代(在线)DPO 通常比在固定数据集上运行一次 DPO 更好?
每轮重新生成和重新标记响应可以使数据与当前策略保持一致,从而减少分布变化和对陈旧比较的过度拟合。
参考模型在 DPO 损失中起什么作用?
DPO 比较策略和参考对数概率;该比率充当隐性奖励并限制政策漂移的程度。
在在线 DPO 的单次迭代中,典型的顺序是什么?
每个循环都会从当前模型生成新的完成,由法官对它们进行排名,并对新对应用 DPO 更新。
DPO中的beta超参数控制什么?
Beta 的作用就像隐性奖励的温度,在接近参考值和适应偏好之间进行权衡。