基础知识指南

偏好优化中的长度标准化

长度标准化调整了偏好调整目标,因此模型不再仅仅通过编写更长的答案来赢得认可。

阅读时间:2分钟最后更新

概述

It matters because uncorrected reward signals push chatbots toward verbose, padded responses instead of genuinely better ones.

深入探讨

当模型与 RLHF 或 DPO 等方法保持一致时,它们会从人类(或奖励模型)选择两个答案中“更好”的比较中学习。一个持续存在的错误是,较长的答案往往会受到青睐,即使它们实际上并不更好,因此模型学习了捷径:冗长。长度标准化可以抵消这一点。在 DPO 中,隐含奖励是每个令牌对数概率差异的总和,它会随着长度机械地增长。长度归一化 DPO 和 SimPO 等变体将奖励除以代币数量,而是按每个代币的平均值进行评分。结果是模型保持简洁和切题,而不是夸大对游戏目标的反应。

技术洞察

DPO 的隐式奖励是调整策略和参考策略之间的对数比,对响应中的每个令牌求和。因为每个令牌都会添加另一个(通常是正数)项,所以原始奖励会随着序列长度而缩放,从而使优化偏向于更长的完成时间。 SimPO 放弃了参考模型,并使用每个代币的平均对数概率作为奖励,加上目标奖励幅度。除以长度消除了机械长度优势,因此偏好梯度反映的是质量而不是字数。

战略影响

更清晰的判决

它可以帮助您将清晰的技术声明与营销语言分开。

成本与预算

在花费金钱或时间之前,您可以提出更好的实施问题。

团队与工作流程

具有共同理解的团队可以做出更好的产品、政策和学习决策。

偏好优化中长度标准化的未来

预计长度控制将成为标准旋钮,而不是事后的想法。研究人员正在将长度标准化与明确的长度惩罚、长度条件奖励和保持答案长度恒定的评估套件相结合,以衡量真实的质量增益。随着奖励模型在发现冗长偏差方面变得更好,对齐管道可能会默认报告长度偏差的获胜率,并且用户将更好地控制模型答案的简洁或详细程度。

现实世界的实施

使用 SimPO 调整客户支持助理,使其给出清晰、准确的答复,而不是看起来很详尽的填充段落。

报告 AlpacaEval 2 上的“长度控制胜率”,以表明模型得到了真正的改进,而不仅仅是变得更喋喋不休。

在微调编码模型时向 DPO 添加长度标准化,以便它返回最少的正确片段,而不是臃肿的样板。

诊断一个奖励模型,该模型可以系统地为较长的论文评分更高,然后在使用它来调整写作助理之前对其进行消除偏差。

风险与防护栏

不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。

基准测试可能看起来很强大,但实际性能却参差不齐。

忽视数据质量和评估计划通常会产生脆弱的结果。

实施路线图

1

从您需要的结果的简单语言定义开始。

2

在测试之前选择一种成功指标和一种失败条件。

3

使用代表性数据运行小型试点,而不是完善的演示集。

4

记录偏好优化中长度归一化的哪些方面有帮助以及哪些更简单的方法更好。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Length Normalization in Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

比值比偏好优化

常见问题

What is Length Normalization in Preference Optimization?

长度标准化调整了偏好调整目标,因此模型不再仅仅通过编写更长的答案来赢得认可。这很重要,因为未经纠正的奖励信号会促使聊天机器人做出冗长、填充的响应,而不是真正更好的响应。

DPO 中的长度标准化主要旨在防止哪些不良行为?

DPO 的隐性奖励随着代币数量的增加而增长,因此如果没有标准化模型,就知道简单地更冗长往往会赢得偏好比较。

为什么标准 DPO 的隐性奖励往往会随着响应长度的增加而增加?

隐式奖励将每个代币的对数概率比相加,因此更多的代币通常意味着更大的总奖励。

SimPO 如何解决长度偏差?

SimPO 通过平均(长度归一化)对数概率对响应进行评分,并增加目标奖励裕度,消除机械长度优势。

哪种评估实践有助于确认模型质量的提高而不仅仅是长度的提高?

长度控制的胜率(如 AlpacaEval 2)根据答案长度进行调整,因此收益反映了质量,而不是冗长。