布拉德利-特里奖励模型
Bradley-Terry 模型是一种具有百年历史的统计方法,用于将成对比较(A 击败 B)转化为数字分数。
概述
In modern AI it powers reward models that learn human preferences from 'which answer is better?' labels, the backbone of RLHF.
深入探讨
Bradley-Terry 于 1952 年提出,假设每个项目都有一个隐藏的强度得分,并且项目 A 击败项目 B 的概率是它们得分差异的逻辑函数。在人工智能对齐中,这巧妙地映射到偏好数据:人类贴标签者看到两个模型响应并选择更好的一个,而不是给出难以校准的绝对评级。奖励模型(通常是具有标量输出头的语言模型)经过训练,以便人类首选的响应获得更高的标量奖励。损失是 Bradley-Terry 概率的负对数似然:最大化(选择的奖励减去拒绝的奖励)的对数 sigmoid。然后,生成的奖励模型对任意输出进行评分,提供 PPO 等强化学习算法优化的信号,使模型更有帮助且更一致。
技术洞察
比较的训练损失只是减去 (r_chosen − r_rejected) 的 log-sigmoid,因此模型仅学习相对差异。这意味着奖励只能在累加常数范围内识别;绝对比例是任意的。由于对人类来说,比较比 1 到 10 的分数更容易且更一致,因此 Bradley-Terry 数据的噪音较小。直接偏好优化稍后表明您可以跳过单独的奖励模型并直接在策略上优化 Bradley-Terry 目标。
战略影响
更清晰的判决
它可以帮助您将清晰的技术声明与营销语言分开。
成本与预算
在花费金钱或时间之前,您可以提出更好的实施问题。
团队与工作流程
具有共同理解的团队可以做出更好的产品、政策和学习决策。
Bradley-Terry 奖励模型的未来
布拉德利-特里假设有一个一致的排名和传递偏好,当人们意见不一致或偏好循环时,它就会崩溃。研究正在转向捕捉偏好分布、多维奖励(帮助、安全、诚实分别评分)的模型,以及像纳什这样从人类反馈中学习的方法,这些方法放弃了单分假设。 DPO 及其变体越来越多地将 Bradley-Terry 目标直接纳入政策培训。期望更丰富的比较方案,包括两个以上项目的排名和置信加权偏好,以减少奖励黑客行为。
现实世界的实施
在 RLHF 中训练奖励模型,对两个聊天机器人的响应进行排名,并向 PPO 微调提供更好或更差的信号。
直接偏好优化使用 Bradley-Terry log-sigmoid 损失直接在选择与拒绝的答案对上微调模型。
通过 Elo 对国际象棋或电子竞技选手进行排名,这在数学上与比赛结果的 Bradley-Terry 模型非常接近。
根据“用户更喜欢 A 而不是 B”的点击数据而不是绝对星级来构建内容推荐排名。
风险与防护栏
不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。
基准测试可能看起来很强大,但实际性能却参差不齐。
忽视数据质量和评估计划通常会产生脆弱的结果。
实施路线图
从您需要的结果的简单语言定义开始。
在测试之前选择一种成功指标和一种失败条件。
使用代表性数据运行小型试点,而不是完善的演示集。
记录 Bradley-Terry 奖励模型在哪些方面有帮助以及在哪些方面更简单的方法更好。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Bradley-Terry Reward Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Bradley-Terry Reward Modeling?
Bradley-Terry 模型是一种具有百年历史的统计方法,用于将成对比较(A 击败 B)转化为数字分数。在现代人工智能中,它支持奖励模型,从“哪个答案更好?”中学习人类的偏好。标签,RLHF 的支柱。
Bradley-Terry 模型将什么转换为数字分数?
Bradley-Terry 进行成对“A 击败 B”比较,并推断出每个项目的隐藏强度分数,这就是为什么它如此适合人类偏好标签的原因。
在 Bradley-Terry 中,A 击败 B 的概率是什么函数?
该模型将 P(A 击败 B) 设置为等于 A 和 B 的隐藏强度分数之间差异的逻辑(S 形)。
为什么布拉德利-特里奖励只能在加性常数范围内识别?
训练损失仅使用选择的奖励和拒绝的奖励之间的差异,因此将所有分数移动相同的常数使损失保持不变;绝对比例是任意的。
奖励模型中单个偏好比较的标准损失是多少?
Bradley-Terry 负对数似然减少为选择减去拒绝奖励差异的负对数 sigmoid,从而将所选响应的奖励推高。
哪种方法通过直接在策略上优化 Bradley-Terry 目标来跳过单独的奖励模型?
DPO 重新制定了 Bradley-Terry 偏好目标,使其可以直接应用于政策模型,从而无需训练和查询独立的奖励模型。