ブラッドリー・テリーの報酬モデリング
Bradley-Terry モデルは、ペアごとの比較 (A が B に勝つ) を数値スコアに変換するための 100 年前から使用されている統計手法です。
概要
In modern AI it powers reward models that learn human preferences from 'which answer is better?' labels, the backbone of RLHF.
ディープダイブ
1952 年に導入された Bradley-Terry は、すべてのアイテムには隠された強度スコアがあり、アイテム A がアイテム B に勝つ確率は、それらのスコアの差のロジスティック関数であると仮定しています。 AI の調整では、これが好みのデータにきちんとマッピングされます。人間のラベル作成者は、調整が難しい絶対評価を与えるのではなく、2 つのモデルの応答を見て、より良い方を選択します。報酬モデル (通常はスカラー出力ヘッドを備えた言語モデル) は、人間が好む応答により高いスカラー報酬が得られるようにトレーニングされます。損失は、ブラッドリー・テリー確率の負の対数尤度です。つまり、(選択された報酬から拒否された報酬を差し引いた) の対数シグモイドを最大化します。結果として得られる報酬モデルは、任意の出力にスコアを付け、PPO などの強化学習アルゴリズムが最適化してモデルをより有用で整合性の高いものにするための信号を提供します。
技術的な洞察
比較のトレーニング損失は単に (r_chosen − r_rejected) の対数シグモイドを引いたものであるため、モデルは相対的な差異のみを学習します。これは、報酬が加算定数までしか識別できないことを意味します。絶対スケールは任意です。人間にとって比較は 1 対 10 のスコアよりも簡単で一貫性があるため、ブラッドリー-テリー データのノイズは少なくなります。その後、Direct Preference Optimization によって、個別の報酬モデルをスキップして、ポリシー上で Bradley-Terry の目標を直接最適化できることが示されました。
戦略的影響
より明確な判決
これは、明確な技術的主張とマーケティング言語を区別するのに役立ちます。
費用と予算
お金や時間を費やす前に、実装に関するより良い質問をすることができます。
チームとワークフロー
共通の理解を持ったチームは、製品、ポリシー、学習に関する意思決定をより適切に行うことができます。
ブラッドリー・テリー報酬モデリングの未来
ブラッドリー・テリーは、単一の一貫したランキングと推移的な好みを前提としていますが、人間の意見が一致しない場合や好みが循環すると、この順位は崩れてしまいます。研究は、選好度の分布、多次元の報酬(有用性、安全性、誠実さが個別にスコア化される)を捉えるモデル、および単一スコアの仮定を外した人間のフィードバックから学習するナッシュのような方法に向かって進んでいます。 DPO とその派生型は、ブラッドリーとテリーの目標を政策トレーニングに直接組み込むことが増えています。報酬のハッキングを減らすために、3 つ以上の項目のランキングや信頼度に重み付けされた好みなど、より豊富な比較スキームが期待されます。
現実世界の実装
2 つのチャットボット応答をランク付けし、より良いまたは悪い信号を PPO 微調整に供給する RLHF の報酬モデルをトレーニングします。
直接優先最適化では、Bradley-Terry ログシグモイド損失を使用して、選択された回答対と拒否された回答のペアに基づいてモデルを直接微調整します。
Elo を介したチェスまたは e スポーツ プレーヤーのランキング。これは数学的にゲームの結果に関するブラッドリー-テリー モデルに近いものです。
絶対的な星の評価ではなく、「ユーザーが B よりも A を好む」クリック データに基づいてコンテンツ推奨ランカーを構築します。
リスクとガードレール
チームが異なれば、同じ用語の使用方法も異なる可能性があるため、範囲を早めに定義してください。
ベンチマークは好調に見えても、実際のパフォーマンスにはばらつきがある場合があります。
データの品質と評価計画を無視すると、多くの場合、脆弱な結果が生じます。
実装ロードマップ
必要な結果を平易な言葉で定義することから始めます。
テストする前に、成功指標と失敗条件を 1 つ選択します。
洗練されたデモセットではなく、代表的なデータを使用して小規模なパイロットを実行します。
Bradley-Terry 報酬モデリングが役立つ部分と、より単純な方法の方が優れている部分を文書化します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Bradley-Terry Reward Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
報酬モデリング
よくある質問
What is Bradley-Terry Reward Modeling?
Bradley-Terry モデルは、ペアごとの比較 (A が B に勝つ) を数値スコアに変換するための 100 年前から使用されている統計手法です。現代の AI では、「どの答えがより良いか?」から人間の好みを学習する報酬モデルを強化します。 RLHF のバックボーンであるラベル。
Bradley-Terry モデルは数値スコアに何を変換しますか?
Bradley-Terry は、「A が B に勝つ」ペアごとの比較を行い、各項目の隠れた強度スコアを推測します。そのため、人間の好みのラベル付けに非常によく適合します。
ブラッドリー・テリーでは、A が B に勝つ確率は何の関数ですか?
モデルは、P(A が B に勝つ) を、A と B の隠れた強度スコアの差のロジスティック (シグモイド) に等しく設定します。
なぜブラッドリーとテリーの報酬は加算定数までしか特定できないのでしょうか?
トレーニング損失では、選択された報酬と拒否された報酬の差のみが使用されるため、すべてのスコアを同じ定数だけシフトすると、損失は変化しません。絶対スケールは任意です。
報酬モデリングにおける単一の選好比較の標準損失はいくらですか?
ブラッドリー・テリーの負の対数尤度は、選択された報酬と拒否された報酬の差のマイナス対数シグモイドに減少し、選択された応答の報酬をより高く押し上げます。
Bradley-Terry の目標をポリシー上で直接最適化することで、別の報酬モデルをスキップする方法はどれですか?
DPO は Bradley-Terry の優先目標を再定式化し、ポリシー モデルに直接適用できるようにし、スタンドアロンの報酬モデルのトレーニングやクエリの必要性を排除します。