基本ガイド

反復的な DPO とオンライン設定チューニング

反復 DPO は、ラウンドごとに新しい応答を生成し、それらをランク付けし、それらの新しいペアを調整することで、言語モデルを人間または AI の好みに繰り返し調整します。

2分の読書最終更新日

概要

It matters because static, one-shot preference data goes stale, while iterating keeps the training signal on-policy and the model improving.

ディープダイブ

Direct Preference Optimization (DPO) は、個別の報酬モデルのトレーニングをスキップします。指定された優先応答と拒否された応答のペアを指定すると、RLHF の目的から導出された単純な分類スタイルの損失を使用して、拒否された応答と比較して選択された応答の可能性を高めるようにポリシーを直接調整します。問題は、バニラ DPO が固定の、多くの場合ポリシーから外れているデータセットでトレーニングするため、モデルが古い比較に過剰適合する可能性があることです。反復 (オンライン) DPO はループを閉じます。現在のモデルが新しい応答をサンプリングし、判定者 (人間または強力な AI/報酬モデル) がどちらが優れているかラベル付けし、この新しいデータに対して別の DPO ラウンドを実行します。これを数回繰り返すと、モデルの実際の動作を追跡する移動ターゲットが生成され、多くの場合、はるかに少ない複雑さで PPO ベースの RLHF と同等またはそれを上回ります。

技術的な洞察

DPO の損失では、参照モデル (通常は SFT チェックポイント) と温度のようなベータを使用して偏差を制御し、ポリシー確率と参照確率の間の対数比に等しい暗黙的な報酬を効果的にエンコードします。現在のポリシーからサンプリングされた嗜好データは配布されたままになり、オフライン DPO を悩ませる配布の変化が軽減されるため、オンライン化が重要になります。各反復では、補完が再生成され、設定が再ラベル付けされ、必要に応じて参照モデルが更新されるため、勾配は常に現在の弱点を反映します。

戦略的影響

より明確な判決

これは、明確な技術的主張とマーケティング言語を区別するのに役立ちます。

費用と予算

お金や時間を費やす前に、実装に関するより良い質問をすることができます。

チームとワークフロー

共通の理解を持ったチームは、製品、ポリシー、学習に関する意思決定をより適切に行うことができます。

反復 DPO とオンライン設定チューニングの将来

AI ジャッジと報酬モデルが大規模なラベルを提供することで、反復ループを低コストで実行できるようになり、優先度の調整がますます自動化および継続的になることが予想されます。 KTO、IPO、長さ制御型または自己報酬型 DPO などの亜種は、冗長性を抑制し、ハッキングに報酬を与えるために損失を調整しています。より大きな傾向としては、生成、判断、更新をパイプラインに緊密に統合し、ステップごとに人によるラベル付けを減らしてフロンティア モデルを継続的に調整することです。

現実世界の実装

複数のラウンドにわたってチャット アシスタントを調整し、そのたびに新しい返信をサンプリングし、有用性を高めるためにそれらを再ランク付けします。

モデルが独自の応答ペアを生成および判断して、より優れた嗜好データをブートストラップする自己報酬型セットアップ

生の品質が確立された後の後の反復で長さ制御された DPO を追加することで、回答の冗長性を軽減します。

ドメイン適応(テスト結果によって判断される、新たに生成されたソリューションのペアに基づいてコーディング モデルを反復的に調整するなど)

リスクとガードレール

チームが異なれば、同じ用語の使用方法も異なる可能性があるため、範囲を早めに定義してください。

ベンチマークは好調に見えても、実際のパフォーマンスにはばらつきがある場合があります。

データの品質と評価計画を無視すると、多くの場合、脆弱な結果が生じます。

実装ロードマップ

1

必要な結果を平易な言葉で定義することから始めます。

2

テストする前に、成功指標と失敗条件を 1 つ選択します。

3

洗練されたデモセットではなく、代表的なデータを使用して小規模なパイロットを実行します。

4

反復 DPO とオンライン設定チューニングが役立つ場合と、より単純な方法の方が優れている場合を文書化します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Iterative DPO and Online Preference Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

プリファレンスの最適化における長さの正規化

よくある質問

What is Iterative DPO and Online Preference Tuning?

反復 DPO は、ラウンドごとに新しい応答を生成し、それらをランク付けし、それらの新しいペアを調整することで、言語モデルを人間または AI の好みに繰り返し調整します。これが重要なのは、静的なワンショット設定データは古くなってしまう一方、反復処理によってトレーニング信号がポリシーに準拠し、モデルが改善され続けるためです。

従来の RLHF (PPO) が必要とするものを DPO が回避しているのは何ですか?

DPO は、プリファレンス ペアから直接ポリシーを最適化し、PPO ベースの RLHF が使用する個別の報酬モデルと RL ループを排除します。

固定データセットに対して DPO を 1 回実行するよりも、反復 (オンライン) DPO の方が優れている場合が多いのはなぜですか?

各ラウンドで応答を再生成して再ラベル付けすることで、データが現在のポリシーに合わせて維持され、分布のシフトや古い比較への過剰適合が軽減されます。

参照モデルは DPO 損失においてどのような役割を果たしますか?

DPO はポリシーと参照ログの確率を比較します。この比率は暗黙の報酬として機能し、ポリシーの変動幅を制限します。

オンライン DPO の 1 回の反復における一般的なシーケンスは何ですか?

各ループは現在のモデルから新しい補完を生成し、審査員がそれらをランク付けし、新しいペアに DPO 更新を適用します。

DPO のベータ ハイパーパラメータは何を制御しますか?

ベータは暗黙の報酬の温度のように機能し、基準に近い状態を維持することと、好みに適合させることをトレードオフにします。