直接的なプリファレンスの最適化
Direct Preference Optimization (DPO) は、別の報酬モデルをトレーニングしたり強化学習を実行したりせずに、言語モデルを人間の好みに合わせて調整する方法です。
概要
It collapses a complex multi-stage pipeline into a single, stable training loss.
ディープダイブ
スタンフォード大学のラファイロフ氏らによって 2023 年に導入された DPO は、人々が好むものをモデルに教える方法を再考します。従来のアプローチ (RLHF) では、人間との比較に基づいて報酬モデルをトレーニングし、強化学習を使用してその報酬を最大化します。 DPO の重要な洞察は数学的です。RLHF 目標に基づく最適なポリシーは報酬に対して閉形式の関係があるため、方程式を並べ替えて、プリファレンス ペアに基づいて直接言語モデルを最適化できます。プロンプト、「選択された」 (優先される) 応答、および「拒否された」応答を与えると、単純な分類スタイルの損失により、選択された応答の可能性が相対的に高くなるようにモデルが調整されます。報酬モデルもサンプリングループも報酬ハッキングもありません。はるかに簡単で、実行がより安定しています。
技術的な洞察
DPO は、優先ペアに対するバイナリのクロスエントロピー損失を使用します。これは、拒否された応答に対する選択された応答の対数確率比を増加させます。各応答は、凍結された参照モデル (通常は教師あり微調整された開始点) に対して測定されます。温度パラメータ ベータは、ポリシーがその基準からどの程度ずれるかを制御し、RLHF が明示的に適用する KL 制約を暗黙的に強制します。報酬は決して実現しません。これはポリシー自体の対数確率に暗黙的に含まれます。
戦略的影響
速度とスケール
言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。
アクセスと到達範囲
言語やコミュニケーション スタイルを超えてアクセスが拡張されます。
より明確な判決
自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。
直接優先最適化の未来
DPO は安価で再現性があるため、デフォルトの調整方法となり、一連の亜種を生み出しました。IPO はほぼ決定論的な好みの過剰適合を修正し、KTO はペアではなく単一の良いまたは悪いラベルから学習し、ORPO は好みの学習を参照モデルなしの微調整に組み込みます。 DPO とポリシー上のデータおよび長さ/品質のバイアス除去を組み合わせて、完全なオンライン RLHF との残りのギャップを縮小する継続的な作業が期待されます。
現実世界の実装
Zephyr や多くの Llama や Mistral の派生モデルなどのオープンウェイト チャット モデルを微調整し、嗜好データセットに関して DPO と調整しました。
問題のある答えよりも安全で役立つ答えが「選択」されるペアを使用して、有害または役に立たない出力を削減します。
開発者が評価した比較を使用して、コーディングアシスタントに、バグのあるソリューションよりも正しく文書化されたソリューションを好むよう教える
モデルが冗長または幻覚的な要約よりも簡潔で忠実な要約を優先するように要約スタイルを調整する
リスクとガードレール
幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。
迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。
アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。
実装ロードマップ
展開する前に、出力形式、トーン、品質基準を定義します。
正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。
一か八かの成果物については人間によるレビュー チェックポイントを維持します。
失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Direct Preference Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
オッズ比優先の最適化
よくある質問
What is Direct Preference Optimization?
Direct Preference Optimization (DPO) は、別の報酬モデルをトレーニングしたり強化学習を実行したりせずに、言語モデルを人間の好みに合わせて調整する方法です。複雑な多段階のパイプラインを単一の安定したトレーニング損失にまとめます。
従来の RLHF と比較して、DPO は何を排除しますか?
DPO の主な利点は、明示的な報酬モデルと RL サンプリング ループを削除し、代わりに優先順位ペアに基づいてポリシーを直接最適化することです。
単一の DPO トレーニング サンプルはどのようなデータで構成されていますか?
DPO は、プロンプトに加えて、1 つの優先 (「選択」) 応答と 1 つの非優先 (「拒否」) 応答という優先ペアでトレーニングします。
参照モデルは DPO においてどのような役割を果たしますか?
凍結された参照 (通常は SFT モデル) は損失を固定します。 beta パラメータは、トレーニングされたポリシーがそこからどこまで移動できるかを制御します。
DPO では、「報酬」はどこで表されますか?
DPO の導出は、報酬がポリシーと参照の間の対数確率比に暗黙的に含まれることを示しているため、明示的な報酬モデルは必要ありません。
DPO のベータ (温度) パラメーターは何を制御しますか?
ベータは暗黙的な KL 制約を制御します。ベータが高いほどポリシーが基準に近づき、ベータが低いほど、より多くの逸脱が許容されます。