基本ガイド

プリファレンスの最適化における長さの正規化

長さの正規化により好みの調整の目標が調整されるため、モデルは長い回答を書くだけで承認を得ることができなくなります。

2分の読書最終更新日

概要

It matters because uncorrected reward signals push chatbots toward verbose, padded responses instead of genuinely better ones.

ディープダイブ

モデルが RLHF や DPO などの手法と連携すると、人間 (または報酬モデル) が 2 つの答えのうち「より良い方」を選択した比較から学習します。永続的なバグは、実際には優れているわけではない場合でも、長い回答が好まれる傾向にあるため、モデルは近道、つまり冗長であることを学習します。長さの正規化はこれに対処します。 DPO では、暗黙的な報酬はトークンごとの対数確率の差の合計であり、長さとともに機械的に増加します。長さ正規化 DPO や SimPO などのバリアントでは、その報酬をトークンの数で除算し、代わりにトークンごとの平均でスコアを付けます。その結果、目標に合わせて応答を膨らませるのではなく、簡潔で的を射たモデルが得られます。

技術的な洞察

DPO の暗黙的な報酬は、応答内のすべてのトークンを合計した、調整ポリシーと参照ポリシー間の対数比です。各トークンは別の (通常は正の) 項を追加するため、生の報酬はシーケンスの長さに応じてスケールされ、最適化がより長い完了に向けて偏ります。 SimPO は参照モデルを削除し、トークンごとの平均対数確率を報酬として使用し、さらに目標報酬マージンを使用します。長さで割ると機械的な長さの利点がなくなるため、好みの勾配は単語数ではなく品質を反映します。

戦略的影響

より明確な判決

これは、明確な技術的主張とマーケティング言語を区別するのに役立ちます。

費用と予算

お金や時間を費やす前に、実装に関するより良い質問をすることができます。

チームとワークフロー

共通の理解を持ったチームは、製品、ポリシー、学習に関する意思決定をより適切に行うことができます。

プリファレンス最適化における長さ正規化の将来

長さコントロールが後付けではなく標準ノブになることを期待してください。研究者らは、長さの正規化と明示的な長さのペナルティ、長さ条件付きの報酬、および回答の長さを一定に保つ評価スイートを組み合わせて、真の品質向上を測定しています。報酬モデルが冗長性の偏りを発見する能力が向上するにつれて、アライメントパイプラインはデフォルトで長さから偏りのない勝率を報告する可能性が高く、ユーザーはモデルの回答をどの程度簡潔にするか詳細にするかをより細かく制御できるようになります。

現実世界の実装

SimPO を使用してカスタマー サポート アシスタントを調整し、単に綿密に見えるだけの詰め込まれた段落ではなく、鮮明で正確な返信を提供できるようにします。

AlpacaEval 2 で「長さ制御された勝率」をレポートし、モデルが単におしゃべりになっただけではなく、真に改善されたことを示しています。

コーディング モデルを微調整するときに DPO に長さの正規化を追加して、肥大化した定型文ではなく最小限の正しいスニペットを返すようにします。

体系的に長いエッセイのスコアを高くする報酬モデルを診断し、それを使用して執筆アシスタントを調整する前にバイアスを軽減します。

リスクとガードレール

チームが異なれば、同じ用語の使用方法も異なる可能性があるため、範囲を早めに定義してください。

ベンチマークは好調に見えても、実際のパフォーマンスにはばらつきがある場合があります。

データの品質と評価計画を無視すると、多くの場合、脆弱な結果が生じます。

実装ロードマップ

1

必要な結果を平易な言葉で定義することから始めます。

2

テストする前に、成功指標と失敗条件を 1 つ選択します。

3

洗練されたデモセットではなく、代表的なデータを使用して小規模なパイロットを実行します。

4

Preference Optimization における長さの正規化が役立つ箇所と、より単純な方法の方が優れている箇所を文書化します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Length Normalization in Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

オッズ比優先の最適化

よくある質問

What is Length Normalization in Preference Optimization?

長さの正規化により好みの調整の目標が調整されるため、モデルは長い回答を書くだけで承認を得ることができなくなります。これが重要なのは、修正されていない報酬シグナルにより、チャットボットが真に優れた応答ではなく、冗長で埋め尽くされた応答に向かうためです。

DPO における長さの正規化は主にどのような望ましくない動作を防ぐことを目的としていますか?

DPO の暗黙的な報酬はトークン数に応じて増加するため、正規化を行わない場合、モデルは単純に冗長である方が優先比較に勝つ傾向があることを学習します。

標準 DPO の暗黙的報酬が応答の長さに応じて増加する傾向があるのはなぜですか?

暗黙的な報酬はすべてのトークンの対数確率比を合計するため、一般にトークンが多いほど総報酬も大きくなります。

SimPO は長さの偏りにどのように対処しますか?

SimPO は、平均 (長さで正規化された) 対数確率によって応答をスコアリングし、ターゲット報酬マージンを追加して、機械的な長さの利点を取り除きます。

モデルの長さだけではなく品質が向上していることを確認するのに役立つ評価手法はどれですか?

長さによって制御された勝率 (AlpacaEval 2 と同様) は回答の長さを調整するため、ゲインは冗長さではなく品質を反映します。