RLHF におけるグループ化された報酬の正規化
グループ化された報酬正規化は、同じプロンプトに対する応答のバッチ内でモデルの報酬を標準化し、ノイズの多いスコアを安定したトレーニング信号に変えます。
概要
It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.
ディープダイブ
ヒューマン フィードバックからの強化学習 (RLHF) では、モデルが応答を生成し、報酬モデルが応答をスコア付けしますが、生の報酬にはノイズが多く、プロンプト間で大きく異なります。グループ化された報酬の正規化では、同じプロンプトに対する複数の応答のグループをサンプリングし、グループ平均を減算してグループの標準偏差で割ることによって各報酬を正規化することでこの問題を修正します。この Z スコアが有利になります。このアプローチは、DeepSeek によって導入された Group Relative Policy Optimization (GRPO) の中心であり、DeepSeek-R1 の推論を強化したことで有名です。重要なことは、グループ平均がベースラインとして機能するため、GRPO は PPO で使用される個別の価値ネットワーク (批評家) を排除することです。これにより、勾配信号の適切なスケーリングを維持しながら、トレーニングがよりシンプルかつ安価になり、メモリ効率が向上します。
技術的な洞察
報酬 r_1...r_G を持つ出力のグループの場合、利点は A_i = (r_i − means(r)) / std(r) です。グループの平均よりも優れた反応はプラスの利点を獲得し、強化されます。平均より悪いものは押し下げられます。比較はプロンプト内で相対的なものであるため、絶対的な報酬スケールとプロンプトごとの難易度が相殺され、差異が減少します。 GRPO は、モデルが過度にドリフトするのを防ぐために、参照ポリシーに対して PPO のクリップされた目標と KL ペナルティを維持します。
戦略的影響
より明確な判決
これは、明確な技術的主張とマーケティング言語を区別するのに役立ちます。
費用と予算
お金や時間を費やす前に、実装に関するより良い質問をすることができます。
チームとワークフロー
共通の理解を持ったチームは、製品、ポリシー、学習に関する意思決定をより適切に行うことができます。
RLHF におけるグループ化された報酬正規化の将来
グループ化された正規化は推論モデルのブームを加速させており、モデルは学んだ批評家なしで数学の正解などの検証可能な報酬から学習します。研究はそれを洗練させており、標準偏差で割るかどうか、利点がゼロの全正解グループまたは全不正解グループの処理、グループ サイズの調整などについて議論しています。グループ化された批判のない手法がエージェント ツールの使用やコード生成に広がり、自動検証機能が安価で豊富な報酬シグナルを提供することが期待されます。
現実世界の実装
問題ごとに 16 個の解決策をサンプリングし、グループの平均正答率を上回ったものに報酬を与えることで、数学的推論モデルをトレーニングします。
各ユーザー プロンプトに対する複数の応答候補の報酬モデル スコアを正規化することで、チャットボットの有用性を微調整します。
サンプリングされた各ソリューションが単体テストに合格するかどうかによってスコア付けされ、グループ内で正規化されるコーディング アシスタントを改善します。
PPO クリティカル ネットワークを削除し、代わりにグループ平均をベースラインとして使用することで、RLHF パイプラインの GPU メモリを削減します。
リスクとガードレール
チームが異なれば、同じ用語の使用方法も異なる可能性があるため、範囲を早めに定義してください。
ベンチマークは好調に見えても、実際のパフォーマンスにはばらつきがある場合があります。
データの品質と評価計画を無視すると、多くの場合、脆弱な結果が生じます。
実装ロードマップ
必要な結果を平易な言葉で定義することから始めます。
テストする前に、成功指標と失敗条件を 1 つ選択します。
洗練されたデモセットではなく、代表的なデータを使用して小規模なパイロットを実行します。
RLHF のグループ化された報酬正規化がどのような場合に役立ち、より単純な方法の方が優れているのかを文書化します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grouped Reward Normalization in RLHF quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
プリファレンスの最適化における長さの正規化
よくある質問
What is Grouped Reward Normalization in RLHF?
グループ化された報酬正規化は、同じプロンプトに対する応答のバッチ内でモデルの報酬を標準化し、ノイズの多いスコアを安定したトレーニング信号に変えます。これは、多くの最新の推論モデルを強化するアルゴリズムである GRPO の背後にある中心的なトリックです。
グループ化された報酬の正規化では、各応答の報酬は何と比較されますか?
各報酬は、同じプロンプトに対する応答グループの平均と標準偏差を使用して Z スコアに変換されます。
グループ化された報酬の正規化に最も関連しているアルゴリズムはどれですか?
DeepSeek によって導入され、DeepSeek-R1 で使用されている GRPO は、グループ内の報酬の正規化を中心に構築されています。
GRPO が特に排除する標準 PPO のコンポーネントは何ですか?
グループ平均をベースラインとして使用することにより、GRPO は学習された批評家を削除し、メモリとコンピューティングを節約します。
報酬がグループの平均を下回る応答はどうなりますか?
グループ平均を減算すると、平均を下回る回答にはマイナスの利点があり、政策がそれらから遠ざけられます。
グループ内で正規化するとトレーニングの分散が減少するのはなぜですか?
比較は各プロンプト内で相対的なものであるため、絶対的なスケールとプロンプトの難易度の違いは解消されます。