グループ相対ポリシーの最適化
Group Relative Policy Optimization (GRPO) は、同じプロンプトに対する兄弟回答のグループに対して各回答を判断する、言語モデルを微調整するための強化学習手法であり、PPO で使用される個別の値ネットワークを排除します。
概要
It became famous as the core training trick behind DeepSeek's reasoning models.
ディープダイブ
GRPO は、大規模な言語モデルの RL 微調整をより安価かつより安定させるように設計されたポリシー勾配強化学習の一種です。標準 PPO では、各トークンがどれほど優れているかを推定するために、ポリシー自体とほぼ同じ規模の学習された「批評家」 (価値モデル) が必要です。 GRPO はその批判者を完全に排除します。プロンプトごとに、完了のグループ (たとえば 8 ~ 64) をサンプリングし、報酬信号でそれらすべてをスコア付けし、グループの平均と標準偏差に対して報酬を標準化することによって各完了の優位性を計算します。平均を上回る回答は強化され、平均を下回る回答は抑制されます。 KL ダイバージェンス項により、モデルは参照ポリシーに近づきます。 DeepSeek によって導入され、DeepSeekMath および DeepSeek-R1 推論モデルを強化しました。
技術的な洞察
重要なアイデアは、PPO の学習値ベースラインをモンテカルロ グループ ベースラインに置き換えることです。報酬 r_i を持つ出力のグループの場合、それぞれの利点は A_i = (r_i - means(r)) / std(r) です。その正規化されたスコアは、PPO とまったく同様に、クリップされた確率比を乗算し、凍結された参照モデルに対する KL ペナルティがドリフトを抑制します。批評家は訓練を受けていないため、メモリと計算量はおよそ半分になり、プロンプトごとの正規化により、自然にスケーリングされ、分散が小さい利点が得られます。
戦略的影響
費用と予算
アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。
より明確な判決
技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。
品質管理
より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。
グループ相対ポリシー最適化の将来
GRPO はオープン推論モデルをトレーニングするためのデフォルトのレシピとして急速に普及しており、研究室はその弱点について繰り返し研究を行っています。研究者たちは、長さと難易度のバイアス (GRPO 博士など) の修正、シーケンス レベルではなくトークン レベルの正規化、KL 用語の削除または再構成を検討しています。検証可能な報酬 (数学、コード、ツールの使用) との緊密な統合、スパース信号のより適切な処理、およびエージェント的なマルチステップ タスクに対するグループ ベースラインと軽量の批評家を組み合わせたハイブリッドが期待されます。
現実世界の実装
DeepSeek-R1 と DeepSeekMath をトレーニングして、数学の問題に対するルールベースの正解報酬を使用して長い思考連鎖推論を生成する
サンプルされた各ソリューションが単体テストに合格するかどうかによってスコア付けされ、勝者を選択するためにグループが正規化される、コード生成モデルの微調整
GRPO を使用したオープンソース RLHF パイプライン (TRL および verl ライブラリなど) により、個別のバリュー ネットワークに料金を支払うことなくチャット モデルを調整できます。
プロンプトごとに複数の応答をサンプリングし、報酬モデルで他の応答と比べて最も高い評価を与えたものに報酬を与えることで、指示に従う行動や安全行動を改善します。
リスクとガードレール
1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。
インフラストラクチャとメンテナンスのコストは過小評価されがちです。
システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。
実装ロードマップ
実装前にレイテンシ、品質、コストの目標を定義します。
現実的な負荷とデータ条件でのベンチマーク。
エラー、ドリフト、ユーザーへの影響を計測器で監視します。
スケーリングの前に、ロールバックとインシデント対応のパスを準備します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Group Relative Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
近接ポリシーの最適化
よくある質問
What is Group Relative Policy Optimization?
Group Relative Policy Optimization (GRPO) は、同じプロンプトに対する兄弟回答のグループに対して各回答を判断する、言語モデルを微調整するための強化学習手法であり、PPO で使用される個別の値ネットワークを排除します。これは、DeepSeek の推論モデルの背後にある中核となるトレーニング トリックとして有名になりました。
GRPO が排除する PPO の主なコンポーネントは何ですか?
GRPO のシグネチャの変更により、PPO の学習値/クリティカル モデルが削除されます。このモデルは、通常はポリシーとほぼ同じサイズであり、大幅なメモリとコンピューティングが節約されます。
GRPO は特定の完了に対する利点をどのように計算しますか?
各完了の利点は (報酬 - グループ平均) / グループ標準偏差であるため、同じプロンプトに対する回答のグループがベースラインとして機能します。
GRPO を有名にしたのはどのモデルですか?
GRPO は、DeepSeek、特に DeepSeekMath および DeepSeek-R1 推論モデルの背後にある RL エンジンとして導入され普及しました。
KL ダイバージェンス項は GRPO においてどのような役割を果たしますか?
参照 (通常は RL より前) モデルに対する KL ペナルティはトレーニングを正規化するため、ポリシーが崩壊したり縮退した出力に流れ込むことなく改善されます。
GRPO が数学やコードで推論モデルをトレーニングするのに特に魅力的なのはなぜですか?
多くのソリューションをサンプリングし、自動正確性チェックでそれらをスコアリングすることは、GRPO のグループ正規化の利点ときれいに組み合わされており、批評家は必要ありません。