言語AIガイド

近接ポリシーの最適化

Proximal Policy Optimization (PPO) は、人間のフィードバックからの言語モデルの微調整に最も関連した強化学習アルゴリズムです。

2分の読書最終更新日

概要

It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.

ディープダイブ

PPO は 2017 年に OpenAI によって導入され、InstructGPT や ChatGPT などのシステムの RLHF の背後で主力となりました。ポリシー勾配 RL の主な課題は、1 つの大規模すぎる更新によってパフォーマンスが崩壊する可能性があることです。 PPO は、「クリップされた代理目標」でこれに対処します。これは、古いポリシーと比較してアクションの可能性がどれだけ高くなった (または低くなった) かを測定し、その比率に利点 (アクションが予想よりどれだけ優れていたか) を乗じて、比率を 0.8 ~ 1.2 のような小さな範囲にクリップします。これにより、アップデートごとにポリシーがどこまで移動できるかが制限され、安定した学習を維持しながら着実な改善が可能になります。言語モデル RLHF では、「アクション」はトークンまたは応答を生成し、報酬は報酬モデルから得られ、KL ダイバージェンス ペナルティによってモデルが元の動作から大きく逸脱することがなくなります。

技術的な洞察

PPO はクリップされた目標を最大化します: min(ratio * Advantage, Clip(ratio, 1-eps, 1+eps) * Advantage)。ここで、ratio は新しいアクションと古いアクションの確率です。利点は通常、一般化利点推定と学習値 (批評) ネットワークを使用して推定されます。 RLHF では、合計報酬は、報酬モデルのスコアと、参照ポリシーに対するトークンごとの KL ペナルティを組み合わせて、元のモデルに近い状態を維持することと報酬の獲得のバランスをとります。

戦略的影響

速度とスケール

言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。

アクセスと到達範囲

言語やコミュニケーション スタイルを超えてアクセスが拡張されます。

より明確な判決

自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。

近接ポリシー最適化の将来

PPO は依然として強力ですが、扱いにくいことで知られています。別個の値ネットワーク、慎重なハイパーパラメータ調整、および大量のコンピューティングが必要です。 DPO (RL がまったくない) や GRPO など、よりシンプルな代替案が普及しつつあります。GRPO は、サンプリングされた応答のグループから利点を推定することで価値ネットワークを落とし、最近の推論モデルを強化しています。 PPO は、ポリシーに基づいた探索が真に役立つ場合には存続しますが、この分野では、その複雑さの一部をより安価な方法と積極的に交換しています。

現実世界の実装

RLHF 経由の指示と人間の好みに従うように InstructGPT と ChatGPT を微調整する

ゲームプレイおよびロボット制御エージェントのトレーニング、言語モデル以前の PPO の独自領域

KL 制約の下で報酬モデル スコアを最大化することによる毒性の軽減または有用性の向上

モデルがタスクを正しく完了すると報酬が得られる、ツールの使用または複数ステップのエージェントの動作を最適化します。

リスクとガードレール

幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。

迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。

アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。

実装ロードマップ

1

展開する前に、出力形式、トーン、品質基準を定義します。

2

正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。

3

一か八かの成果物については人間によるレビュー チェックポイントを維持します。

4

失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Proximal Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

グループ相対ポリシーの最適化

よくある質問

What is Proximal Policy Optimization?

Proximal Policy Optimization (PPO) は、人間のフィードバックからの言語モデルの微調整に最も関連した強化学習アルゴリズムです。慎重かつ小さなステップでポリシーを改善し、単純なポリシー勾配手法に見られる不安定性を回避します。

PPO の「クリッピング」は主にどのような問題に対処しますか?

確率比をクリップすることにより、単一の更新でポリシーが過度に移動することを防ぎます。これは、ポリシー勾配手法の不安定性の主な原因です。

PPO を使用した言語モデル RLHF では、報酬シグナルは通常どこから来るのでしょうか?

RL 中にすべての出力を人間に採点させるのは現実的ではないため、報酬モデルは生成された応答に対するスカラー報酬を提供します。

KL ダイバージェンス ペナルティは PPO ベースの RLHF で何をしますか?

元の (参照) ポリシーに対するトークンごとの KL ペナルティは、モデルが報酬を追求する際にその動作を大幅に変更することを妨げます。

PPO における価値 (批評) ネットワークの役割は何ですか?

PPO はアクター批判的な手法です。バリュー ネットワークは期待される報酬を推定し、分散を削減する利点の推定 (多くの場合 GAE 経由) を可能にします。

PPO における「アドバンテージ」とは何を意味しますか?

利点は、選択したアクションが推定値と比較してどれだけ優れていたか (または悪かったか) を測定し、どのアクションを強化するかをポリシーに指示します。