人間のフィードバックからの強化学習
RLHF は、生の言語モデルを人間の好みに基づいてトレーニングすることで、役立つ丁寧なアシスタントに変える技術です。
概要
It matters because it aligns model behavior with what people actually want, not just what is statistically likely.
ディープダイブ
事前トレーニングされた言語モデルは、もっともらしいテキストを予測しますが、もっともらしいことは、役立つ、正直、または安全であることと同じではありません。 RLHF はこの問題を段階的に修正します。まず、教師あり微調整では、人間が書いた回答例を使用して指示に従うようにモデルを学習します。次に、人間は同じプロンプトに対するモデル応答のペアを比較し、より良い方を選択します。これらの比較により、応答をスコアリングする別の報酬モデルがトレーニングされます。最後に、言語モデルは強化学習によって最適化され、報酬モデルが高く評価する応答が生成されます。ペナルティにより、元のモデルから大きく外れないようにするため、滑らかなままであり、報酬モデルの癖を悪用することはありません。 RLHF は、ChatGPT スタイルのアシスタントを使用できるようにする上で中心的な役割を果たしました。
技術的な洞察
報酬モデルは通常、ブラッドリー・テリー形式の損失を伴う好みのペアでトレーニングされ、人間が好む回答に高いスカラー スコアを与えるように学習します。その後、ポリシーは PPO (近接ポリシー最適化) で更新され、報酬を最大化すると同時に、参照モデルに対する KL 発散ペナルティが過剰な最適化と「報酬ハッキング」を防ぎます。 PPO は扱いにくいため、DPO (直接優先最適化) のような新しい手法では、明示的な報酬モデルと強化ループをスキップし、優先ペアから直接ポリシーを最適化します。
戦略的影響
費用と予算
アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。
より明確な判決
技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。
品質管理
より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。
人間のフィードバックから学ぶ強化学習の未来
RLHF は合理化され、部分的に自動化されています。 DPO とそれに関連する直接優先手法は、多くのチームにとって重い PPO パイプラインに取って代わりつつあり、RLAIF は AI によって生成されたフィードバック (Constitutional AI と同様) を使用してラベル作成コストを削減しています。研究では、プロセスの監視やディベートなどの手法を使用して、報酬ハッキング、アノテーターのバイアス、長い応答や専門家の応答を判断することの難しさに取り組んでいます。人間と AI のフィードバックを融合する調整、単一の親指アップを超えたより豊富な報酬シグナル、および誰が好みを提供し、どのような値をエンコードするかについての監視の強化が期待されます。
現実世界の実装
チャット アシスタントを調整して、有害なリクエストを拒否し、ただもっともらしいテキストではなく、役立つ、よく構造化された回答を提供します。
人間の好みに基づいて要約のペアをランク付けし、人間が実際に役立つと感じる要約を作成するモデルをトレーニングします。
人間の評価者が敬意を表し安全であると判断した回答に報酬を与えることで、有害な出力や偏った出力を削減します。
完全な PPO ループを実行せずに、優先回答と拒否回答のデータセットで DPO を使用してオープンソース モデルを調整します。
リスクとガードレール
1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。
インフラストラクチャとメンテナンスのコストは過小評価されがちです。
システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。
実装ロードマップ
実装前にレイテンシ、品質、コストの目標を定義します。
現実的な負荷とデータ条件でのベンチマーク。
エラー、ドリフト、ユーザーへの影響を計測器で監視します。
スケーリングの前に、ロールバックとインシデント対応のパスを準備します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Reinforcement Learning From Human Feedback quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
強化学習
よくある質問
What is Reinforcement Learning From Human Feedback?
RLHF は、生の言語モデルを人間の好みに基づいてトレーニングすることで、役立つ丁寧なアシスタントに変える技術です。これは、モデルの動作を、統計的にありそうなものだけではなく、人々が実際に望んでいることと一致させるため、重要です。
言語モデルにおける RLHF の主な目的は何ですか?
RLHF は、人間が好む反応に向けてモデルを誘導し、それを単にもっともらしいものではなく、より有用で、正直で、安全なものにします。
RLHF の報酬モデルは実際に何を行うかを学習しますか?
報酬モデルは人間の好みの比較に基づいてトレーニングされ、応答をスコアリングし、ポリシーが最適化するシグナルを提供します。
RL ステップ中に元のモデルに対する KL 発散ペナルティが使用されるのはなぜですか?
KL ペナルティにより、最適化されたポリシーが参照モデルに近い状態に保たれ、報酬のハッキングや流暢さの損失が防止されます。
報酬モデルのために嗜好データは通常どのように収集されますか?
アノテーターはペアワイズ比較で好ましい応答を選択し、ブラッドリー・テリー形式の損失を通じて報酬モデルをトレーニングします。
DPO (Direct Preference Optimization) は、従来の RLHF パイプラインに比べてどのような利点がありますか?
DPO は、個別の報酬モデルや面倒な強化学習ステップを回避し、好みから直接目標を導き出します。