除去サンプリングの微調整
拒否サンプリング微調整 (RFT) は、多数の回答候補を生成し、最もスコアの高い回答のみを保持し、それらの勝者に基づいてモデルを再トレーニングします。
概要
It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.
ディープダイブ
拒否サンプリング微調整は、ベストオブ N 微調整とも呼ばれ、Meta の Llama 2 と Llama 3 のようなモデルをどのように調整するかにおいて重要な要素です。レシピは簡単です。プロンプトごとに、現在のモデルからいくつかの応答 (たとえば 4 ~ 64) をサンプリングし、報酬モデルまたは自動チェッカーでそれぞれをスコア付けし、最上位の出力を除くすべてを破棄 (「拒否」) します。生き残った高品質のサンプルは、新鮮な教師付き微調整データセットとなり、モデルは通常のネクストトークン損失を使用してそれらに基づいてトレーニングされます。このループを反復的に繰り返すことで、モデル自体がより適切な答えを生成できるようになります。モデルは独自のフィルター処理された出力から学習するため、RFT は報酬信号を活用しながら、ポリシー勾配 RL の不安定性と調整の悩みを回避します。
技術的な洞察
RFT は、何度もサンプリングして最大の報酬応答を維持すると、鮮明で高品質な分布からの選択に近似するという事実を利用します。標準のクロスエントロピーを介してこれらの勝者をトレーニングすると、その最良の N 動作がモデルの単一サンプル出力に効率的に抽出されます。数学やコードなどの検証可能な領域の場合、「報酬」は単に最終的な回答または単体テストに合格するかどうかであり、学習された報酬モデルの必要性が完全になくなります。
戦略的影響
速度とスケール
言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。
アクセスと到達範囲
言語やコミュニケーション スタイルを超えてアクセスが拡張されます。
より明確な判決
自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。
リジェクションサンプリング微調整の未来
RFT は現代のポストトレーニングの中心であり、多くの場合、PPO や DPO などの RL 手法の前または並行して使用されます。その魅力は、安価な推論と強力な自動検証機能によってさらに高まります。モデルの自己生成と自己チェックが向上するにつれて、反復拒否サンプリングが合成データと自己改善ループをサポートします。検証可能な思考連鎖を生成する推論モデルとのより緊密な統合と、モデル自身の出力で繰り返しトレーニングする際の報酬ハッキングや多様性の崩壊を回避する方法についての継続的な研究が期待されます。
現実世界の実装
プロンプトごとに複数の回答をサンプリングすることで Llama スタイルのモデルを調整し、最高の報酬モデル スコアを維持し、それらを SFT します。
多数の解を生成し、正しい、確認可能な答えに到達したものだけを保持することにより、数学ソルバーを改善します。
単体テストに合格した場合にのみ候補が保持され、トレーニング データとして使用されるコード生成
次のトレーニング ラウンドに向けてモデル自身の最適な自己生成応答をフィルタリングすることにより、合成命令データセットを構築する
リスクとガードレール
幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。
迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。
アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。
実装ロードマップ
展開する前に、出力形式、トーン、品質基準を定義します。
正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。
一か八かの成果物については人間によるレビュー チェックポイントを維持します。
失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rejection Sampling Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
QLoRA と 4 ビット微調整
よくある質問
What is Rejection Sampling Fine-Tuning?
拒否サンプリング微調整 (RFT) は、多数の回答候補を生成し、最もスコアの高い回答のみを保持し、それらの勝者に基づいてモデルを再トレーニングします。これは、複雑な強化学習の代わりに単純な教師あり学習を使用して RLHF の利点の多くを提供するため、重要です。
リジェクションサンプリング微調整の中心的な考え方は何ですか?
RFT は複数の回答をサンプリングし、最もスコアの高い回答をフィルタリングし、それらの勝者に基づいてモデルを微調整します。
数学やコードなどの検証可能な領域では、何が報酬として機能するのでしょうか?
チェック可能なタスクの場合、RFT は正確な正確性を使用するか単体テストに合格することで、学習された報酬モデルを回避できます。
アライメント中にリジェクションサンプリングを使用したことで有名なモデルファミリーはどれですか?
Meta では、Llama 2 および Llama 3 モデルのトレーニング後のレシピの一部として拒否サンプリングを使用する方法について説明しました。
なぜチームは PPO のようなポリシー勾配 RL よりも RFT を好むのでしょうか?
RFT は、フィルタリングされたサンプルに対する標準のネクスト トークン損失を使用して再トレーニングし、ポリシー勾配法の調整の困難さと不安定性を回避します。
最大報酬サンプルでのトレーニングは効果的に何をしますか?
フィルタリングされた上位の応答から学習することにより、モデルは 1 世代でより高品質の動作を内部化します。