Best-of-N のサンプリングと再ランキング
Best-of-N サンプリングでは、モデルからいくつかの候補回答が生成され、別のスコアリング ステップを使用して最良の回答が選択されます。
概要
It is one of the simplest, most reliable ways to trade extra compute at inference time for higher answer quality.
ディープダイブ
サンプリングを伴う言語モデルは、実行するたびに異なる出力を生成します。 Best-of-N はこれを利用します。N 個の回答候補を抽出し、それらを再ランク付けして、上位のものを返します。リランカーは、学習された報酬モデル (人間のフィードバックからの強化学習で一般的)、正しさをチェックする検証器、または多数決による回答一致のような単純なヒューリスティックです。モデルでは多くの試行のうち良好な試行が 1 つだけ必要なため、特に正しいパスが存在するが必ずしも最初のサンプルであるとは限らない推論タスクやコード タスクでは、N が増加するにつれて品質が急激に向上します。コストは N で線形であり、スコアラーが不完全な場合、つまり報酬ハッキングまたは報酬の過剰最適化と呼ばれる失敗モードの場合、ゲインは最終的に頭打ちになるか逆転することさえあります。
技術的な洞察
ベストオブ N の質は完全にスコアラーに左右されます。完璧な検証器では、精度は N 個のサンプルのうち少なくとも 1 つが正しい確率に近づき、N が大きくなると急速に上昇します。ノイズの多い報酬モデルでは、選択をだますことができます。N を非常に高くすると、スコアラーの盲点に対して最適化しているため、スコアは高くても実際には間違っている出力が増幅されます。これが、成果を上げ続けるテクニックにとって、調整された堅牢な報酬モデルが重要である理由です。
戦略的影響
速度とスケール
言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。
アクセスと到達範囲
言語やコミュニケーション スタイルを超えてアクセスが拡張されます。
より明確な判決
自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。
Best-of-N サンプリングと再ランキングの将来
Best-of-N は、思考連鎖やツリー検索と並んで、推論時間スケーリングの中核となる構成要素になりつつあります。加重多数決、各推論ステップをスコアリングするプロセス報酬モデル、および信頼性が高くなるとサンプリングを停止する適応 N など、よりスマートなバリエーションが期待されます。検証機能が向上するにつれ、特に正確性をチェックできるコードや数学では、多くのサンプルを再ランク付けすることが、ベース モデルを再トレーニングせずに予備のコンピューティングを信頼性に変換する標準的な方法となるでしょう。
現実世界の実装
数学の問題に対する 64 の解決策をサンプリングし、ほとんどのサンプルが同意する回答を選択します (自己一貫性 / 多数決)。
複数のコード補完を生成し、最も多くの単体テストに合格したものを自動検証ツールとして保持します。
RLHF パイプラインでいくつかの応答を描画し、報酬モデルのスコアが最も高い応答を選択してユーザーに提供します。
いくつかの要約草案を作成し、それらを高品質のモデルで再ランク付けして、最も忠実で簡潔な要約を返します。
リスクとガードレール
幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。
迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。
アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。
実装ロードマップ
展開する前に、出力形式、トーン、品質基準を定義します。
正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。
一か八かの成果物については人間によるレビュー チェックポイントを維持します。
失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Best-of-N Sampling and Reranking quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
温度とサンプリング
よくある質問
What is Best-of-N Sampling and Reranking?
Best-of-N サンプリングでは、モデルからいくつかの候補回答が生成され、別のスコアリング ステップを使用して最良の回答が選択されます。これは、推論時に余分なコンピューティングを犠牲にしてより高い応答品質を得る、最もシンプルで信頼性の高い方法の 1 つです。
Best-of-N サンプリングの中心的な考え方は何ですか?
Best-of-N では、複数の回答候補を抽出し、それらを再ランク付けして、最もスコアの高い回答を返します。
Best-of-N が最も役立つ傾向があるのはどの種類のタスクですか?
モデルが時々しか見つけられない検証可能な正解がある場合、より多くの候補をサンプリングすると、その候補が正しい可能性が高くなります。
Best-of-N が実際に結果を改善するかどうかを主に決定するものは何でしょうか?
選択はリランカーと同じくらい優れています。採点者が弱いか偏っていると、間違った答えを選んでしまう可能性があります。
不完全な報酬モデルで N が非常に高く設定された場合、どのような失敗モードが発生する可能性がありますか?
欠陥のあるスコアラーに対して厳しい最適化を行うと、その死角を利用する出力が増幅されるため、精度が頭打ちになったり、低下したりする可能性があります。
自己一貫性とも呼ばれる単純な再ランキング戦略はどれですか?
自己一貫性は、多くの推論チェーンをサンプリングし、ほとんどの推論チェーンが同意する最終的な答えを選択します。