ニュースに戻る
革新AI Understanding ブリーフィング

論文は、LLM 解答セットの多様性を維持する点で RL に勝つ進化戦略を主張しています

新しい arXiv のプレプリントでは、進化戦略 (重みに直接摂動を与える母集団ベースの勾配のない手法) を使用したポストトレーニング LLM が、pass@k と解のカバレッジで強化学習に勝ると主張しています。要約では、より優れた数学ベンチマーク結果が引用されていますが、モデル、ベンチマーク、数値の名前は挙げられていません。

7 min readRead the primary source
Source-page capture accompanying Paper Argues Evolution Strategies Beat RL at Keeping LLM Answer Sets Diverse
一次情報源文書記録されたソース
出版社
arxiv.org
ソースリンク
arxiv.orghttps://arxiv.org/abs/2608.12679
ソースの種類
一次文書 — 私たちが直接読む公式発表、論文、提出書類、またはファーストパーティのページ。
コンテキスト60秒で理解できる

ここから始めましょう

重要な用語

大規模言語モデル (LLM)
テキストを生成および分析するために大規模なテキスト コーパスでトレーニングされた言語モデル。
人工知能 (AI)
パターン認識、推論、言語、意思決定を必要とするタスクを実行するシステムを構築する広範な分野。
強化学習
報酬によるトレーニングは、エージェントが長期的な利益を最大化するアクションを学習することを示します。
自分自身をテストしてくださいAIトレーニングクイズ

何が起こったのか

7人の研究者がarXivにプレプリントを投稿し、トレーニング後の強化学習は言語モデルの答えの多様性を崩壊させ、進化戦略(ランダムな摂動を通じて重み空間で直接最適化する)がその多様性を維持し、pass@kを高めると主張した。この論文は2026年8月13日に提出され、査読は受けていません。一般に公開されている要約には、ベンチマーク名、モデル サイズ、測定値は含まれていません。

「Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies」というタイトルのプレプリントが 2026 年 8 月 13 日に arXiv に提出され、人工知能 (cs.AI) の下にカタログ化され、ニューラルおよび進化的コンピューティング (cs.NE) に二次リストが追加されました。この本の著者は、Conor F. Hayes、Elliot Meyerson、Kajetan Schweighofer、Roberto Dailey、Babak Hodjat、Risto Miikkulainen、Xin Qiu の 7 名です。 arXiv の記録には所属機関が記載されておらず、この報告書もその研究がどの組織にも帰属するものではありません。

この論文の構成は、数学や科学などの発見の場面で言語モデルが通常どのように使用されるかというところから始まります。つまり、問題が提示され、モデルの 1 つの答えが提案された解決策として採用されます。著者らは、追加のテスト時間の計算を 1 つではなく多数の候補解を生成するために費やすことができるため、この「最良推測」モードには価値が残ると主張しています。この状況は通常、pass@k で測定されます。これは、サンプリングされた k 個の試行のうち少なくとも 1 つが正しい場合に問題が解決されたとみなすメトリックです。

中心的な主張は、現在の診療における副作用の診断です。著者らは、強化学習を使用してモデルをトレーニングした後、高報酬出力を中心にモデルの出力分布を狭め、その狭まりによってソリューションのカバレッジが崩れると書いています。言い換えれば、RL は、個別の答えのセットを小さくしながら、最初の答えをより良くすることができます。これにより、作成者が関心を持っている pass@k レジームに特にペナルティが課せられます。

代替案として、この論文は進化戦略を提案しています。これは、報酬信号を逆伝播するのではなく、ランダムな摂動をモデルパラメータに適用し、結果に基づいて選択することにより、重み空間で直接最適化する、母集団ベースの勾配のないポストトレーニング手法です。要約では、ES は RL よりも一貫して高い pass@k を達成し、より広いソリューション カバレッジでより幅広い出力分布を生成し、このカバレッジが標準的な数学ベンチマークでより良い結果につながると述べています。

要約に記載されていないものは、ほとんどの証拠です。モデル ファミリやパラメーター数、特定のベンチマーク、k の値、ベースライン RL アルゴリズム、および数値結果については言及されていません。提供される特徴付けは、「一貫して高い」および「より良い結果」という言葉だけです。提出された内容は 449 KB で、全文は PDF および実験用 HTML として入手できるため、これらの詳細は論文に記載される可能性があります。それらはここで評価されるレコードに存在しないだけです。これはバージョン 1 のプレプリントであり、査読の兆候がなく、目に見えるコードやデータ リンクもなく、独立した複製もありません。

ソースの詳細: arxiv.org

なぜそれが重要なのか

証明、コード、科学的仮説など、候補となる答えをチェックできる領域では、有用な上限は、モデルの最初の推測が正しいかどうかではなく、一連の試行のどこかに正しい答えが現れるかどうかです。 RL ポストトレーニングが体系的にそのプールを縮小する場合、業界の支配的な調整レシピは、まさに検出とエージェント検索が依存するプロパティをトレードオフする可能性があります。

この論文が示している区別、つまりモデルの単一の最良の答えと、モデルが多数のサンプルにわたって生成できる範囲の広さの間の区別は、学術的なものではありません。価値の高い AI 作業の割合が増加しており、生成と検証のループで実行されます。つまり、多くの候補プログラムを提案してテスト スイートを実行し、多くの証明ステップを提案して機械的にチェックし、多くの仮説を提案してそれらをスクリーニングします。これらすべての設定において、検証者がどの候補が正しいかを決定するため、拘束制約は正しい候補が生成されたかどうかです。カバー範囲は上限であり、最初の試行の精度はその下に 1 ポイントしかありません。

そのため、診断はトレーニング後の主要なレシピにとって重要な結果となる可能性があります。報酬信号からの強化学習は、現在のほとんどのフロンティア モデルが事前トレーニング後に形成される方法であり、出力分布をシャープにすることが演習のポイントに近づいています。そのシャープ化により確実にカバレッジにコストがかかる場合、標準パイプラインは k=1 で測定されたベンチマーク スコアを最適化している一方で、モデルのデプロイが増加している領域では静かにパフォーマンスを低下させている可能性があります。 RL がモデルの多様性を狭めるという懸念は、以前の研究文献で提起されていました。ここで主張されている貢献は、新しい診断ではなく、具体的な代替案です。

提案された救済策には、よく知られている独自のトレードオフがあります。進化戦略は勾配を完全に回避し、これにより RL 微調整の不安定性の一部を回避しますが、歴史的にはサンプル効率によってその代償を払ってきました。ランダムな重みの摂動から有用な更新方向を推定するには、通常、母集団全体にわたる多くの順方向パスが必要となり、並列化はうまくいきますが、コンピューティングを消費します。その算術が現代の言語モデルのスケールで機能するかどうかは、まさに読者が答えを求めている質問であり、要約ではコストについてはまったく触れられていません。

一般の人々にとっても、実践者にとっても、今日は何も変わりません。これはトレーニング方法論に関する研究の主張であり、製品、モデルリリース、または安全性に関する知見ではありません。その実用的な重要性は、コミットではなく探索するように調整されたモデルを通じて、または最初の回答の精度と引き換えに広範さを犠牲にするノブを公開するプロバイダーを通じて、間接的にもたらされます。ソースには、展開されたシステムがこの方法を使用しているという証拠はなく、どのベンダーもそれを採用していると記載されていません。

プレプリント要約から結論できることの限界を述べるのも価値があります。 ES が pass@k で RL に勝つという主張は、著者ら自身の実験の報告であり、独立して確立された事実ではありません。最適化手法間の比較は、調整作業、計算予算、ベースラインの選択に影響されやすいことで知られており、1 つのモデル スケールまたは 1 つのベンチマーク ファミリに当てはまる結果が一般化しないことがよくあります。

Interactive Mechanism

インタラクティブなメカニズム: 実際にどのように機能するか

この開発の背後にある基盤となるテクノロジーをインタラクティブに探索します。

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
インタラクティブコンセプトチェック+10 Points
AI Training Quiz

In AI training, what is an "epoch"?

次に見るべきもの

負荷に耐える詳細は、要約ではなく完全な PDF にあります。どのモデルがトレーニングされたか、どのベンチマークが使用されたか、k の値は何か、そして重要なことに、ES と RL が一致したコンピューティングで比較されたかどうかなどです。また、コードが公開されるかどうか、結果が数学の範囲外で再現されるかどうか、フロンティアラボがその手法を採用するかどうかも注目に値します。

最初に確認する必要があるのは、論文全体の実験設定、特に ES と RL の実行が計算で一致しているかどうかです。 RL ベースラインよりも大幅に多くのトレーニング コンピューティングを消費する勾配のない手法は、著者らが提案するメカニズムとは関係のない理由でより良く見える可能性があります。読者は、トレーニングされたモデルのサイズ、比較として使用された RL アルゴリズム、世代ごとの摂動の数、および pass@k が測定された k の値を確認する必要があります。カバレッジ曲線はしばしば交差し、大きな k で勝てる手法は、k=1 では負ける可能性があります。

次に、範囲に注意してください。下流の利益に関する要約の具体的な主張は、安価な自動検証と事前の多大な最適化を伴う領域である「標準数学ベンチマーク」に限定されています。カバレッジの利点がコード生成、科学的仮説生成、またはオープンエンドのエージェント タスク (検証のノイズが多く正確性が二値的ではないタスク) に移るかどうかは、利用可能な資料によっては確立されていません。

3 番目に、アーティファクトとレプリケーションに注意してください。 arXiv のリストには、関連するコードやデータのリリースは示されていません。リリースされた実装、または作成者と関係のないグループによる複製は、これを主張から結果に移行します。それがなければ、適切な姿勢は自信ではなく関心であり、採用のシグナルには独自の数字が伴うはずです。

第 4 に、検証者の質問は、カバレッジの向上がどの程度の価値があるかを制限します。より高い pass@k は、多数の中から正しい候補を特定できる場合にのみ、有用な出力に変換します。数学とソフトウェアにはチェッカーが存在します。ほとんどの商用アプリケーションではそうではなく、より広範な選択肢から正しい答えを選択すること自体が未解決の問題になります。 ES でトレーニングされたモデルと選択メカニズムを組み合わせたフォローアップ作業は、自然な次のステップとなるでしょう。

最後に、出版トラックをご覧ください。この論文は v1 のプレプリントであり、開催地や審査状況は明記されていません。 RL トレーニング後の多様性に取り組んでいる他の研究者からの修正、会議への提出、または公開批評はすべて、中心的な主張をどれだけ真剣に受け止めるべきかを明確にするでしょう。

関連ガイドとクイズ

AIトレーニングAI モデルの説明AIの未来ChatGPTとLLMあなたが知っていることをテストする - 無料の AI クイズに挑戦してください用語集で AI 用語を検索する
これは役に立ちましたか?