返回新闻
创新AI Understanding 简报

论文认为进化策略在保持 LLM 答案集多样化方面击败了 RL

arXiv 的一份新预印本认为,采用进化策略(一种基于群体、直接扰动权重的无梯度方法)的法学硕士在训练后在 pass@k 和解决方案覆盖率上击败了强化学习。摘要引用了更好的数学基准结果,但没有提及模型、基准或数字。

7 min readRead the primary source
Source-page capture accompanying Paper Argues Evolution Strategies Beat RL at Keeping LLM Answer Sets Diverse
主要来源文件来源记录
出版商
arxiv.org
来源链接
arxiv.orghttps://arxiv.org/abs/2608.12679
来源类型
主要文件——我们直接阅读的官方公告、文件、文件或第一方页面。
背景60 秒内了解这一点

从这里开始

关键术语

大语言模型(LLM)
在海量文本语料库上训练来生成和分析文本的语言模型。
人工智能(AI)
构建执行需要模式识别、推理、语言或决策的任务的系统的广泛领域。
强化学习
通过奖励信号进行训练,代理学习能够最大化长期回报的行动。
测试一下自己人工智能培训测验

发生了什么

七位研究人员在 arXiv 上发布了一篇预印本,认为训练后的强化学习会破坏语言模型答案的多样性,而进化策略(通过随机扰动直接在权重空间中进行优化)可以保留多样性并提高 pass@k。该论文于2026年8月13日提交,尚未经过同行评审。公开可见的摘要不包含基准名称、模型尺寸或测量数据。

题为“超越最佳猜测:通过进化策略提高 LLM 解决方案覆盖率”的预印本已于 2026 年 8 月 13 日提交给 arXiv,并在人工智能 (cs.AI) 下进行编目,并在神经和进化计算 (cs.NE) 下进行二级列出。它归功于七位作者:Conor F. Hayes、Elliot Meyerson、Kajetan Schweighofer、Roberto Dailey、Babak Hodjat、Risto Miikkulainen 和 Xin Qiu。 arXiv 记录没有列出机构隶属关系,本报告也没有将这项工作归属于任何组织。

本文的框架从语言模型通常如何在数学和科学等发现环境中使用开始:提出一个问题,并将模型的单一答案作为建议的解决方案。作者认为,这种“最佳猜测”模式留下了价值,因为额外的测试时间计算可以用于生成许多候选解决方案,而不是一个。该机制通常用 pass@k 来衡量,如果 k 次采样尝试中至少有一次正确,则该指标将问题视为已解决。

核心主张是对当前实践中副作用的诊断。作者写道,通过强化学习对模型进行后训练,会缩小模型围绕高奖励输出的输出分布,而这种缩小会导致解决方案覆盖范围崩溃。换句话说,强化学习可以使第一个答案更好,同时使不同答案的集合更小,这特别惩罚了作者关心的 pass@k 制度。

作为替代方案,本文提出了进化策略:一种基于群体、无梯度的后训练方法,通过对模型参数应用随机扰动并选择结果来直接在权重空间中进行优化,而不是反向传播奖励信号。摘要指出,ES 始终比 RL 获得更高的 pass@k,产生更广泛的输出分布和更大的解决方案覆盖范围,而这种覆盖范围反过来又转化为标准数学基准上更好的结果。

摘要没有提供大部分证据。它没有指定模型系列或参数计数,没有具体的基准,没有 k 值,没有基线 RL 算法,也没有数值结果——“始终更高”和“更好的结果”是唯一提供的描述。提交的内容为 449 KB,全文以 PDF 和实验性 HTML 形式提供,因此这些详细信息很可能包含在论文中;他们根本没有出现在此处评估的记录中。它是第一版预印本,没有同行评审的迹象,没有可见的代码或数据链接,也没有独立的复制。

来源详情: arxiv.org

为什么这很重要

在可以检查候选答案的领域(证明、代码、科学假设),有用的上限不是模型的第一个猜测是否正确,而是正确的答案是否出现在一批尝试中的任何地方。如果 RL 训练后系统地缩小该池,那么该行业占主导地位的对齐方法可能会恰好牺牲发现和代理搜索所依赖的属性。

这篇论文所得出的区别——模型的最佳单一答案和它可以在许多样本中产生的广度之间的区别——并​​不是学术性的。越来越多的高价值人工智能工作在“生成然后验证”循环中运行:提出许多候选程序并运行测试套件,提出许多证明步骤并机械检查它们,提出许多假设并筛选它们。在所有这些设置中,验证者决定哪个候选者是正确的,因此绑定约束是是否生成了正确的候选者。覆盖范围是上限,第一次尝试的准确度仅比上限低一点。

这使得诊断对于主要的训练后配方可能产生重要影响。从奖励信号中进行强化学习是大多数当前前沿模型在预训练后形成的方式,并且锐化输出分布接近练习的重点。如果这种锐化确实会影响覆盖范围,那么标准管道可能会针对 k=1 时测量的基准分数进行优化,同时在模型越来越多地部署的情况下悄悄降低性能。之前的研究文献中已经提出过关于强化学习缩小模型多样性的担忧;这里声称的贡献是一个具体的替代方案,而不是一个新的诊断。

所提议的补救措施也有其众所周知的权衡。进化策略完全避免了梯度,这避免了强化学习微调的一些不稳定性,但它们在历史上以样本效率为代价:从随机权重扰动估计有用的更新方向通常需要在群体中进行多次前向传递,这可以很好地并行化,但会消耗计算量。该算术是否适用于现代语言模型的规模正是读者想要回答的问题,而摘要根本没有解决成本问题。

对于公众和从业者来说,今天没有任何改变。这是关于训练方法的研究声明,而不是产品、模型发布或安全发现。它的实际意义将是间接的——通过调整模型来探索而不是承诺,或者通过提供者公开以第一答案的准确性换取广度的旋钮。来源中没有证据表明任何已部署的系统都使用此方法,并且没有供应商被描述为采用它。

还值得说明的是从预印本摘要中可以得出的结论的局限性。 ES 在 pass@k 上击败 RL 的说法是作者对自己实验的报告,而不是独立确定的事实。众所周知,优化方法之间的比较对调优工作、计算预算和基线选择非常敏感,并且适用于一种模型规模或一种基准系列的结果通常不能概括。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
交互式概念检查+10 Points
AI Training Quiz

Which question best defines a clear goal for using AI Training?

接下来看什么

承载细节位于完整的 PDF 中,而不是摘要中:训练了哪些模型、使用了哪些基准、k 值是多少,以及最重要的是 ES 和 RL 是否在匹配计算时进行了比较。同样值得关注的是代码是否发布、结果是否在数学之外再现、以及是否有前沿实验室采用该方法。

首先要检查的是整篇论文的实验设置,特别是 ES 和 RL 运行是否计算匹配。由于与作者提出的机制无关的原因,比 RL 基线消耗更多训练计算量的无梯度方法看起来更好。读者应该寻找训练的模型大小、用作比较的 RL 算法、每代扰动的数量以及测量 pass@k 时的 k 值——覆盖曲线经常交叉,在 k=1 时获胜的方法可能会在 k=1 时失败。

其次,注意范围。摘要关于下游收益的具体主张仅限于“标准数学基准”,这是一个具有廉价自动验证和大量事先优化的领域。覆盖范围优势是否转移到代码生成、科学假设生成或开放式代理任务(其中验证更加嘈杂且正确性不是二元的)尚不清楚。

第三,注意文物和复制。 arXiv 列表显示没有相关代码或数据发布。发布的实现或由与作者无关的团体进行的复制,会将其从声明转变为结果。如果没有这一点,适当的态度就是兴趣而不是信心,任何采用信号都应该有自己的数字。

第四,验证者问题限制了覆盖范围增益的价值。仅当某些东西可以从众多候选者中识别出正确的候选者时,较高的 pass@k 才会转换为有用的输出。在数学和软件领域,跳棋是存在的。在大多数商业应用中,它们并不这样做,并且从更广泛的池中选择正确的答案本身就成为未解决的问题。将 ES 训练的模型与选择机制配对的后续工作将是自然的下一步。

最后,观看发布轨迹。该论文是 v1 预印本,没有指定地点或审阅状态。其他研究 RL 训练后多样性的研究人员的修改、会议提交或公开批评都将强化中心主张的严肃性。

相关指南和测验

人工智能培训人工智能模型解释AI 的未来ChatGPT 与大语言模型测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语
觉得这有用吗?