返回新闻
创新AI Understanding 简报

架构感知学分分配改进了语言模型的强化学习

arXiv 预印本介绍了 CompPO,这是一种强化学习方法,它使用语言模型自己的注意力模式来跨令牌分配训练学分。作者报告称,在 Qwen3-4B 和 Llama-3.1-8B-Instruct 上的实验中,比调整后的 GRPO 具有更高的保留精度和更高的稳定性。

6 min readRead the primary source
Source-page capture accompanying Architecture-aware credit assignment improves reinforcement learning for language models
主要来源文件来源记录
出版商
arxiv.org
来源链接
arxiv.orghttps://arxiv.org/abs/2608.21501
来源类型
主要文件——我们直接阅读的官方公告、文件、文件或第一方页面。
背景60 秒内了解这一点

从这里开始

关键术语

强化学习
通过奖励信号进行训练,代理学习能够最大化长期回报的行动。
大语言模型(LLM)
在海量文本语料库上训练来生成和分析文本的语言模型。
内存(代理内存)
AI 代理跨步骤或会话使用存储的上下文来提高连续性。
测试一下自己AI 模型解释测验

发生了什么

研究人员引入了计算条件信用传输,这是一种根据语言模型在响应期间执行的计算将强化学习信用分配给各个标记的方法。他们的实现 CompPO 使用注意力集中来创建每个令牌保留门,并将其与重用参与者隐藏状态和路由信息的批评家相结合。

8 月 21 日提交给 arXiv 的预印本提出了一种在大型语言模型强化学习期间分配学分的新方法。该论文将信用分配分为三个部分:有关首次推出是否成功的证据、将该证据转化为代币级优势的运输运营商以及将这些优势转化为政策变化的更新几何结构。作者认为,最近的工作改进了第一部分和第三部分,而常用的传输规则在很大程度上仍然独立于模型架构。

所提出的框架称为计算条件信用传输,它使用与行为策略内部计算无关的统计数据来参数化下游价值如何通过部署进行传输。具体算法 CompPO 将本机注意力集中度转换为每个标记的有界保留门。该门既可用于单步引导,也可用于称为 Comp-GAE 的路径相关广义优势跟踪。作者指出,恒定门将方法简化为固定系数广义优势估计,提供了与标准基线的链接。

CompPO 还包括一个与运输相关的批评家 (TAC)。 TAC 没有添加第二个相同规模的 Transformer,而是重用了 actor 的隐藏状态和路由信息。论文称,任务奖励和削减后的 PPO 政策目标保持不变;所谓的改变是信用的传输方式以及批评者如何与这种传输保持一致。在使用 5 个 Qwen3-4B 种子的实验中,作者报告了 61.4% 的最终保留准确度,95% 置信区间为 60.8% 至 62.0%,而调整后的 GRPO 的最终保留准确度为 53.8%,置信区间为 52.9% 至 54.7%。

论文的消融结果将结果归因于组件的组合。 Comp-GAE与标准批评家配对达到55.2%,而TAC与固定门配对达到56.4%;两者都不匹配完整的系统。作者报告交互效应为 2.4 点,95% 置信区间为 1.9 至 2.9 点。据报道,随机播放和位置控制支持特定轨迹的对齐。 CompPO 在 12 次 PPO 网格运行中的 10 次中保持稳定,而对比设置中的 12 次中有 3 次保持稳定。在冻结评估中,作者报告在 Qwen3-4B 和 Llama-3.1-8B-Instruct 上分别比 GRPO 提高了 4.3 和 3.9 贪婪 pass@1 宏点。

来源详情: arxiv.org ↗

为什么这很重要

结果解决了大型语言模型强化学习的一个实际瓶颈:决定长响应的哪些部分应该对最终结果表示赞扬或指责。作者报告了经过调整的 GRPO 的改进,但证据来自预印本和一组有限的实验,因此该方法的通用性和运营成本仍然不确定。

语言模型的强化学习必须将最终奖励与许多单独的标记和中间决策联系起来。响应可以包含有用和无用的步骤,但在整个响应中广播相同结果统计数据的方法可能会提供较弱的指导。该论文的核心主张是,模型自身的计算可以提供更具体的信号,用于决定信用从一个代币到下一个代币的持续强度。

如果报告的效果在更广泛的环境中成立,架构感知的信用传输可以使强化学习更新更有针对性,而不需要不同的奖励定义或政策目标。这很重要,因为学分分配的变化可能会被纳入现有的 PPO 式培训渠道中。所报告的与 GRPO 的比较与当前的 LLM 强化学习实践特别相关,因为它将所提出的方法视为对训练信号的更改,而不是新的模型系列或面向用户的产品。

所报告的消融是有用的,因为它们表明结果不能仅由注意力衍生门或重用批评家来解释。在所提供的结果中,完整方法的表现优于两种部分变体,作者表示,随机播放和位置控制支持了轨迹特定对齐很重要的观点。稳定性比较还指出了可能的实际好处:更少的不稳定运行可以减少浪费的训练尝试,尽管来源不提供计算或成本测量。

这些证据仍应被视为早期研究结果。来源是 arXiv 预印本,而不是同行评审的出版物,摘要未描述超出报告置信区间的基础任务、数据集大小、基线实施细节、培训预算或统计程序。它还没有确定收益是否会带来额外的内存、延迟、工程复杂性或对注意力模式的敏感性。因此,该方法的公共影响取决于独立研究人员是否可以重现结果,以及该方法是否可以转移到更大的模型和不同的强化学习目标。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
交互式概念检查+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

接下来看什么

接下来的重要测试是独立复制、更广泛的模型和任务覆盖范围以及包括训练成本、内存使用和运行时间的比较。该消息来源并未确定 CompPO 是否能够在所报告的 Qwen3-4B 和 Llama-3.1-8B-Instruct 评估之外可靠地工作,或者其基于注意力的信号在不同的模型架构中是否仍然有用。

首要任务是复制五个 Qwen3-4B 种子和报告的冻结评估之外的内容。独立小组应该在更多的模型大小、训练任务、奖励结构和语言模型架构上测试该方法。来源名称为 Qwen3-4B 和 Llama-3.1-8B-Instruct,但没有说明该方法是否在更广泛的模型中进行了评估,或者注意信号在具有不同路由或注意设计的架构中是否表现相似。

研究人员还应该衡量完整的训练权衡。该论文称,TAC 重用了 Actor 隐藏状态和路由信息,而无需使用第二个相同规模的 Transformer,但该来源没有量化内存消耗、挂钟训练时间、硬件要求或总计算量。这些测量将确定所报告的准确性和稳定性增益对于已经运行昂贵的强化学习管道的组织是否实用。

进一步的工作应该检查注意力衍生的保留门的稳健性。报告的洗牌和位置控制支持实验中特定于轨迹的对齐,但来源没有显示门如何响应长上下文、不寻常的推理轨迹、稀疏或嘈杂的奖励或提示和采样的变化。目前还不清楚注意力集中是否是计算重要性的可靠代表,或者仅仅是测试的特定模型和任务的有用信号。

最后,该方法作为预印本的地位很重要。来源不报告独立验证、生产部署、代码可用性或同行评审结果。这些遗漏并不会使研究结果无效,但它们留下了关于可重复性和概括性的重要问题。更强有力的案例需要发布实施细节、匹配成本基线、其他架构的结果,以及在作者的评估设置之外仍然存在改进的证据。

相关指南和测验

人工智能模型解释人工智能培训变形金刚AI 的未来测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语关注 AI 模型发布跟踪器
觉得这有用吗?