发生了什么
研究人员 Oguz Serdar 和 Cuneyt Mertayak 发布了一份预印本,描述了 SteerBench-Work,这是工作场所人工智能代理的预提交“继续或保留”决策的基准。他们报告说,在 30 种模型条件中,模型错误地在 28.1% 的机会中进行了授权、证据明确的工作,并错误地允许了 1.0% 的机会进行不安全的工作。
两位研究人员 Oguz Serdar 和 Cuneyt Mertayak 于 2026 年 8 月 12 日在 arXiv 上发布了一份预印本,介绍了 SteerBench-Work,这是一个围绕长期运行的 AI 代理工作流程中的单个决策构建的基准:是采取行动还是保留该行动以供人工或政策审查。作者将此称为转向决策,并将其放置在他们所谓的操作边界处——即代理发送电子邮件、合并拉取请求或电汇付款之前的点。该基准不会对代理是否能够完成任务进行评分。它对智能体是否正确跨越或保持该边界进行评分。
摘要中描述的版本标记为 v2026-05,包含 106 个场景,涵盖开发人员运营、客户服务、财务、法律、医疗、人力资源和安全。这些场景以公共事件为基础。每一个都与作者所说的证据反转镜子(同一情况的一个版本,其中潜在的证据指向相反的方向)以及校准控制配对。标签在“继续”和“保持”之间几乎均匀地划分,作者说这是故意的:它给两个错误方向接近相同数量的发生机会,因此模型不能仅仅通过默认谨慎来获得良好的分数。在每个项目中,模型都会显示建议的操作和可用的证据,并返回门决策。
作者报告说,在 30 种模型条件下,故障几乎完全朝一个方向发生。模型错误地认为 28.1% 的机会是经过授权、证据明确的工作,而错误地允许 1.0% 的机会是不安全的工作。根据摘要,最难的类别是作者所说的风险解决提交:真正的风险触发器被触发但签名或结构化证据已经清除的情况,正确的答案是继续。著名事件及其镜像之间的表现也存在很大差异——事件本身的表现为 98.5%,而证据颠倒版本的表现为 63.8%。
作者进一步区分了一般能力和转向校准。他们写道,更高能力的模型通常会在提交边界处过度拒绝,而额外的推理可以修复弱门,同时留下已经校准的门。摘要指向公共排行榜,但源页面将地址呈现为占位符而不是工作链接。
这里提供的材料并不能确定一些事情。摘要没有命名所测试的模型,没有定义 30 个模型中什么算作独特的“模型条件”,也没有给出每个领域或每个模型的细分。它没有描述谁编写了真实标签或如何解决分歧,并且版本标签 v2026-05 没有针对 8 月提交日期进行解释。这是第一版预印本,没有同行评审的迹象,并且没有任何数据被独立复制。
为什么这很重要
大多数代理安全测试都会衡量模型是否阻止有害行为。这项工作测量了两个错误方向,发现主要的失败是过度阻塞,这会带来实际的运营成本,并可能迫使人们陷入橡皮图章。这些数字来自未经审查的预印本,并且未经独立验证。
人工智能代理越来越多地被部署来采取行动,而不仅仅是生成文本,而建议产生不可逆转影响的点正是风险实际发生的地方。大量已发表的代理安全工作都提出了一个问题:模型是否拒绝了有害的东西? ——而一个拒绝一切的系统在这个问题上得分完美,但毫无用处。通过平衡继续和保留标签并报告两种错误率,该基准衡量的是权衡而不是其中的一方面。
如果所报告的不对称现象普遍存在,那么企业代理部署中的实际问题可能更接近于过度阻塞,而不是失控行动。错误保留并不是免费的。每个人都将工作重新分配给一个人,这根本降低了任务自动化的效率,并且增加了诸如票证解决或代码审查等流程的延迟,而延迟本身就会产生成本。还有一个更微妙的风险:充满不必要升级的审核队列会训练审核人员快速批准,这削弱了保留机制所提供的人为监督。下游效应是从设置中合理推断的,而不是基准测量的东西。
著名事件的 98.5% 和证据反转镜子的 63.8% 之间的差距是最值得审视的结果。它与识别有据可查的失败的形状并对这种识别做出反应而不是阅读面前的证据的模型是一致的。如果这种解读成立,那么买家应该如何解释代理商安全评分就会变得复杂化:一个模型在类似于已发表的警示故事的场景中看起来很可靠,但当事实被重新排列时,对相同结构情况的处理却很糟糕。作者的“风险解决的提交”类别正是测试了这一点——存在清除触发风险的证据,并且模型必须实际处理它。
研究结果还与人机交互需求的编写方式有关。强制审查行动类别的政策假设门是安全的默认设置。这项工作表明,门在阻止清除工作的方向上有自己的错误率,并且应该测量该错误率,而不是假设其接近于零。
权衡所有这些:基准测试评估的是给定精心策划的证据包的单个预提交判断,而不是运行真实工具循环的代理,其必须自行收集不完整的信息。实际部署还位于场景无法完全代表的权限系统和组织上下文背后。无论 106 个构建的场景如何精心锚定,是否可以预测生产中的行为仍然是一个悬而未决的问题,这里的主张是作者自己的。
Interactive Mechanism: How It Actually Works
Explore the underlying technology behind this development interactively.
What is the most accurate way to describe what AI Agents can do today?
接下来看什么
完整的论文、数据集和排行榜是否可以识别测试的模型;独立团体是否会重现过度拒绝的差距;证据反转镜像结果是否可以作为模式匹配的标志;以及买家和监管机构是否开始将错误持有视为一种有节制的失败,而不是安全的违约。
最直接的事情就是披露。完整的论文、任何发布的数据集或代码以及摘要参考的排行榜将显示测试了哪些模型、30 个条件是如何组成的以及 28.1% 的数字如何在模型和领域之间分布。涵盖 30 种条件的总数可能会掩盖很大的变化,对于任何选择模型的人来说,实际问题是哪些系统位于该范围的哪一端。
独立复制比标题数字更重要。留意运行场景的其他小组,对最难的“风险解决提交”案例的真实标签的审查,以及事件与镜像之间的差距是否能够经受住没有构建基准的人的测试。这一差距是该论文最重要的主张,也是最依赖于镜子的构造方式的一个主张。
另外值得跟踪的是单步分帧是否转移。要求通过提供的证据来控制一项拟议行动的模型与任务中期的代理处于不同的位置,后者必须决定在提交之前收集哪些证据。将相同场景放入完整代理循环中的后续工作将测试此处测量的校准是否可以预测真实行为。
在采用方面,问题是错误保留率是否与拒绝率一起进入采购和系统卡,以及模型开发人员是否开始在操作边界处进行校准调整,而不是仅仅出于谨慎。作者声称,增加推理有助于弱门,但对已经校准的门没有帮助,如果得到证实,将推翻更多推理时间计算可靠地提高安全相关判断的假设。
最后,观看版本控制。标记为 v2026-05 并以公共事件为基础的基准测试面临着污染问题,因为它的场景正在传播,未来的模型也将以此为基础进行训练。作者如何更新这个集合——以及镜像性能是通过真正的推理增益还是通过暴露而提高——将决定这些数字在多长时间内具有今天的意义。