返回新闻
安全AI Understanding 简报

研究发现人工智能安全基准可以使用更少的测试

英国人工智能安全研究所附属的预印本重现了几项安全基准结果,提示次数减少了 97-99%,同时警告说,较短的测试并不能证明现实世界的安全性。

5 min readRead the primary source
主要来源文件来源记录
出版商
Rivera and colleagues' research paper on arXiv
来源链接
arxiv.orghttps://arxiv.org/abs/2608.05086
来源类型
主要文件——我们直接阅读的官方公告、文件、文件或第一方页面。
背景60 秒内了解这一点

从这里开始

关键术语

人工智能安全
该领域专注于减少人工智能系统中的有害行为、故障和误用风险。
API(应用程序编程接口)
一种软件系统向另一个系统发送请求并接收响应的结构化方式。
系统提示
为模型设置行为、策略和响应方式的高优先级指令。
测试一下自己什么是人工智能?测验

发生了什么

8 月 5 日发布的一篇研究论文应用了教育测试的方法来衡量人工智能安全基准捕获的内容,选择较小的有用提示集,并审核模型行为的变化。

两名独立研究人员和两名隶属于英国人工智能安全研究所的研究人员根据八个基准评估了 192 个聊天模型,涵盖有害请求拒绝、过度拒绝良性请求、情境伤害和真实性。全套包含预处理前的 5,255 个提示;在删除未评分的答案和无法区分测试模型的项目后,该分析保留了 5,067 个。

该团队将模型视为考生,将基准提示视为测试项目,使用项目响应理论来估计哪些提示较困难以及哪些模型最好分开。在其主要因素分析中,三因素解决方案(概括为拒绝严格性、真实性和情境伤害)解释了模型能力 77% 的变异,而单因素只能解释 47%。

在 20 项保留评估中,三项固定的 25 项提示测试使用不到 2% 的套件恢复了这三个因素。对于 HarmBench、SORRY-Bench 和 OR-Bench-Hard,大约 10 个自适应选择的提示再现了全基准排名,相关性为 0.92 至 0.94,并将提示数量减少了 97-99%;随着测试预算的增加,优势逐渐缩小。

压缩不仅仅是随机采样。项目反应理论估计每个提示的难度以及它如何区分具有不同反应模式的模型,然后选择保留较大测试结构的项目。作者将固定简短形式与自适应选择进行了比较,并进行了评估,而不是仅测量用于选择提示的数据。该设计支持更狭隘的主张,即可以有效地复制一些现有的基准排名;它并没有表明 10 或 25 项测试可以发现全新的故障模式。

来源详情: Rivera and colleagues' research paper on arXiv ↗

为什么这很重要

该研究表明,更好地选择提示可以使频繁的人工智能安全检查更加便宜,而无需假装每个基准测试都衡量一个通用的安全分数。

更便宜的测试可以让开发人员、小型实验室和独立评估人员在训练、微调、量化和系统提示更改期间检查更多模型版本。结果是有效地再现现有的基准测试结果,而不是扩展这些基准测试可以检测到的内容。

因子分析还揭示了评分权衡。奖励拒绝的基准可以相互重叠,而避免不必要的拒绝的基准则奖励相反的行为。在不解释权重的情况下对它们进行平均可以隐藏模型是否变得更安全,只是更具限制性,还是对良性请求不太有用。

该论文还测试了对故意促使沙袋行为的黑盒审计方法。响应模式检查发现了选择性表现不佳的情况,但漏掉了大多数普遍表现不佳的情况;添加历史能力检查将模拟案例中的组合检测率提高到 94-97%。这支持分层审核,而不是依赖单一分数。

对于开发者来说,运营价值就是频率。在系统提示更改、量化通过、微调、工具更新或安全策略修订后,可以重新运行较短的评估,而无需每次都消耗完整基准测试的预算。但只有当团队保留原始套件作为定期审核、轮换保留的提示并调查令人惊讶的变化而不是直接针对压缩测试进行优化时,结果才有用。否则廉价的支票可能会成为过度拟合的另一个目标。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
交互式概念检查+10 Points
What is AI? Quiz

Which description best fits "narrow AI", the kind of AI in use today?

接下来看什么

关注独立复制、对未来模型系列的验证,以及缩短测试预测其设计重现基准之外的行为的证据。

这是一个新的预印本,而不是完整的同行评审结论。潜在结构分析使用了 134 个模型,作者指出,按照传统的心理测量标准来看,这些模型很小,而另一种提取方法保留了两个因素而不是三个因素。因素名称是经验总结,而不是经过验证的安全性定义。

每个模型通过 OpenRouter 为每个可用提示生成一个响应,并且每个基准测试都使用其规定的自动判断。由此产生的简短测试可能会继承原始提示、评分规则、语言覆盖范围和评委方面的缺陷;作者明确表示,压缩并不表明基准可以预测部署安全性或为未来模型提供信息。

使用的沙袋测试促进了模型生物,而不是经过微调以逃避评估的模型,这可能更容易被发现。 API 检查建立了行为连续性,而不是隐藏模型权重的身份,并且该研究没有测试经过专门训练来击败审计方法的对手。

本文最重要的边界是测量效率和安全保证之间。简短的形式可以估计原始基准中存在的潜在因素,但它继承了基准的语言、判断、提示框架和盲点。未来的评估应该测试多语言提示、支持工具的代理、长时间对话、对抗性微调模型和独立的人类判断。他们还应该报告压缩分数何时变得不稳定,因为保留数据的清晰相关性可以掩盖下一个模型系列的失败。

实际采用规则遵循这些限制:使用压缩测试作为哨兵,而不是判决。团队可以经常运行它们来捕获回归,然后在简短形式出现意外变化时将更改升级为完整基准和人工审核。该研究本身的证据支持分层工作流程,因为因素结构是从特定的提示、判断和模型输出中得出的。发布选定的项目、选择代码、保留的结果和版本历史记录将使独立评估者检查简短的测试在开发人员看到它们后以及在新模型系列更改响应分布后是否仍然提供信息。

当模型更新时,同样的透明度也很重要。在一代上校准的简短测试可能会变得太简单、太狭窄或意外地与新的系统提示对齐。团队应该保留以前的版本,披露项目或判断何时发生变化,并报告置信区间,而不是提供压缩排名作为精确的安全分数。这些做法将论文的效率结果转变为可审计的监控计划,同时保留原始基准以供更深入的审查。

相关指南和测验

什么是人工智能?ChatGPT 与大语言模型AI 伦理测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语关注AI监管追踪器
觉得这有用吗?