返回新闻
安全AI Understanding 简报

研究发现多代理人工智能安全取决于来源,而不仅仅是规则

新的 POLIS 预印本报告称,当可执行的保护措施信任可变策略状态而不是创建它的机构时,可执行保护措施可能会失败,同时还说明了为什么恢复路径在块后很重要。

6 min readRead the primary source
主要来源文件来源记录
出版商
POLIS multi-agent AI safety paper on arXiv
来源链接
arxiv.orghttps://arxiv.org/abs/2608.09828
来源类型
主要文件——我们直接阅读的官方公告、文件、文件或第一方页面。
背景60 秒内了解这一点

从这里开始

关键术语

人工智能安全
该领域专注于减少人工智能系统中的有害行为、故障和误用风险。
基准测试
用于测量和比较模型性能的标准化测试或数据集。
特征
模型用来进行预测的输入变量。
测试一下自己人工智能安全测验

发生了什么

POLIS 研究计划的新 arXiv 预印本测试了一个随着人工智能代理代表组织委派任务、移动信息和调用工具而变得更加重要的问题:如果系统无法判断该规则背后的权威来自哪里,那么安全规则是否有效?在冻结的 5,280 集研究套件中,作者改变了治理规则、可执行守卫咨询的权威状态、内部后备的吸引力以及受阻的工作流程是否可以继续。结果是对受控多代理工作流程的研究,而不是已部署产品遭受事故的证据。

主要的委托实验涵盖四个模型系列,并通过有针对性的高冲突诊断添加了另外三个模型端点。代理在结构化环境中运行,其中确定性系统决定执行哪些操作以及结果状态是否违反策略。这种设计让研究人员能够将被禁止的提案与已实现的违规行为区分开来,然后将详细的宪法提示与在行动边界进行干预的可执行保护措施进行比较。

该报报道称,宪法提示在 384 次事件中实现了零违规,同时完成了 365 次合规事件。咨询可见本地策略状态的本地可执行守卫在相同规模的条件下产生了 22 次违规,即 5.7%。具有来源感知的可执行防护也产生了零已实现的违规行为,但它阻止了 51 次禁止的尝试;其中 44 集后来安全完成。这些数字描述了该实验的结构化条件,而不是语言模型的通用安全率。

最明显的差异出现在匹配的政策洗钱场景中。普通的转换改变了当地警卫可见的政策,同时保持原始权威不变。在这种情况下,地方国家警卫承认了 96 起事件中的 22 起违规行为,而出处执法部门却没有承认任何违规行为,论文报告 p = 4.77 × 10⁻⁷。该机制比代理可以绕过任何护栏的说法更狭窄:它证明了执行层信任的状态可以改变结果。

一项单独的资源分配实验发现,揭示其他方面相同的上限会改变代理请求的数值。作者用这个结果来论证最终的违规计数可以隐藏不同的机制:规则、权限记录、工作流程创建的激励以及干预后可用的路径都很重要。该论文长达 17 页,包含 5 个数字,其作者表示,代码和可重复性工件可在公共 POLIS 存储库中找到。

来源详情: POLIS multi-agent AI safety paper on arXiv ↗

为什么这很重要

该研究的实际信息是,代理系统的授权必须比规则的最新文本表示更持久。当代理可以转换数据、委派工作或跨越组织边界时,仅检查当前可见状态的警卫可能会丢失决定是否仍允许执行操作所需的历史记录。

这种区别对于处理文档、存储库、客户记录或共享工具的系统很重要。文件可以被复制、汇总、包装在另一个对象中,或者在代理之间传递,而其来源和限制保持不变。如果后面的组件仅信任可变标签,则其他普通转换可以使禁止的传输看起来是授权的。因此,出处不仅仅是一个审计功能;它也是一个功能。在纸张的洗钱情况下,它是执行决定的一部分。

对于产品和安全团队来说,这意味着架构要求:保留可检查的记录,记录谁或什么授予了权限、发生了哪些转换、应用了哪些策略以及委托是否更改了范围。这可以包括签名或仅附加出处、能力衰减、显式边界检查以及对高影响力操作的人工批准。该论文没有规定一种实现方式,但它给出了一个具体的理由来测试每个警卫是否咨询原始权威而不仅仅是最新的派生状态。

恢复结果同样重要。系统可以防止有害的执行,但如果不提供安全的下一步,仍然会使工作流程无法使用。在所报告的起源感知条件下,大多数被阻止的事件后来安全完成,这表明执行力和有用性应该一起衡量。评估应记录禁止的建议、受阻的操作、安全恢复、不完整的工作以及用户可见的摩擦,而不是将所有内容都压缩为单个拒绝或违规数字。

对于公众关于代理人安全的主张,还有一个衡量课程。作者保持模型、任务环境和行动空间足够结构化,以便直接比较治理条件。这使得该机制清晰易读,但也限制了关于开放式生产系统的推断。一个机构设计的基准分数不应单独作为模型的属性呈现,特别是当权限、工具、日志记录和恢复行为可以改变测量结果时。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
交互式概念检查+10 Points
AI Safety Quiz

What is 'specification gaming' in AI systems?

接下来看什么

下一个证据应该测试出处感知控制是否能够在更广泛的模型、更少的脚本任务、操纵权限状态的适应性尝试以及真正的部署约束下生存。预印本支持设计假设和可重复的评估方向;它并没有建立一个防护架构来解决多代理安全问题。

独立团体应使用已发布的工件重新运行 POLIS 套件,并报告每个模型系列的结果、治理条件和事件结果。有用的复制会改变宪法提示的措辞、转换的顺序、内部后备的成本以及执行层可用的信息。他们还应该公布失败和未遂事件,而不仅仅是最终实现的违规率。

部署者应该针对自己的数据流测试相同的原理。安全的练习可以通过摘要、提取、工具调用和跨代理委派来跟踪来自批准来源的文档,然后验证派生对象是否仍附加限制。测试应涵盖撤销、过期、权限冲突、重试、部分失败以及尝试在不更改其来源的情况下重新标记内容。日志需要使操作员能够理解决策路径。

未来的评估应该检查阻塞和完成之间的权衡。停止每个不明确请求的防护可能会通过拒绝有用的工作来产生零违规,而宽容的防护可能会以无声泄漏为代价来保持吞吐量。有用的衡量标准包括任务完成情况、提议阻塞率、已实现的危害、恢复时间、人工审核负载、误报以及在首选委派被拒绝时代理是否可以选择安全的内部路线。

最后,读者应该保持论文的边界清晰可见。它是一个新的、未经同行评审的预印本,基于结构化情节和选定的模型端点;它不报告现实世界的违规行为、独立审计或对商业代理平台的保证。最强有力的后续措施是将公共代码与预先注册的复制、类似生产的权限图、多语言和多模式输入以及旨在针对来源本身的对抗性测试相结合。

相关指南和测验

人工智能安全人工智能安全人工智能代理法学硕士评估测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语关注AI监管追踪器
觉得这有用吗?