返回新闻
安全AI Understanding 简报

论文警告LLM代理可以通过工具恢复已删除的知识

一篇新的 arXiv 论文指出了 LLM 遗忘中的一个差距:代理可能会停止从其权重中回忆信息,但可以通过网络搜索、检索或数据库工具恢复它。作者提出了一种两阶段方法来减少这两种形式的恢复,同时保留合法的工具使用。

5 min readRead the primary source
Primary-source image accompanying Paper warns that LLM agents can recover deleted knowledge through tools
主要来源文件来源记录
出版商
arxiv.org
来源链接
arxiv.orghttps://arxiv.org/abs/2608.21544
来源类型
主要文件——我们直接阅读的官方公告、文件、文件或第一方页面。
背景60 秒内了解这一点

从这里开始

关键术语

大语言模型(LLM)
在海量文本语料库上训练来生成和分析文本的语言模型。
强化学习
通过奖励信号进行训练,代理学习能够最大化长期回报的行动。
内存(代理内存)
AI 代理跨步骤或会话使用存储的上下文来提高连续性。
测试一下自己AI 代理测验

发生了什么

arXiv 论文介绍了 Agentic Tool Unlearning,这是一个为可以调用外部工具的语言模型代理而设计的框架。作者认为,传统的遗忘可能会抑制模型对信息的直接回忆,但不会阻止智能体通过网络搜索、检索或数据库查找来恢复相同的信息。

该论文描述了一种称为工具介导恢复的故障模式。在传统的语言模型中,通常通过测试模型是否仍然可以从其参数中直接回忆起指定目标来评估遗忘。作者认为,对于一个代理来说,这种评估是不完整的,因为代理的答案可能取决于工具调用和外部观察。这样的代理可能无法从记忆中陈述目标,但可以通过外部源检索相同的信息。这种区别很重要,因为即使模型的内部响应发生了变化,可观察的答案仍然可用。在这种情况下,评估模型而不评估其行为可能会错过恢复目标的路线。

所提出的方法,Agentic Tool Unlearning,有两个阶段。首先,系统应用参数化知识去学习,旨在抑制直接回忆。其次,它在模拟工具增强环境中使用轨迹级强化学习。根据论文摘要,此阶段对目标搜索工具的行为和最终答案的泄漏进行惩罚。目标是通过代理的行为来减少恢复,而不仅仅是通过改变模型权重。这使得智能体的决策序列成为遗忘问题的一部分,包括选择寻求信息以及将检索到的材料纳入响应的方式。

作者报告了跨不同语言模型架构的 RWKU 和 MUSE 遗忘基准的实验。他们表示,该方法在忘记指定目标和保留应保持可用的知识的正常效用之间取得了更好的平衡。所提供的来源不提供数值结果、模型名称、培训成本、基线比较或模拟工具的详细信息,因此无法仅从摘要中评估所报告改进的强度和范围。这些遗漏使得结果最好被理解为带有报告实验的研究提案,而不是作为该方法已在部署的系统中得到验证的证据。

来源详情: arxiv.org ↗

为什么这很重要

该论文强调了将语言模型与外部工具相结合的系统的实际安全和隐私问题。如果代理仍然可以通过其周围的工具定位或重建目标,那么从模型参数中删除知识可能还不够。

这一发现很重要,因为工具的访问改变了人工智能系统忘记某些东西的含义。模型可能不再直接编码或复制一条信息,但完整的代理仍然可以通过搜索、检索或查询连接的数据库来生成它。因此,对于处理个人、专有或其他受限信息的系统,相关的评估单元可能是完整的代理工作流程,而不是孤立的模型。这种更广泛的观点遵循可以产生答案的整个路径的信息,而不是将模型参数视为唯一可能的来源。

这种区别还影响组织如何解释删除或删除声明。如果请求旨在阻止代理生成特定目标,则单独修改模型参数可能会留下替代路线。该论文并未证明目前任何部署的系统都会以这种方式失败,但它提供了一个具体的评估框架,用于测试代理的工具是否破坏了遗忘过程。该框架可以帮助将模型回忆的变化与组装系统仍然可以获得的变化区分开来。它还将删除声明的范围与用户实际观察到的行为联系起来。

在所提出的目标中存在困难的工程权衡。代理通常需要使用工具来回答有关其应保留信息的问题。惩罚太多的工具寻找可能会损害有用的行为,而惩罚太少可能会让被遗忘的目标恢复。该论文声称的保留保留知识的目标使这种权衡变​​得明确,但来源没有显示该方法处理模糊请求、间接查询或包含重叠信息的工具的效果如何。因此,有用的方法必须限制不需要的路线,同时继续支持保持合法的工具使用,这种平衡不能仅从抽象中推断出来。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
交互式概念检查+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

接下来看什么

核心问题是所报告的方法是否具有超出论文模拟环境和基准的概括性。需要更多关于目标信息、工具配置、模型架构、衡量权衡以及该方法是否可靠工作而不干扰合法工具使用的详细信息。

全文应该阐明什么才算成功遗忘。重要的细节包括评估是否仅检查精确的目标再现或释义、间接答案和多步骤重建。它还应该表明该方法如何区分禁止的目标搜寻和相关保留知识的合法检索,因为这种区别将决定该方法是否实用。评估设计与标题结果一样重要:狭隘的测试可能会表明特定的响应被阻止,但不会表明无法通过其他路径到达底层信息。明确的定义将使所报告的遗忘和效用之间的平衡更容易解释。

复制非常重要,因为报告的实验使用 RWKU 和 MUSE 以及模拟工具增强环境。读者应该寻找不同工具类型、检索系统、数据库和模型系列的测试,以及在作者的培训设置之外进行的评估。摘要没有说明代码、环境或训练模型是否可用,因此目前尚不清楚可重复性。独立测试还有助于确定该方法是否取决于模拟工具公开信息的特定方式,或者当周围系统配置不同时其约束是否仍然有效。如果没有这种比较,该方法的通用性仍然是一个悬而未决的问题。

未来的评估应该衡量较长代理轨迹的安全性和实用性。在短期测试中阻止直接泄漏的系统在可以计划、重试、调用多个工具或组合部分观察结果时可能表现不同。该消息来源还没有确定代理工具取消学习是否可以解决复制到工具索引或数据库本身的信息,以及是否可以将其应用于已部署的代理而无需重新训练其周围系统。这些问题将模型级过程与可以进行恢复的更广泛的环境联系起来。他们还指出了为什么成功的演示需要检查代理拒绝透露的内容以及它继续检索的有用信息。

相关指南和测验

人工智能代理ChatGPT 与大语言模型人工智能模型解释AI 伦理测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语关注AI监管追踪器
觉得这有用吗?