返回新聞
安全性AI Understanding 簡報

論文警告LLM代理可以透過工具恢復已刪除的知識

一篇新的 arXiv 論文指出了 LLM 遺忘中的一個差距:代理可能會停止從其權重中回憶信息,但可以通過網絡搜索、檢索或數據庫工具恢復它。作者提出了兩階段方法來減少這兩種形式的恢復,同時保留合法的工具使用。

5 min readRead the primary source
Primary-source image accompanying Paper warns that LLM agents can recover deleted knowledge through tools
主要來源文件來源記錄
出版商
arxiv.org
來源連結
arxiv.orghttps://arxiv.org/abs/2608.21544
來源類型
主要文件-我們直接閱讀的官方公告、文件、文件或第一方頁面。
背景60 秒內了解這一點

從這裡開始

關鍵術語

大語言模型(LLM)
在海量文本語料庫上訓練來產生和分析文本的語言模型。
強化學習
透過獎勵訊號進行訓練,代理學習能夠最大化長期回報的行動。
記憶體(代理記憶體)
AI 代理程式跨步驟或會話使用儲存的上下文來提高連續性。
測試一下自己AI 代理測驗

發生了什麼事

arXiv 論文介紹了 Agentic Tool Unlearning,這是一個為可以調用外部工具的語言模型代理而設計的框架。作者認為,傳統的遺忘可能會抑制模型對資訊的直接回憶,但不會阻止智能體透過網路搜尋、檢索或資料庫查找來恢復相同的資訊。

該論文描述了一種稱為工具介導恢復的故障模式。在傳統的語言模型中,通常透過測試模型是否仍可從其參數中直接回憶起指定目標來評估遺忘。作者認為,對於一個代理人來說,這種評估是不完整的,因為代理人的答案可能取決於工具呼叫和外部觀察。這樣的代理可能無法從記憶中陳述目標,但可以透過外部來源檢索相同的資訊。這種差異很重要,因為即使模型的內部反應發生了變化,可觀察的答案仍然可用。在這種情況下,評估模型而不評估其行為可能會錯過恢復目標的路線。

所提出的方法,Agentic Tool Unlearning,有兩個階段。首先,系統應用參數化知識去學習,旨在抑制直接回憶。其次,它在模擬工具增強環境中使用軌跡級強化學習。根據論文摘要,此階段對目標搜尋工具的行為和最終答案的洩漏進行懲罰。目標是透過代理的行為來減少恢復,而不僅僅是透過改變模型權重。這使得智能體的決策序列成為遺忘問題的一部分,包括選擇尋求資訊以及將檢索到的材料納入回應的方式。

作者報告了跨不同語言模型架構的 RWKU 和 MUSE 遺忘基準的實驗。他們表示,該方法在忘記指定目標和保留應保持可用的知識的正常效用之間取得了更好的平衡。所提供的來源不提供數值結果、模型名稱、培訓成本、基線比較或模擬工具的詳細信息,因此無法僅從摘要中評估所報告改進的強度和範圍。這些遺漏使得結果最好被理解為具有報告實驗的研究提案,而不是作為該方法已在部署的系統中得到驗證的證據。

來源詳情: arxiv.org ↗

為什麼這很重要

該論文強調了將語言模型與外部工具結合的系統的實際安全和隱私問題。如果代理仍然可以透過周圍的工具定位或重建目標,那麼從模型參數中刪除知識可能還不夠。

這項發現很重要,因為工具的存取改變了人工智慧系統忘記某些東西的含義。模型可能不再直接編碼或複製一條訊息,但完整的代理仍然可以透過搜尋、檢索或查詢連接的資料庫來產生它。因此,對於處理個人、專有或其他受限資訊的系統,相關的評估單元可能是完整的代理工作流程,而不是孤立的模型。這種更廣泛的觀點遵循可以產生答案的整個路徑的信息,而不是將模型參數視為唯一可能的來源。

這種區別也影響組織如何解釋刪除或刪除聲明。如果請求旨在阻止代理程式產生特定目標,則單獨修改模型參數可能會留下替代路線。該論文並未證明目前任何部署的系統都會以這種方式失敗,但它提供了一個具體的評估框架,用於測試代理的工具是否破壞了遺忘過程。這個框架可以幫助將模型回憶的變化與組裝系統仍然可以獲得的變化區分開來。它還將刪除聲明的範圍與用戶實際觀察到的行為聯繫起來。

在所提出的目標中存在困難的工程權衡。代理通常需要使用工具來回答有關其應保留資訊的問題。懲罰太多的工具尋找可能會損害有用的行為,而懲罰太少可能會讓被遺忘的目標恢復。該論文聲稱的保留保留知識的目標使這種權衡變得明確,但來源沒有顯示該方法處理模糊請求、間接查詢或包含重疊資訊的工具的效果如何。因此,有用的方法必須限制不必要的路線,同時繼續支持保持合法的工具使用,這種平衡不能僅從抽像中推斷出來。

Interactive Mechanism

互動機制:它實際上是如何運作的

以互動方式探索這項發展背後的基礎技術。

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
互動式概念檢查+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

接下來看什麼

核心問題是所報告的方法是否具有超越論文模擬環境和基準的概括性。需要更多關於目標資訊、工具配置、模型架構、衡量權衡以及該方法是否可靠工作而不干擾合法工具使用的詳細資訊。

全文應該闡明什麼才算成功遺忘。重要的細節包括評估是否僅檢查精確的目標再現或釋義、間接答案和多步驟重建。它還應該表明該方法如何區分禁止的目標搜尋和相關保留知識的合法檢索,因為這種區別將決定該方法是否實用。評估設計與標題結果一樣重要:狹隘的測試可能會表明特定的反應被阻止,但不會表明無法通過其他路徑到達底層資訊。明確的定義將使所報告的遺忘和效用之間的平衡更容易解釋。

複製非常重要,因為報告的實驗使用 RWKU 和 MUSE 以及模擬工具來增強環境。讀者應該尋找不同工具類型、檢索系統、資料庫和模型系列的測試,以及在作者的培訓設定之外進行的評估。摘要沒有說明程式碼、環境或訓練模型是否可用,因此目前尚不清楚可重複性。獨立測試還有助於確定該方法是否取決於模擬工具公開資訊的特定方式,或者當周圍系統配置不同時其約束是否仍然有效。如果沒有這種比較,該方法的通用性仍然是一個懸而未決的問題。

未來的評估應該衡量較長代理軌蹟的安全性和實用性。在短期測試中阻止直接洩漏的系統在可以規劃、重試、呼叫多個工具或組合部分觀察結果時可能表現不同。該消息來源還沒有確定代理工具取消學習是否可以解決複製到工具索引或資料庫本身的信息,以及是否可以將其應用於已部署的代理而無需重新訓練其周圍系統。這些問題將模型級過程與可以進行恢復的更廣泛的環境聯繫起來。他們還指出了為什麼成功的演示需要檢查代理拒絕透露的內容以及它繼續檢索的有用資訊。

相關指引和測驗

人工智慧代理ChatGPT 與大型語言模型人工智慧模型解釋AI 倫理測試你所知道的—嘗試免費的人工智慧測驗在我們的詞彙表中尋找人工智慧術語關注AI監管追蹤器
覺得有用嗎?