返回新聞
安全性AI Understanding 簡報

預印本報告語言模型輸出可能會洩漏上下文中的秘密

arXiv 預印本報告稱,即使在拒絕直接提取請求之後,語言模型也可能洩露上下文中的敏感資料。作者表示,在受控實驗中,自適應攻擊從普通輸出中恢復了簡短的秘密,並從生產式代理中提取了完整的社會安全號碼。

6 min readRead the primary source
Source-provided image accompanying Preprint reports language-model outputs can leak secrets held in context
主要來源文件來源記錄
出版商
arxiv.org
來源連結
arxiv.orghttps://arxiv.org/abs/2608.19857
來源類型
主要文件-我們直接閱讀的官方公告、文件、文件或第一方頁面。
背景60 秒內了解這一點

從這裡開始

關鍵術語

上下文視窗
語言模型一次可以處理的輸入標記的最大數量。
微調
對特定領域的資料進行持續訓練,以使預先訓練的模型適應特定任務。
縮放定律
一種經驗關係,顯示效能如何隨模型大小、資料或計算而提高。
測試一下自己AI 模型解釋測驗

發生了什麼事

一組研究人員報告說,語言模型上下文中的敏感資訊可以在其他良性回應中創建隱藏的相關性。作者表示,在涉及八個專有模型的受控實驗中,兩位數的秘密以近乎完美的精度重建,而四位數的秘密在對普通非對抗性請求的回應中實現了 82% 的精確匹配率。該論文還描述了推斷有關用戶記憶的語義事實並從生產式代理中提取完整社會安全號碼的攻擊。

主要來源是 2026 年 8 月 20 日提交的第一版論文的 arXiv 摘要。作者 Jaiden Fairoze、Neal Mangaokar、Kamalika Chaudhuri、Sanjam Garg 和 Saeed Mahloujifar 研究語言模型系統中的一個特定問題:簡單地將敏感的用戶上下文放入模型的上下文視窗中是否會改變以後的良性輸出。摘要將日曆、憑證、健康記錄和財務數據作為人工智慧代理可能持有的上下文的範例。它表示,即使模型正確拒絕提取秘密的直接請求,它也可能洩漏資訊。消息來源證實研究人員提出了這些主張並描述了報告的實驗;它沒有在此處提供的材料中提供獨立的證實。

報告的測量涉及上下文中嵌入的短秘密。根據摘要,作者表示,在八個專有模型中,兩位數的上下文秘密以近乎完美的精度被重建,四位數的秘密則以 82% 的精確匹配率從對普通非對抗性請求的回應中恢復出來。根據摘要,重要的細節是,這些結果來自於回應普通的非對抗性請求而產生的輸出。該論文還研究了一個對手,該對手主動設計提示以放大效果,將模型視為訊息的隱藏載體。摘要沒有識別這八個模型,沒有披露試驗次數,沒有描述確切的提示,沒有說明秘密是合成的還是來自真實用戶,也沒有對報告的結果給出不確定性估計。

預印本描述了兩種實用的攻擊路徑。首先,它報告一個訓練有素的分類器,該分類器從常規自然語言輸出中推斷出有關使用者記憶的語義謂詞,例如,使用者是否有健康狀況或經歷過財務事件。這是對類別或事實的推斷,而不一定是再現底層文本。其次,作者報告了一個經過 RL 訓練的對手,該對手從生產式代理中提取完整的社會安全號碼。 「製作風格」是來源的描述;摘要不識別已部署的服務或表明現實世界的產品受到損害。它也沒有指定攻擊的成功率、所需的互動次數或測試代理中存在的防護措施。

來源詳情: arxiv.org

為什麼這很重要

如果獨立複製這項發現,人工智慧代理的隱私風險將擴大到直接即時提取之外。使用日曆、憑證、健康記錄或財務資料作為上下文的系統可能會透過日常協助間接揭露資訊。然而,來源是第一版 arXiv 預印本,並沒有確定這種影響在部署系統中發生的頻率、哪些模型受到影響,或哪些防禦措施有效。

人工智慧代理越來越依賴包含傳統聊天機器人可能永遠不會收到的資訊的共享上下文。如果作者的結果具有普遍性,那麼系統就可以在不產生明顯洩露秘密的答案的情況下披露敏感資訊。使用者可能會尋求有關日程安排、摘要或其他日常任務的協助,而觀察者會分析回應的措詞以尋找有關隱藏上下文的訊號。即使存取控制和拒絕規則似乎起作用,這也將使普通輸出與隱私相關。該消息來源並未證明這種洩漏廣泛存在,但它確定了傳統直接提取測試可能錯過的機制。

摘要稱,能力更強的模型洩漏的資訊更多,因為更強的指令遵循能力會增強對上下文秘密的敏感度。作者將此解釋為證據,表明該行為可能是功能的副產品,而不是可以透過一個補丁刪除的離散錯誤。如果得到全面研究的支持,這將使產品設計變得複雜:提高模型遵循細緻入微的指令的能力也可能增加測試其產出如何與私人背景相關的需求。這是論文作者的主張,而不是獨立制定的縮放法則。該來源並未提供逐個模型的結果、能力測量、基準比較或顯示微調、系統提示或情境架構是否會改變效果的證據。

實際風險取決於抽像中未解決的部署細節。它沒有說明攻擊者是否必須是授權用戶,是否可以透過單獨的應用程式或代理工具發動攻擊,需要多少輸出,或者速率限制和監控是否可以偵測到它。它也不報告防禦、補救實驗或與上下文最小化、分區或輸出過濾等方法的比較。這些未知因素對於公眾影響很重要。引人注目的實驗室提取結果可能代表嚴重暴露、狹窄故障模式或兩者兼而有之;僅憑來源無法確定其流行程度、供應商之間的可用性或對實際用戶可能造成的傷害。

Interactive Mechanism

互動機制:它實際上是如何運作的

以互動方式探索這項發展背後的基礎技術。

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
互動式概念檢查+10 Points
AI Models Explained Quiz

What is the best response when AI Models Explained makes a mistake in production?

接下來看什麼

關鍵問題是所報告的攻擊是否在作者控制的設定之外重現,秘密和使用者記憶是合成的還是真實的,以及攻擊者需要多少訪問或培訓。全文還可能闡明樣本量、置信區間、提示、模型身份以及報告的社會安全號碼提取背後的條件。開發人員和稽核人員將需要有關隔離、監控和評估方法的證據,以解決間接洩漏而不僅僅是直接拒絕故障。

第一個驗證重點是方法細節。讀者應該尋找全文的秘密建構程序、上下文長度、範例數量、試驗計數、攻擊預算和統計不確定性。八個專有模型的身份和版本將有助於確定效果是否跨越模型系列或集中在特定架構或服務配置中。將普通請求產生的基準洩漏與對手主動工程師提示後獲得的更強結果區分開來也很重要。摘要報告了這兩種設置,但沒有量化它們的相對性能。

所聲稱的社會安全號碼提取需要特別仔細的審查。完整的論文應明確這些數字是否是虛構的測試字串、它們如何插入到代理的上下文中、「生產風格」的含義是什麼,以及對手是否需要對代理或其對話歷史記錄進行特權存取。獨立團隊使用單獨的模型進行複製將有助於測試結果是否反映了語言模型系統的一般屬性。可用來源不包含任何外部複製、供應商回應、事件報告或任何指定商業產品暴露真實客戶記錄的證據。

對於開發人員和評估人員來說,下一個實際問題是如何測試間接洩漏,而不僅僅依賴「揭露秘密」等直接請求。審計可能需要衡量當受保護的上下文發生變化時,包括當使用者提出不相關的問題時,輸出是否會發生可預測的變化。該消息來源沒有建議具體的緩解措施,因此可能的保護措施及其有效性仍然未知。因此,公開報告應避免將預印本視為所有人工智慧代理洩露社會安全號碼的證據。這裡建立的內容範圍更窄:作者報告了上下文相關洩漏的受控證據以及他們所說的可以利用它的兩種攻擊方法。

相關指引和測驗

人工智慧模型解釋人工智慧代理AI 倫理Prompt Engineering測試你所知道的—嘗試免費的人工智慧測驗在我們的詞彙表中尋找人工智慧術語
覺得有用嗎?