返回新聞
安全性AI Understanding 簡報

研究發現良性強化學習會增加記憶私人資料的語言模型洩漏

新的 arXiv 預印本報告稱,對不包含個人資訊的事實數據進行強化學習,使得從測試的語言模型中提取記憶的電子郵件地址變得更容易。

5 min readRead the primary source
Source-page capture accompanying Study finds benign reinforcement learning can increase language-model leakage of memorized private data
主要來源文件來源記錄
出版商
arxiv.org
來源連結
arxiv.orghttps://arxiv.org/abs/2608.21727
來源類型
主要文件-我們直接閱讀的官方公告、文件、文件或第一方頁面。
背景60 秒內了解這一點

從這裡開始

關鍵術語

強化學習
透過獎勵訊號進行訓練,代理學習能夠最大化長期回報的行動。
微調
對特定領域的資料進行持續訓練,以使預先訓練的模型適應特定任務。
召回
模型正確辨識的實際陽性的比例。
測試一下自己AI 模型解釋測驗

發生了什麼事

研究人員 Renfei Zhang 和 Niloofar Mireshghallah 報告說,強化學習對良性事實數據進行可驗證的獎勵,增加了指令模型已經記憶的個人識別資訊的可訪問性。在DeepSeek-V3.1的測試中,逐字召回@k從0.155上升到0.370,提升了2.4倍。

報告的模式也隨模型尺寸的不同而變化。作者表示,在參數範圍從 80 億到 6,710 億個參數的三個模型中,最大模型的絕對洩漏量最大。這一比較描述了研究中檢查的模型之間報告的結果有何不同。它不會取代中心結果或添加單獨的測量結果。比較中的模型作為作者實驗說明的一部分呈現,其尺寸範圍為此比較提供了規定的比例。同時,措辭保留了絕對洩漏與強化學習如何影響對記憶資訊的存取這一更廣泛問題之間的區別。

同時,模型在研究評估中保留了推理能力和拒絕率。作者將這種組合解釋為強化學習有選擇地改變對記憶資訊的存取而不是廣泛改變模型行為的證據。因此,在研究的描述中,所報告的可及性的增加與保留的表現和拒絕行為一起出現。重點不是模型的每個方面都發生了變化,而是報告的隱私相關結果發生了變化,而引用的評估仍然保留。這是作者在描述強化學習過程在實驗中的作用時所使用的特定組合。

來源沒有提供足夠的細節來獨立評估完整的訓練設定、評估樣本大小或所有三個模型的確切身份。此限制適用於解釋比較的來源中可用的詳細程度。報告的模型大小模式、保留的推理能力和拒絕率以及作者的解釋都在草案中進行了描述。缺少資訊意味著該帳戶無法獨立建立超出規定的有關設定或評估的其他詳細資訊。因此,可以透過其規定的測量和解釋來報告結果,同時保持源未解決的細節可見。

來源詳情: arxiv.org ↗

為什麼這很重要

研究結果表明,即使新的訓練資料不包含個人訊息,隱私風險也會在模型微調過程中發生變化。模型可以保留其推理表現和拒絕行為,同時更有可能顯示記憶的私人資料。

該研究也使拒絕率和一般能力測試作為隱私指標的使用變得複雜。作者報告說,拒絕率和推理能力得以保留,而洩漏卻增加了。一起閱讀,這些陳述描述了透過廣泛的能力或拒絕檢查來衡量的行為與記憶資訊的可訪問性之間的不匹配。研究聲稱的重要性來自於這種共存:即使報告的洩漏測量增加,所引用的檢查也沒有顯示出相應的推理損失或拒絕行為。因此,人們擔心這些檢查可能會遺漏哪些內容。

這表明模型可以在廣泛的安全或性能檢查中表現穩定,同時變得更願意或能夠揭示其參數中嵌入的資訊。該聲明是根據報告的發現提出的建議,而不是聲稱每個模型或部署的系統都以這種方式運作。它確定了為什麼報告的結果對於評估很重要:一組檢查中看似穩定的結果可能與存取記憶資料時的不同結果共存。這項研究的相關性源自於作者所描述的一般表現、拒絕行為和具體洩漏結果之間可能的分離。

這項發現是重要的,但它仍然是作者所描述的實驗的預印本結果,而不是所有已部署語言模型的失敗證明。這項限定限制了權利要求的範圍,同時保留了其重要性。該草案並未將結果作為所有已部署系統具有相同行為的證據。它提出了預印本的發現,報告了作者在實驗中觀察到的情況,並確定了這些觀察結果所產生的隱私意義。所有已部署語言模型的結果和已證明的失敗之間的差異是該發現的正確背景的一部分。

Interactive Mechanism

互動機制:它實際上是如何運作的

以互動方式探索這項發展背後的基礎技術。

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
互動式概念檢查+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

接下來看什麼

結果需要在更多模型、訓練方法、資料集和隱私攻擊上進行測試。重要的未知因素包括影響的普遍程度、部署的系統是否面臨相同的風險,以及哪些安全措施可以偵測或防止記憶資訊的存取發生變化。

公共影響仍不確定,因為消息來源並未表明已部署的服務透過此機制洩露了私人資料。這種不確定性涉及預印本中所描述的實驗與現實世界服務行為之間的距離。報告的機制涉及在良性強化學習後存取記憶的私有數據,但來源並未顯示由此引起的部署服務事件。沒有該演示並不能消除報告的結果;它定義了在考慮其公共影響時仍未解決的問題。因此,該草案將實驗結果與有關觀察到的服務故障的主張分開。

它還沒有具體說明需要多少良性訓練,效果是否可以逆轉,或者哪些控制措施可以可靠地阻止提取而不損害有用的功能。這些是關於所報告影響的條件、可逆性和緩解的未知因素。它們很重要,因為來源沒有提供確定可訪問性的變化在不同數量的培訓或嘗試的保護措施下如何表現所需的資訊。該措辭也保留了草案中確定的權衡:控制措施需要阻止提取,同時避免對有用功能造成損害。這裡沒有提供額外的閾值、反轉方法或控制。

這些未知因素應該緩和論文的對抗性含義,同時保持核心結果:根據作者的說法,從不接觸私人資料的訓練仍然可以改變記憶的私人資料的可訪問性。謹慎和核心結果是一體的。公共影响、培训要求、可逆性和控制的不确定性限制了其含义的应用范围。同時,作者報告的主張仍然是值得關注的中心點:不包含個人資訊的良性訓練資料仍然可能會改變對模型已經記憶的私人資訊的存取。该草案并未将这一主张扩展到作者的叙述之外。

相關指引和測驗

人工智慧模型解釋人工智慧培訓AI 倫理AI 的未來測試你所知道的—嘗試免費的人工智慧測驗在我們的詞彙表中尋找人工智慧術語關注AI監管追蹤器
覺得有用嗎?