社團指南

模型提取和竊取攻擊

模型提取攻擊讓攻擊者只需查詢其公共 API 並根據答案訓練模仿者即可克隆專有的 AI 模型。

閱讀時間約2分鐘最後更新

概述

It matters because companies spend millions training models that can be approximated for the price of a few thousand API calls.

深入探討

模型提取(或模型竊取)攻擊將已部署的模型視為預言機。攻擊者發送輸入、記錄輸出並訓練替代模型來模仿該行為。由於目標模型本身是將輸入映射到輸出的學習函數,因此複製足夠的輸入輸出對可以重建近似值,而無需查看原始權重或訓練資料。研究人員竊取了影像分類器的決策邊界,甚至恢復了小層的精確權重。 2024 年,一個團隊展示了 OpenAI 和 Google 生產模型嵌入層的部分內容可以以不到幾百美元的價格提取。被盜的副本會削弱付費服務,繞過安全過濾器,並引發進一步的白盒攻擊,例如製作對抗性範例。

技術洞察

API 回應越豐富,盜竊的成本就越低。傳回完整的機率向量或 logits 每個查詢會比單一 top-1 標籤洩漏更多的信息,因此攻擊者可以用更少的查詢來重建邊界。主動學習策略在決策邊界附近選擇資訊最豐富的查詢。一個具有里程碑意義的結果表明,查詢輸出維度計數可以透過線性代數準確地恢復最終的線性投影層,因為該層實際上是響應跨度的矩陣。

戰略影響

風險與安全

災難性和日常的人工智慧危害都取決於誰了解風險以及誰能夠採取行動。

更明確的決策

民眾和專業素養決定強而有力的安全政策在政治上是否可行。

突破炒作

清晰的解釋可以減少炒作、實驗室公關和模糊道德劇場的影響。

模型提取和竊取攻擊的未來

防禦措施正在從阻止轉向檢測和降級:速率限制、返回舍入或僅限前 1 的輸出、添加校準噪聲、為模型行為添加水印以便對被盜副本進行指紋識別,以及監控提取簽名的查詢模式。預計將提取視為盜竊的監管和許可條款,以及對可證明難以提取的架構的積極研究。隨著模型變得越來越大,完全提取的成本仍然很高,但部分提取有價值的成分和蒸餾式克隆仍將是持續的商業和安全威脅。

現實世界的實施

一家新創公司查詢競爭對手的付費圖像識別 API 數千次,並訓練一個免費克隆來複製其準確性。

安全研究人員使用精心設計的 API 查詢來提取生產語言模型的最終嵌入投影層,成本僅為數百美元。

攻擊者在本地複製垃圾郵件或詐欺分類器,以便他們可以離線探測它並製作可靠地逃避偵測的輸入。

雲端供應商添加了查詢率監控,標記其存取模式與主動學習提取相符的帳戶並限制其回應。

風險與防護欄

將存在風險視為科幻小說,同時能力複合。

混淆了表面產品安全與高度自治下的對準。

只給非英語和非專業觀眾留下低品質的資源。

實施路線圖

1

單獨的產品危害、誤用和失控/失調風險。

2

詢問哪些證據會改變您對時間表和嚴重性的看法。

3

比起行銷主張,更喜歡主要來源和具體評估。

4

確定一條行動路徑:職業、政策、資金或技能——而不僅僅是意識。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model Extraction and Stealing Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

成員資格推斷攻擊

常見問題

What is Model Extraction and Stealing Attacks?

模型提取攻擊讓攻擊者只需查詢其公共 API 並根據答案訓練模仿者即可克隆專有的 AI 模型。這很重要,因為公司花費了數百萬美元訓練模型,而這些模型的價格大約相當於數千次 API 呼叫的價格。

模型提取攻擊背後的核心思想是什麼?

提取將部署的模型視為預言機:攻擊者收集輸入輸出對並訓練模仿模型來模仿行為,而無需存取原始權重。

為什麼回傳完整機率向量比只回傳 top-1 標籤更容易被提取?

每個完整的機率向量比單一標籤揭示更多有關模型內部決策表面的信息,讓攻擊者可以用更少的查詢重建邊界。

哪種防禦技術可以直接減少每次查詢外洩的資訊?

粗化輸出,例如僅返回頂部標籤或舍入機率,會減少每個回應向攻擊者提供的訊號,從而提高提取成本。

2024 年的結果表明,攻擊者可以準確地以低廉的成本恢復生產語言模型的哪一部分?

研究人員證明,最終的線性投影層只需幾百美元即可恢復,因為它的響應跨越可恢復的矩陣。

為什麼被盜的替代模型除了收入損失之外還有其他危險?

一旦攻擊者擁有本地副本,他們就可以自由探測​​它以設計對抗性輸入或規避攻擊,從而欺騙原始部署的系統。