社團指南

數據中毒和後門攻擊

資料中毒透過篡改訓練資料來破壞模型,而後門攻擊隱藏了一個秘密觸發器,使模型在命令下行為不當。

閱讀時間約2分鐘最後更新

概述

They matter because models increasingly learn from scraped, crowdsourced data that attackers can quietly contaminate.

深入探討

中毒攻擊分為兩個主要目標。可用性攻擊旨在透過注入錯誤標記或損壞的範例來降低整體準確性。有針對性的後門攻擊更加隱密:此模型在正常輸入上表現完美,但每當出現隱藏觸發器(例如小像素補丁、特定短語或不可見浮水印)時,就會產生攻擊者選擇的輸出。 BadNets 的工作展示了一個停車標誌分類器,它將標有貼紙的標誌讀取為「速度限制」。現代系統之所以暴露,是因為它們是在網路規模的資料上進行訓練的。研究人員證明,購買一小部分資料集 URL 背後的過期網域可能會花費數百美元來毒害流行的圖像資料集。語言模型也可以透過有毒的微調資料或指令範例來設定後門。

技術洞察

乾淨標籤後門尤其危險:中毒的樣本保留正確的標籤,並且在人類審查者看來正常,但它們嵌入了模型學習與目標類別關聯的觸發功能。在推理時,呈現觸發器會翻轉預測,同時乾淨的準確性保持較高水平,因此標準驗證永遠不會捕獲它。防禦措施包括激活聚類、光譜特徵、觸發重建和資料來源檢查。

戰略影響

風險與安全

災難性和日常的人工智慧危害都取決於誰了解風險以及誰能夠採取行動。

更明確的決策

民眾和專業素養決定強而有力的安全政策在政治上是否可行。

突破炒作

清晰的解釋可以減少炒作、實驗室公關和模糊道德劇場的影響。

數據中毒和後門攻擊的未來

由於供應鏈依賴抓取的資料、預先訓練的權重和第三方微調,中毒正在從理論轉變為真正的供應鏈威脅。期望資料集簽署和出處標準、經過認證的穩健性訓練(限制固定數量中毒點的損害)以及部署前對模型的連續後門掃描。監管機構和 MITRE ATLAS 等安全框架開始將中毒視為一流的機器學習風險。

現實世界的實施

當存在小貼紙觸發器時,自動駕駛汽車將停車標誌誤認為限速標誌的視覺模型

透過劫持託管部分圖像 URL 的過期域,以低廉的成本毒害公共圖像資料集

對程式碼完成模型進行後門處理,隱藏提示短語使其插入不安全的程式碼

破壞垃圾郵件過濾器的眾包培訓回饋,使特定的惡意電子郵件漏網

風險與防護欄

將存在風險視為科幻小說,同時能力複合。

混淆了表面產品安全與高度自治下的對準。

只給非英語和非專業觀眾留下低品質的資源。

實施路線圖

1

單獨的產品危害、誤用和失控/失調風險。

2

詢問哪些證據會改變您對時間表和嚴重性的看法。

3

比起行銷主張,更喜歡主要來源和具體評估。

4

確定一條行動路徑:職業、政策、資金或技能——而不僅僅是意識。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Data Poisoning and Backdoor Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

What is Data Poisoning and Backdoor Attacks?

資料中毒透過篡改訓練資料來破壞模型,而後門攻擊隱藏了一個秘密觸發器,使模型在命令下行為不當。它們很重要,因為模型越來越多地從攻擊者可以悄悄污染的抓取的眾包資料中學習。

後門攻擊與一般可用性中毒攻擊有何不同?

後門模型通常對乾淨的輸入起作用,並且僅當隱藏的觸發器出現時才產生攻擊者的目標輸出。

為什麼清潔標籤後門攻擊難以偵測?

由於中毒範例具有正確的標籤並且看起來很普通,因此人工審查和標準驗證準確性不會標記它們。

BadNets 研究著名地證明了什麼?

BadNets 展示了一個帶有後門的交通標誌分類器,它會誤讀標有小貼紙的停車標誌。

研究人員如何證明網路規模的資料集可以廉價地中毒?

由於資料集透過 URL 引用圖像,因此購買失效的網域可以讓攻擊者以較低的成本控制這些圖像。

其中哪一項是公認的後門攻擊防禦措施?

除其他檢測方法外,防禦還分析內部激活,以將中毒樣本與乾淨樣本區分開。