技術指南

訓練資料歸因的影響函數

影響函數估計每個訓練範例對模型預測的影響程度,讓您可以將輸出追溯到導致該結果的資料。

閱讀時間約2分鐘最後更新

概述

They matter because they turn an opaque model into something auditable for copyright, debugging, and trust.

深入探討

影響函數來自穩健的統計數據,並於 2017 年被 Koh 和 Liang 應用於深度學習。核心問題是反事實的:如果刪除或增加特定訓練範例,模型在測試點上的損失將如何變化?影響函數不是實際進行再訓練(這是極其昂貴的),而是使用微積分來近似該變化。他們計算訓練點和測試點的損失梯度,然後透過損失的逆 Hessian 矩陣將它們連接起來,從而捕捉模型參數空間的曲率。較大的正面影響意味著訓練範例推動模型朝著其預測方向發展;較大的負值意味著它會推動它。結果是最負責任的培訓範例的排名清單。

技術洞察

精確的公式需要所有參數的損失的逆 Hessian 矩陣,這對於十億參數的模型來說是很棘手的。從業者使用 LiSSA(隨機迭代反演)、克羅內克因子曲率 (EK-FAC) 或隨機投影(例如 TRAK)等方法來近似它。 Anthropic 2023 年的工作使用 EK-FAC 將影響函數擴展到大型語言模型,揭示了有影響力的範例通常共享抽像模式而不是精確的表面措辭。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

訓練資料歸因影響函數的未來

預計基於影響力的歸因將成為人工智慧問責的基礎設施。監管機構和法院在調查受版權保護的文字是否形成輸出時需要範例層級的出處,而開發人員將使用它來顯示標籤錯誤或有毒的資料。 TRAK 和梯度草圖等較便宜的近似方法正在將歸因推向即時,將其與遺忘相結合可以讓團隊在無需完全重新訓練的情況下消除文件的影響。

現實世界的實施

追蹤哪些受版權保護的書籍對語言模型產生的段落影響最大,以進行法律和許可分析

透過顯示錯誤標記的訓練圖像來調試錯誤分類,這些圖像將模型推向錯誤的答案

檢測對特定預測產生巨大影響的中毒或異常訓練範例

審核信用或招募模型,以顯示哪些歷史記錄推動了有爭議的決策

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Influence Functions for Training Data Attribution quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

完全分片數據並行

常見問題

What is Influence Functions for Training Data Attribution?

影響函數估計每個訓練範例對模型預測的影響程度,讓您可以將輸出追溯到導致該結果的資料。它們很重要,因為它們將不透明的模型變成了可審核版權、調試和信任的模型。

影響函數近似什麼反事實問題?

影響函數估計擾動訓練範例的權重對測試點損失的影響,近似留一法再訓練而不這樣做。

哪個數學物件使得大型模型的精確影響計算變得困難?

經典的影響力公式需要對所有參數進行 Hessian 矩陣求逆,這對於具有數十億參數的模型來說是不可行的。

誰在 2017 年的一篇著名論文中將影響函數應用於現代深度學習?

Pang Wei Koh 和 Percy Liang 於 2017 年發表的論文「透過影響函數來理解黑盒預測」將此技術引入深度學習。

負面影響值較大說明什麼?

負面影響意味著增加訓練範例的權重會降低模型對預測的置信度,即它與輸出相反。

Anthropic 使用哪一種近似值將影響函數擴展到大型語言模型?

Anthropic 的 2023 年研究使用 EK-FAC 來近似逆 Hessian,從而能夠對大型語言模型進行影響分析。