技術指南

機率校準

校準意味著模型規定的機率與現實相符:當它說 70% 時,該事件應該在大約 70% 的情況下發生。

閱讀時間約2分鐘最後更新

概述

It matters because accurate confidence drives good decisions in medicine, finance, and risk-sensitive AI.

深入探討

模型可能很準確,但校準很差。現代深度網路因過度自信而臭名昭著,其輸出 99% 的預測正確率要低得多。校準透過按置信度對預測進行分桶並檢查每個桶中觀察到的頻率來對此進行審核。可靠性圖繪製了預測與實際情況;完美校準的模型位於對角線上。預期校準誤差 (ECE) 將差距總結為各箱的加權平均值。修復有兩種形式:事後方法,如 Platt 縮放(擬合邏輯變換)、溫度縮放(用學習的標量 T 除 logits)和等滲回歸(單調逐步擬合);以及訓練時方法,例如標籤平滑或適當的評分損失。校準和準確性是不同的目標,改進其中一個目標並不需要改進另一個目標。

技術洞察

溫度縮放是神經網路的主力:將 softmax 之前的 logits 除以單一學習溫度 T,然後重新進行 softmax。 T > 1 會軟化過度自信的分佈,T < 1 會銳化它們。至關重要的是,T 適合驗證數據,以最大限度地減少負對數似然,並且永遠不會改變哪個類別獲勝,因此準確性不會受到影響,而機率會變得誠實。它的單一參數使其數據高效且幾乎不可能過度擬合。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

機率校準的未來

隨著人工智慧進入高風險循環,校準從事後想法轉變為要求。工作正在擴展到校準大型語言模型置信度和言語不確定性、分佈變化下的校準以及分組校準,以便各個子群體的機率是公平的。期望校準指標以及模型卡和監管審計的準確性,再加上與保形預測和選擇性預測的更緊密整合,以便系統在誠實信心較低時能夠可靠地棄權。

現實世界的實施

氣象服務可確保預測降雨量為 30% 的日子裡,實際上有 30% 的時間會下雨,這是教科書的校準目標。

信用違約模型是有溫度尺度的,因此規定的 5% 違約風險確實對應於定價貸款的 5% 歷史違約率。

醫療診斷網絡透過等滲透壓回歸重新校準,因此「疾病的高機率」反映了臨床醫生採取行動之前的真實發病率。

自動駕駛感知堆疊可校準物件偵測置信度,因此規劃模組會適當信任 90% 的行人分數。

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Probability Calibration quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

AI信任校準

常見問題

What is Probability Calibration?

校準意味著模型規定的機率與現實相符:當它說 70% 時,該事件應該在大約 70% 的情況下發生。這很重要,因為準確的信心可以推動醫學、金融和風險敏感型人工智慧領域的良好決策。

溫度縮放對神經網路的輸出有何影響?

溫度縮放將 logits 除以單一學習的 T 並重新套用 softmax,軟化或銳化機率而不更改 argmax。

可靠性圖繪製了什麼?

可靠性圖將預測置信度與實際結果頻率進行比較;對角線代表完美的校準。

為什麼高精度模型還需要校準?

模型可以很好地對預測進行排名(高精度),但會分配不匹配的機率值,因此必須單獨檢查校準。