技術指南

類不平衡和重採樣

Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.

閱讀時間約2分鐘最後更新

概述

Resampling rebalances the training data so the model actually learns to spot the minority.

深入探討

當類別存在偏差時,模型可以透過始終預測大多數並且從不發現任何詐欺行為來達到 99.9% 的準確率,但這是無用的。重採樣透過兩種主要方式修復訓練分佈。過採樣會重複或合成少數樣本 - 經典的 SMOTE(合成少數過採樣技術)透過在少數樣本與其最近的少數樣本鄰居之間進行插值而不是複製它們來創建新點。相反,欠採樣會丟棄大多數範例(隨機地或透過 Tomek links 或 NearMiss 等方法巧妙地丟棄)以均勻分佈,但代價是丟棄資料。避免接觸資料的替代方案包括類別加權(在損失函數中更多地懲罰少數錯誤)和在訓練後調整決策閾值。

技術洞察

一個關鍵規則:僅對訓練集重新採樣,而不對驗證集或測試集重新採樣,並且始終在交叉驗證折疊內重新採樣。分割之前的過採樣會將接近重複的點洩漏到測試集中並誇大分數。因為準確度在這裡毫無意義,所以評估應該依賴精確度、召回率、F1、精確召回率 AUC 或馬修斯相關係數——當正類很少時保持誠實的指標。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

類不平衡和重採樣的未來

機器學習管道內的重採樣越來越自動化,像不平衡學習這樣的庫直接整合到交叉驗證中。研究正在轉向成本敏感的學習和定制的損失函數(例如焦點損失,它會降低簡單多數示例的權重),這些函數通常優於深度網路上的粗略重採樣。對於表格和影像數據,合成現實少數樣本的生成模型正在成為 SMOTE 式插值的更複雜的後繼者。

現實世界的實施

訓練信用卡詐欺偵測器,其中真實詐欺遠低於交易的 1%,使用 SMOTE 放大罕見的詐欺案例

為僅少數患者出現的罕見疾病建立醫學模型,應用類別權重,因此錯過的病例將受到嚴厲懲罰

檢測生產線上的瑕疵物品,幾乎所有產品都通過檢驗,對「好」物品進行抽樣以平衡培訓

在以正常流量為主的網路安全日誌中標記罕見的網路入侵,並使用 Precision-Recall AUC 而不是準確性進行評估

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Class Imbalance and Resampling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

連體網絡和三元組損失

常見問題

What is Class Imbalance and Resampling?

類別不平衡是指一種結果的數量遠遠超過另一種結果(例如 99.9% 的合法交易與 0.1% 的詐欺交易),這會欺騙模型忽略罕見但重要的類別。重新採樣會重新平衡訓練數據,因此模型實際上學會了發現少數。

為什麼簡單準確率對於高度不平衡的分類問題來說是一個糟糕的指標?

如果 99.9% 的情況都是陰性,則始終預測陰性的模型在捕捉零陽性的同時獲得 99.9% 的準確率,因此準確度隱藏了罕見類別的完全失敗。

SMOTE 是做什麼的?

SMOTE(合成少數派過採樣技術)透過在少數派點與其最近的少數派鄰居之間進行插值來創建新的少數派範例,而不是簡單地複製它們。

哪種方法可以在不改變訓練範例數量的情況下處理不平衡?

類別加權不會影響數據,而是使損失函數對少數類別的錯誤進行更嚴厲的懲罰。

在將資料拆分為訓練集和測試集之前應用過採樣的主要風險是什麼?

分割之前的重新採樣會讓訓練集和測試集中出現幾乎相同的少數點,從而洩漏資訊並產生過於樂觀、不切實際的性能。

隨機欠採樣的主要缺點是什麼?

欠採樣透過丟棄多數範例來平衡類別,這可能會丟棄資訊資料並損害模型學習多數類別的能力。