技術指南

Mixup 與 CutMix 增強

Mixup 和 CutMix 是資料增強方法,透過混合兩個影像及其標籤來建立新的訓練範例。

閱讀時間約2分鐘最後更新

概述

Mixup 線性插值整張圖片與標籤,而 CutMix 則將一張圖片的長方形貼片貼到另一張圖片,並依區域混合標籤——兩者皆減少過擬合並提升穩健性。

深入探討

Mixup(Zhang et al., 2017)形成一個新樣本 x̃ = λ·x_a + (1−λ)·x_b,標籤 ỹ 與相同的 λ 混合,其中 λ 是從 Beta 分佈中提取的。這鼓勵模型在範例之間表現出線性,從而平滑決策邊界並改進校準。 CutMix (Yun et al., 2019) 相反,從圖像 B 中剪切一個矩形區域並將其粘貼到圖像 A 上;標籤權重由每個圖像貢獻的像素比例設定。由於 CutMix 保持局部連貫的影像區域(而不是幽靈般的混合),因此它保留了有用的空間結構,同時仍迫使模型專注於多個物件和部分。這兩種技術都充當強大的正則化器,提高了 ImageNet 規模基準的準確性,並顯著提高了對損壞和對抗性輸入的穩健性。

技術洞察

兩種方法都會修改損失目標,而不僅僅是輸入。標籤變成了一個軟的、混合的目標,因此交叉熵損失是兩個類別的 λ 加權組合——實際上是與像素混合比相關的標籤平滑的一種形式。在 CutMix 中,λ 等於未改變像素的分數,透過剪切框面積除以總影像面積計算得出,這會使標籤比例與每個影像的可見部分保持一致。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

Mixup 和 CutMix 增強的未來

基於混合的增強現在是強大的圖像分類方法的標準,並支撐了視覺變換器的現代訓練管道,這通常需要大量的正則化。關於顯著性感知變體(例如,對資訊區域進行剪切)、變壓器的標記級混合以及音頻、文本和 3D 數據的擴展的研究仍在繼續。隨著架構對資料的需求越來越大,預計混合策略仍將是提高準確性、校準和穩健性的低成本槓桿。

現實世界的實施

使用 CutMix 訓練 ImageNet 分類器以提高 top-1 準確度並改善物件的定位。

應用 Mixup 來改進模型校準,使預測的置信度更好地匹配真實的準確性。

結合 Mixup 和 CutMix 對視覺變換器(例如 DeiT)進行大量正則化,以在有限的數據上進行訓練。

提高安全關鍵視覺系統中影像損壞和分佈外輸入的穩健性。

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixup and CutMix Augmentation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

測試時間增加

常見問題

什麼是 Mixup 和 CutMix Augmentation?

Mixup 和 CutMix 是資料增強方法,透過混合兩個影像及其標籤來建立新的訓練範例。 Mixup 對整個圖像和標籤進行線性插值,而 CutMix 將一個圖像中的矩形塊粘貼到另一張圖像上,並按塊區域混合標籤 - 既減少了過度擬合,又提高了穩健性。

Mixup 如何建立新的訓練範例?

混合形式 x̃ = λx_a + (1−λ)x_b 並將標籤與從 Beta 分佈中提取的相同 λ 混合。

CutMix 和 Mixup 的核心差異是什麼?

CutMix 將一個矩形區域從一個影像複製到另一個影像中,保持局部連貫的內容,而不是將兩個影像重影在一起。

在 CutMix 中,如何決定標籤的混合權重 (lambda)?

CutMix 中的標籤比例是根據貼框相對於整個影像的面積來設定的,使標籤與可見像素保持一致。

除了輸入影像之外,Mixup 和 CutMix 還修改什麼?

這兩種方法也混合標籤,產生軟目標,其作用類似於依賴資料的標籤平滑形式。

哪一種分佈通常用於對混合係數 lambda 進行取樣?

Mixup 和 CutMix 通常從 Beta 分佈中提取 λ,該分佈控制兩個範例混合的強度。