テクニカルガイド

Mixup と CutMix の拡張

Mixup と CutMix は、2 つの画像とそのラベルをブレンドすることで新しいトレーニング サンプルを作成するデータ拡張メソッドです。

2分の読書最終更新日

概要

Mixup linearly interpolates whole images and labels, while CutMix pastes a rectangular patch from one image onto another and mixes labels by patch area — both reduce overfitting and improve robustness.

ディープダイブ

Mixup (Zhang et al., 2017) は、ラベル ỹ を同じ λ で混合した x̃ = λ・x_a + (1−λ)・x_b として新しいサンプルを形成します。ここで、λ はベータ分布から抽出されます。これにより、モデルがサンプル間で線形に動作するようになり、決定境界が平滑化され、キャリブレーションが向上します。 CutMix (Yun et al., 2019) は代わりに、画像 B から長方形の領域を切り取り、それを画像 A に貼り付けます。ラベルの重みは、各画像が寄与するピクセルの割合によって設定されます。 CutMix は (ゴースト的なブレンドではなく) 局所的に一貫した画像領域を維持するため、モデルに複数のオブジェクトやパーツを強制的に適用しながら、有用な空間構造を維持します。どちらの手法も強力な正則化機能として機能し、ImageNet スケールのベンチマークの精度を高め、破損や敵対的な入力に対する堅牢性を著しく向上させます。

技術的な洞察

どちらの方法でも、入力だけでなく損失ターゲットも変更されます。ラベルはソフトな混合ターゲットになるため、クロスエントロピー損失は 2 つのクラスの λ 重み付けされた組み合わせになります。これは、事実上、ピクセル混合比に関連付けられたラベル平滑化の一種です。 CutMix では、λ は、カット ボックス領域を画像領域全体で割って計算される、変更されていないピクセルの割合に等しく、これにより、表示される各画像の量とラベルの比率の一貫性が保たれます。

戦略的影響

費用と予算

アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。

より明確な判決

技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。

品質管理

より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。

Mixup と CutMix Augmentation の未来

ミックスベースの拡張は現在、強力な画像分類レシピの標準となっており、多くの場合高度な正則化が必要なビジョン トランスフォーマーの最新のトレーニング パイプラインを支えています。顕著性を意識したバリアント (情報領域にカットを配置するなど)、トランスフォーマーのトークンレベルのミキシング、オーディオ、テキスト、および 3D データの拡張に関する研究が続けられています。アーキテクチャがより多くのデータを必要とするようになるにつれて、混合戦略は精度、キャリブレーション、堅牢性を高めるための低コストの手段であり続けることが予想されます。

現実世界の実装

CutMix を使用して ImageNet 分類子をトレーニングして、トップ 1 の精度を高め、オブジェクトの位置特定を改善します。

Mixup を適用してモデルのキャリブレーションを改善し、予測された信頼度が実際の精度とより一致するようにします。

限られたデータでトレーニングするために、Mixup と CutMix を組み合わせてビジョン トランスフォーマー (DeiT など) を厳密に正規化します。

セーフティクリティカルなビジョンシステムにおける画像の破損や分布外の入力に対する堅牢性が向上します。

リスクとガードレール

1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。

インフラストラクチャとメンテナンスのコストは過小評価されがちです。

システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。

実装ロードマップ

1

実装前にレイテンシ、品質、コストの目標を定義します。

2

現実的な負荷とデータ条件でのベンチマーク。

3

エラー、ドリフト、ユーザーへの影響を計測器で監視します。

4

スケーリングの前に、ロールバックとインシデント対応のパスを準備します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixup and CutMix Augmentation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

よくある質問

What is Mixup and CutMix Augmentation?

Mixup と CutMix は、2 つの画像とそのラベルをブレンドすることで新しいトレーニング サンプルを作成するデータ拡張メソッドです。 Mixup は画像とラベル全体を線形補間しますが、CutMix はある画像から別の画像に長方形のパッチを貼り付け、パッチ領域ごとにラベルを混合します。どちらも過剰適合を軽減し、堅牢性を向上させます。

Mixup はどのようにして新しいトレーニング サンプルを作成するのでしょうか?

ミックスアップは、x̃ = λx_a + (1−λ)x_b を形成し、ベータ分布から得られた同じ λ を持つラベルを混合します。

CutMix と Mixup の主な違いは何ですか?

CutMix は、ある画像から別の画像に長方形の領域をコピーし、2 つの画像をゴースト化するのではなく、局所的に一貫したコンテンツを維持します。

CutMix では、ラベルの混合ウェイト (ラムダ) はどのように決定されますか?

CutMix のラベルの比率は、画像全体に対する貼り付けられたボックスの面積によって設定され、ラベルと可視ピクセルの一貫性が保たれます。

Mixup と CutMix は入力画像以外に何を変更しますか?

どちらの方法でもラベルを混合し、データ依存形式のラベル スムージングのように機能するソフト ターゲットを生成します。

混合係数ラムダのサンプリングにはどの分布が一般的に使用されますか?

Mixup と CutMix は通常、2 つの例がどの程度強く混合されるかを制御するベータ分布から λ を引き出します。