GUIDE Technique

Augmentation du Mixup et du CutMix

Mixup et CutMix sont des méthodes d'augmentation des données qui créent de nouveaux exemples de formation en mélangeant deux images et leurs étiquettes.

2 minutes de lectureDernière mise à jour

Aperçu

Mixup linearly interpolates whole images and labels, while CutMix pastes a rectangular patch from one image onto another and mixes labels by patch area — both reduce overfitting and improve robustness.

Plongée profonde

Mixup (Zhang et al., 2017) forme un nouvel échantillon comme x̃ = λ·x_a + (1−λ)·x_b avec l'étiquette ỹ mélangée par le même λ, où λ est tiré d'une distribution bêta. Cela encourage le modèle à se comporter de manière linéaire entre les exemples, lissant les limites de décision et améliorant le calibrage. CutMix (Yun et al., 2019) coupe à la place une région rectangulaire de l'image B et la colle sur l'image A ; les poids des étiquettes sont définis par la proportion de pixels apportée par chaque image. Parce que CutMix conserve des régions d'image localement cohérentes (plutôt que des mélanges fantomatiques), il préserve la structure spatiale utile tout en obligeant le modèle à s'occuper de plusieurs objets et pièces. Les deux techniques agissent comme de puissants régularisateurs, augmentent la précision des références à l'échelle d'ImageNet et améliorent notamment la robustesse face aux corruptions et aux entrées contradictoires.

Aperçu technique

Les deux méthodes modifient l’objectif de perte, pas seulement l’entrée. L'étiquette devient une cible douce et mixte, de sorte que la perte d'entropie croisée est une combinaison pondérée λ de deux classes - en fait une forme de lissage d'étiquette liée au rapport de mélange des pixels. Dans CutMix, λ est égal à la fraction de pixels non modifiés, calculée à partir de la zone de coupe divisée par la zone totale de l'image, ce qui maintient la proportion de l'étiquette cohérente avec la quantité de chaque image visible.

Impact stratégique

Coût et budget

Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.

Décisions plus claires

La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.

Contrôle qualité

De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.

L’avenir du mixup et de l’augmentation CutMix

L'augmentation basée sur le mix est désormais la norme dans les recettes de classification d'images solides et sous-tend les pipelines de formation modernes pour les transformateurs de vision, qui nécessitent souvent une régularisation importante. La recherche se poursuit sur les variantes tenant compte de la saillance (par exemple, en plaçant des coupes sur les régions informatives), le mixage au niveau des jetons pour les transformateurs et les extensions aux données audio, texte et 3D. Attendez-vous à ce que les stratégies de mixage restent un levier peu coûteux pour améliorer la précision, l’étalonnage et la robustesse à mesure que les architectures sont de plus en plus gourmandes en données.

Mise en œuvre dans le monde réel

Formation des classificateurs ImageNet avec CutMix pour augmenter la précision de premier ordre et améliorer la localisation des objets.

Application de Mixup pour améliorer l'étalonnage du modèle afin que les confiances prédites correspondent mieux à la précision réelle.

Transformateurs de vision fortement régularisés (par exemple, DeiT) avec Mixup et CutMix combinés pour s'entraîner sur des données limitées.

Robustesse accrue face aux corruptions d’images et aux entrées hors distribution dans les systèmes de vision critiques pour la sécurité.

Risques et garde-fous

L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.

Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.

Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.

Feuille de route de mise en œuvre

1

Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.

2

Benchmark dans des conditions de charge et de données réalistes.

3

Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.

4

Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixup and CutMix Augmentation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Augmentation du temps de test

Questions fréquemment posées

What is Mixup and CutMix Augmentation?

Mixup et CutMix sont des méthodes d'augmentation des données qui créent de nouveaux exemples de formation en mélangeant deux images et leurs étiquettes. Mixup interpole linéairement des images et des étiquettes entières, tandis que CutMix colle un patch rectangulaire d'une image sur une autre et mélange les étiquettes par zone de patch, ce qui réduit le surajustement et améliore la robustesse.

Comment Mixup crée-t-il un nouvel exemple de formation ?

Le mélange forme x̃ = λx_a + (1−λ)x_b et mélange les étiquettes avec le même λ tiré d'une distribution bêta.

Quelle est la principale différence entre CutMix et Mixup ?

CutMix copie une région rectangulaire d'une image dans une autre, en conservant un contenu localement cohérent plutôt que de créer des images fantômes ensemble.

Dans CutMix, comment est déterminé le poids de mélange (lambda) des étiquettes ?

La proportion de l'étiquette dans CutMix est définie par la zone de la zone collée par rapport à l'image entière, gardant les étiquettes cohérentes avec les pixels visibles.

Outre l’image d’entrée, que modifient Mixup et CutMix ?

Les deux méthodes mélangent également les étiquettes, produisant des cibles souples qui agissent comme une forme de lissage d'étiquettes dépendante des données.

Quelle distribution est couramment utilisée pour échantillonner le coefficient de mélange lambda ?

Mixup et CutMix tirent généralement λ d'une distribution bêta, qui contrôle la force avec laquelle les deux exemples sont mélangés.