Augmentation du Mixup et du CutMix
Mixup et CutMix sont des méthodes d'augmentation des données qui créent de nouveaux exemples de formation en mélangeant deux images et leurs étiquettes.
Aperçu
Mixup linearly interpolates whole images and labels, while CutMix pastes a rectangular patch from one image onto another and mixes labels by patch area — both reduce overfitting and improve robustness.
Plongée profonde
Mixup (Zhang et al., 2017) forme un nouvel échantillon comme x̃ = λ·x_a + (1−λ)·x_b avec l'étiquette ỹ mélangée par le même λ, où λ est tiré d'une distribution bêta. Cela encourage le modèle à se comporter de manière linéaire entre les exemples, lissant les limites de décision et améliorant le calibrage. CutMix (Yun et al., 2019) coupe à la place une région rectangulaire de l'image B et la colle sur l'image A ; les poids des étiquettes sont définis par la proportion de pixels apportée par chaque image. Parce que CutMix conserve des régions d'image localement cohérentes (plutôt que des mélanges fantomatiques), il préserve la structure spatiale utile tout en obligeant le modèle à s'occuper de plusieurs objets et pièces. Les deux techniques agissent comme de puissants régularisateurs, augmentent la précision des références à l'échelle d'ImageNet et améliorent notamment la robustesse face aux corruptions et aux entrées contradictoires.
Aperçu technique
Les deux méthodes modifient l’objectif de perte, pas seulement l’entrée. L'étiquette devient une cible douce et mixte, de sorte que la perte d'entropie croisée est une combinaison pondérée λ de deux classes - en fait une forme de lissage d'étiquette liée au rapport de mélange des pixels. Dans CutMix, λ est égal à la fraction de pixels non modifiés, calculée à partir de la zone de coupe divisée par la zone totale de l'image, ce qui maintient la proportion de l'étiquette cohérente avec la quantité de chaque image visible.
Impact stratégique
Coût et budget
Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.
Décisions plus claires
La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.
Contrôle qualité
De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.
L’avenir du mixup et de l’augmentation CutMix
L'augmentation basée sur le mix est désormais la norme dans les recettes de classification d'images solides et sous-tend les pipelines de formation modernes pour les transformateurs de vision, qui nécessitent souvent une régularisation importante. La recherche se poursuit sur les variantes tenant compte de la saillance (par exemple, en plaçant des coupes sur les régions informatives), le mixage au niveau des jetons pour les transformateurs et les extensions aux données audio, texte et 3D. Attendez-vous à ce que les stratégies de mixage restent un levier peu coûteux pour améliorer la précision, l’étalonnage et la robustesse à mesure que les architectures sont de plus en plus gourmandes en données.
Mise en œuvre dans le monde réel
Formation des classificateurs ImageNet avec CutMix pour augmenter la précision de premier ordre et améliorer la localisation des objets.
Application de Mixup pour améliorer l'étalonnage du modèle afin que les confiances prédites correspondent mieux à la précision réelle.
Transformateurs de vision fortement régularisés (par exemple, DeiT) avec Mixup et CutMix combinés pour s'entraîner sur des données limitées.
Robustesse accrue face aux corruptions d’images et aux entrées hors distribution dans les systèmes de vision critiques pour la sécurité.
Risques et garde-fous
L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.
Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.
Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.
Feuille de route de mise en œuvre
Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.
Benchmark dans des conditions de charge et de données réalistes.
Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.
Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mixup and CutMix Augmentation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Augmentation du temps de test
Questions fréquemment posées
What is Mixup and CutMix Augmentation?
Mixup et CutMix sont des méthodes d'augmentation des données qui créent de nouveaux exemples de formation en mélangeant deux images et leurs étiquettes. Mixup interpole linéairement des images et des étiquettes entières, tandis que CutMix colle un patch rectangulaire d'une image sur une autre et mélange les étiquettes par zone de patch, ce qui réduit le surajustement et améliore la robustesse.
Comment Mixup crée-t-il un nouvel exemple de formation ?
Le mélange forme x̃ = λx_a + (1−λ)x_b et mélange les étiquettes avec le même λ tiré d'une distribution bêta.
Quelle est la principale différence entre CutMix et Mixup ?
CutMix copie une région rectangulaire d'une image dans une autre, en conservant un contenu localement cohérent plutôt que de créer des images fantômes ensemble.
Dans CutMix, comment est déterminé le poids de mélange (lambda) des étiquettes ?
La proportion de l'étiquette dans CutMix est définie par la zone de la zone collée par rapport à l'image entière, gardant les étiquettes cohérentes avec les pixels visibles.
Outre l’image d’entrée, que modifient Mixup et CutMix ?
Les deux méthodes mélangent également les étiquettes, produisant des cibles souples qui agissent comme une forme de lissage d'étiquettes dépendante des données.
Quelle distribution est couramment utilisée pour échantillonner le coefficient de mélange lambda ?
Mixup et CutMix tirent généralement λ d'une distribution bêta, qui contrôle la force avec laquelle les deux exemples sont mélangés.