Technische GIDS

Mixup en CutMix-vergroting

Mixup en CutMix zijn methoden voor gegevensvergroting die nieuwe trainingsvoorbeelden creëren door twee afbeeldingen en hun labels te combineren.

2 min readLaatst bijgewerkt

Overzicht

Mixup linearly interpolates whole images and labels, while CutMix pastes a rectangular patch from one image onto another and mixes labels by patch area — both reduce overfitting and improve robustness.

Diepe duik

Mixup (Zhang et al., 2017) vormt een nieuw monster als x̃ = λ·x_a + (1−λ)·x_b met het label ỹ gemengd met dezelfde λ, waarbij λ afkomstig is uit een bètaverdeling. Dit moedigt het model aan om zich lineair tussen voorbeelden te gedragen, waardoor beslissingsgrenzen worden afgevlakt en de kalibratie wordt verbeterd. CutMix (Yun et al., 2019) knipt in plaats daarvan een rechthoekig gebied uit afbeelding B en plakt dit op afbeelding A; de labelgewichten worden bepaald door het aantal pixels dat elke afbeelding bijdraagt. Omdat CutMix lokaal coherente beeldgebieden behoudt (in plaats van spookachtige overvloeiingen), behoudt het een nuttige ruimtelijke structuur terwijl het model nog steeds wordt gedwongen aandacht te besteden aan meerdere objecten en onderdelen. Beide technieken fungeren als sterke regularisatoren, verhogen de nauwkeurigheid van benchmarks op ImageNet-schaal en verbeteren met name de robuustheid tegen corruptie en vijandige input.

Technisch inzicht

Beide methoden wijzigen het verliesdoel, niet alleen de invoer. Het label wordt een zacht, gemengd doelwit, dus het cross-entropieverlies is een λ-gewogen combinatie van twee klassen - in feite een vorm van labelvereffening gekoppeld aan de pixelmengverhouding. In CutMix is ​​λ gelijk aan de fractie van ongewijzigde pixels, berekend op basis van het snijkadergebied gedeeld door het totale afbeeldingsgebied, waardoor de labelverhouding consistent blijft met hoeveel van elke afbeelding zichtbaar is.

Strategische impact

Cost and budget

Architectuurbeslissingen bepalen jarenlang de prestaties en bedrijfskosten.

Clearer decisions

Technisch onderwijs helpt teams bij het kiezen van de juiste stapel, niet alleen de nieuwste.

Quality control

Betere technische keuzes verminderen het aantal betrouwbaarheidsincidenten in de productie.

De toekomst van Mixup en CutMix-augmentatie

Op mixen gebaseerde augmentatie is nu standaard in krachtige recepten voor beeldclassificatie en ondersteunt moderne trainingspijplijnen voor visietransformatoren, die vaak zware regularisatie nodig hebben. Er wordt onderzoek gedaan naar varianten die zich bewust zijn van de opvallendheid (bijvoorbeeld het plaatsen van bezuinigingen op informatieve gebieden), mixen op tokenniveau voor transformatoren en uitbreidingen van audio-, tekst- en 3D-gegevens. Verwacht dat mengstrategieën een goedkope hefboom zullen blijven voor het vergroten van de nauwkeurigheid, kalibratie en robuustheid naarmate architecturen steeds meer data-hongerig worden.

Implementatie in de echte wereld

ImageNet-classificatoren trainen met CutMix om de top-1-nauwkeurigheid te verhogen en de lokalisatie van objecten te verbeteren.

Het toepassen van Mixup om de modelkalibratie te verbeteren, zodat de voorspelde betrouwbaarheid beter overeenkomt met de werkelijke nauwkeurigheid.

Zwaar regulariserende zichttransformatoren (bijv. DeiT) met gecombineerde Mixup en CutMix om te trainen op beperkte gegevens.

Het vergroten van de robuustheid van beeldcorrupties en niet-distributie-inputs in veiligheidskritische zichtsystemen.

Risico's en vangrails

Het optimaliseren van één benchmark kan bredere systeemzwakheden verbergen.

Infrastructuur- en onderhoudskosten worden vaak onderschat.

De lacunes op het gebied van beveiliging en waarneembaarheid kunnen groter worden naarmate systemen complexer worden.

Implementatie routekaart

1

Definieer latentie-, kwaliteits- en kostendoelen vóór implementatie.

2

Benchmark onder realistische belasting- en gegevensomstandigheden.

3

Instrumentbewaking op fouten, drift en gebruikersimpact.

4

Bereid rollback- en incidentresponspaden voor voordat u gaat schalen.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixup and CutMix Augmentation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Testtijdvergroting

Frequently asked questions

What is Mixup and CutMix Augmentation?

Mixup en CutMix zijn methoden voor gegevensvergroting die nieuwe trainingsvoorbeelden creëren door twee afbeeldingen en hun labels te combineren. Mixup interpoleert lineair hele afbeeldingen en labels, terwijl CutMix een rechthoekige patch van de ene afbeelding op de andere plakt en labels per patchgebied mengt - beide verminderen overfitting en verbeteren de robuustheid.

Hoe maakt Mixup een nieuw trainingsvoorbeeld?

Mixup vormt x̃ = λx_a + (1−λ)x_b en mengt de labels met dezelfde λ uit een bètadistributie.

Wat is het belangrijkste verschil tussen CutMix en Mixup?

CutMix kopieert een rechthoekig gebied van de ene afbeelding naar de andere, waardoor de lokaal coherente inhoud behouden blijft in plaats van twee afbeeldingen samen te voegen.

Hoe wordt in CutMix het menggewicht (lambda) voor de etiketten bepaald?

De labelverhouding in CutMix wordt bepaald door het gebied van het geplakte kader ten opzichte van de hele afbeelding, waardoor labels consistent blijven met zichtbare pixels.

Wat veranderen Mixup en CutMix nog meer, behalve de invoerafbeelding?

Beide methoden combineren de labels ook, waardoor zachte doelen ontstaan ​​die fungeren als een gegevensafhankelijke vorm van labelvereffening.

Welke verdeling wordt gewoonlijk gebruikt om de mengcoëfficiënt lambda te bemonsteren?

Mixup en CutMix halen doorgaans λ uit een bètadistributie, die bepaalt hoe sterk de twee voorbeelden worden gemengd.