Mixup a CutMix Augmentace
Mixup a CutMix jsou metody pro rozšiřování dat, které vytvářejí nové příklady školení smícháním dvou obrázků a jejich štítků.
Přehled
Mixup lineárně interpoluje celé obrázky a štítky, zatímco CutMix vkládá pravoúhlou záplatu z jednoho obrázku na druhý a míchá štítky podle oblastí záplaty – oboje omezuje přepasování a zlepšuje robustnost.
Hluboký ponor
Mixup (Zhang et al., 2017) tvoří nový vzorek jako x̃ = λ·x_a + (1−λ)·x_b se značkou ỹ smíchanou se stejným λ, kde λ je čerpáno z distribuce Beta. To povzbuzuje model, aby se choval lineárně mezi příklady, vyhlazuje hranice rozhodování a zlepšuje kalibraci. CutMix (Yun et al., 2019) místo toho vyřízne obdélníkovou oblast z obrázku B a vloží ji na obrázek A; váhy štítků jsou nastaveny poměrem pixelů, kterými každý obrázek přispívá. Protože CutMix zachovává lokálně koherentní oblasti obrazu (spíše než strašidelné prolnutí), zachovává užitečnou prostorovou strukturu a přitom stále nutí model věnovat se více objektům a dílům. Obě techniky fungují jako silné regularizátory, zvyšují přesnost benchmarků ImageNet a výrazně zlepšují odolnost vůči korupcím a nepřátelským vstupům.
Technický přehled
Obě metody upravují cíl ztráty, nejen vstup. Štítek se stává měkkým, smíšeným cílem, takže ztráta křížové entropie je λ-vážená kombinace dvou tříd – v podstatě forma vyhlazení štítku spojená s poměrem míšení pixelů. V CutMix se λ rovná podílu nezměněných obrazových bodů, vypočítanému z plochy oříznutého rámečku dělené celkovou plochou obrazu, což udržuje proporce štítku konzistentní s tím, jak velká část každého obrazu je viditelná.
Strategický dopad
Cena a rozpočet
Rozhodnutí o architektuře zvyšují výkon a provozní náklady po mnoho let.
Jasnější rozhodnutí
Technické vzdělání pomáhá týmům vybrat ten správný stack, nejen ten nejnovější.
Kontrola kvality
Lepší konstrukční volby snižují výskyt problémů se spolehlivostí ve výrobě.
Budoucnost Mixup a CutMix Augmentace
Rozšíření založené na mixu je nyní standardem v receptech na silnou klasifikaci obrazu a je základem moderních tréninkových kanálů pro transformátory vidění, které často vyžadují velkou regularizaci. Pokračuje výzkum variant s důrazem na význačnost (např. umístění výřezů na informativní oblasti), míchání na úrovni tokenů pro transformátory a rozšíření pro zvuk, text a 3D data. Očekávejte, že strategie mixování zůstanou levnou pákou pro zvýšení přesnosti, kalibrace a robustnosti, protože architektury budou stále více náročné na data.
Real-World Implementace
Školení klasifikátorů ImageNet pomocí CutMix pro zvýšení přesnosti 1 a zlepšení lokalizace objektů.
Použití Mixup ke zlepšení kalibrace modelu tak, aby předpokládané spolehlivosti lépe odpovídaly skutečné přesnosti.
Silně regularizující transformátory vidění (např. DeiT) s kombinací Mixup a CutMix pro trénování na omezených datech.
Zvýšení odolnosti vůči poškození obrazu a vstupům mimo distribuci v systémech vidění kritických z hlediska bezpečnosti.
Rizika a zábradlí
Optimalizace jednoho benchmarku může skrýt širší systémové slabiny.
Náklady na infrastrukturu a údržbu jsou často podceňovány.
Mezery v zabezpečení a pozorovatelnosti se mohou zvětšovat, jak se systémy stávají složitějšími.
Plán implementace
Před implementací definujte cíle latence, kvality a nákladů.
Benchmark za realistických podmínek zatížení a dat.
Monitorování chyb, posunu a dopadu na uživatele.
Před škálováním připravte cesty vrácení zpět a reakce na incidenty.
Pokračujte v objevování
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mixup and CutMix Augmentation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Další průvodce
Rozšíření doby testu
Často kladené otázky
Co je Mixup a CutMix Augmentace?
Mixup a CutMix jsou metody pro rozšiřování dat, které vytvářejí nové příklady školení smícháním dvou obrázků a jejich štítků. Mixup lineárně interpoluje celé obrázky a štítky, zatímco CutMix vkládá pravoúhlou záplatu z jednoho obrázku na druhý a míchá štítky podle oblastí záplaty – oboje omezuje překrytí a zlepšuje robustnost.
Jak Mixup vytvoří nový příklad školení?
Míchání tvoří x̃ = λx_a + (1−λ)x_b a míchá štítky se stejným λ čerpaným z distribuce Beta.
Jaký je hlavní rozdíl mezi CutMix a Mixup?
CutMix zkopíruje pravoúhlou oblast z jednoho obrázku do druhého, přičemž zachová lokálně koherentní obsah místo toho, aby se dva obrázky spojily.
Jak se v CutMix určuje hmotnost míchání (lambda) pro etikety?
Poměr štítků v CutMix je nastaven podle plochy vloženého rámečku vzhledem k celému obrázku, přičemž štítky jsou konzistentní s viditelnými pixely.
Co kromě vstupního obrázku ještě Mixup a CutMix upravují?
Obě metody také míchají štítky a vytvářejí měkké cíle, které fungují jako forma vyhlazování štítků závislá na datech.
Která distribuce se běžně používá pro vzorkování směšovacího koeficientu lambda?
Mixup a CutMix obvykle čerpají λ z distribuce Beta, která řídí, jak silně jsou tyto dva příklady smíchány.