Műszaki ÚTMUTATÓ

Osztálykiegyensúlyozatlanság és újramintavételezés

Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.

2 perc olvasásUtoljára frissítve

Áttekintés

Resampling rebalances the training data so the model actually learns to spot the minority.

Mély merülés

Ha az osztályok torzak, a modell 99,9%-os pontosságot érhet el, ha mindig megjósolja a többséget, és soha egyetlen csalást sem kap el, ami haszontalan. Az újramintavételezés kétféle módon rögzíti a képzési eloszlást. A túlmintavétel megkettőzi vagy szintetizálja a kisebbségi példákat – a klasszikus SMOTE (Synthetic Minority Over-sampling Technique) új pontokat hoz létre a kisebbségi minta és a legközelebbi kisebbségi szomszédok közötti interpolációval, ahelyett, hogy másolná őket. Az alulmintavételezés ehelyett elveti a többségi példákat (véletlenszerűen vagy intelligensen olyan módszerekkel, mint a Tomek linkek vagy a NearMiss), hogy kiegyenlítse a dolgokat, az adatok kidobása árán. Az adatok érintését elkerülő alternatívák közé tartozik az osztálysúlyozás (a veszteségfüggvényben a kisebbségi hibák fokozottabb büntetése) és a döntési küszöb edzés utáni módosítása.

Technikai betekintés

Egy kritikus szabály: csak a betanító készletből vegyen újra a mintát, soha ne az érvényesítési vagy tesztkészletet, és mindig vegyen újra mintát a keresztellenőrzési hajtásokon belül. A felosztás előtti túlmintavételezés majdnem duplikált pontokat eredményez a tesztkészletben, és növeli a pontszámokat. Mivel a pontosság itt értelmetlen, az értékelésnek a pontosságra, a visszahívásra, az F1-re, a Precision-Recall AUC-ra vagy a Matthews-korrelációs együtthatóra kell támaszkodnia – olyan mérőszámokra, amelyek becsületesek maradnak, ha ritka a pozitív osztály.

Stratégiai hatás

Költség és költségvetés

Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.

Tisztább döntések

A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.

Minőségellenőrzés

A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.

Az osztálykiegyensúlyozatlanság és az újramintavétel jövője

Az újramintavételezés egyre inkább automatizálódik az ML folyamatokon belül, és az olyan könyvtárak, mint az egyensúlytalan tanulás közvetlenül integrálódnak a keresztellenőrzésbe. A kutatás a költségérzékeny tanulás és a testre szabott veszteségi függvények irányába tolódik el – mint például a fókuszvesztés, amely a könnyű többségi példákat lenyomja –, amelyek gyakran felülmúlják a mély hálózatokon végzett nyers újramintavételezést. A táblázatos és képi adatokhoz a valósághű kisebbségi mintákat szintetizáló generatív modellek a SMOTE-stílusú interpoláció kifinomultabb utódjaként jelennek meg.

Valós megvalósítás

A hitelkártya-csalás észlelőjének betanítása, ahol a valódi csalás jóval kevesebb, mint a tranzakciók 1%-a, a SMOTE használata a ritka csalási esetek felerősítésére

Egy olyan ritka betegség orvosi modelljének felépítése, amely a betegek csak néhány százalékában fordul elő, osztálysúlyok alkalmazása, így a kihagyott esetek súlyos büntetést kapnak.

Hibás tételek észlelése egy olyan gyártósoron, ahol szinte minden termék átmegy az ellenőrzésen, alulmintavétel a „jó” cikkekből a képzés egyensúlya érdekében

Ritka hálózati behatolások megjelölése a normál forgalom által dominált kiberbiztonsági naplókban, pontosság helyett Precision-Recall AUC-vel értékelve

Kockázatok és védőkorlátok

Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.

Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.

A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.

Végrehajtási ütemterv

1

Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.

2

Benchmark reális terhelési és adatviszonyok mellett.

3

Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.

4

A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Class Imbalance and Resampling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Sziámi hálózatok és hármasok elvesztése

Gyakran ismételt kérdések

What is Class Imbalance and Resampling?

Az osztályok kiegyensúlyozatlansága az, amikor az egyik eredmény nagymértékben meghaladja a másikat – például a jogszerű tranzakciók 99,9%-a a 0,1%-os csalással szemben –, ami ráveszi a modelleket, hogy figyelmen kívül hagyják a ritka, de fontos osztályt. Az újramintavételezés újraegyensúlyozza a betanítási adatokat, így a modell ténylegesen megtanulja felismerni a kisebbséget.

Miért rossz a sima pontosság egy erősen kiegyensúlyozatlan osztályozási probléma esetén?

Ha az esetek 99,9%-a negatív, akkor egy olyan modell, amely mindig negatívat jósol, 99,9%-os pontosságot kap, miközben nulla pozitívat kap, tehát a pontosság elrejti a ritka osztály teljes meghibásodását.

Mit csinál a SMOTE?

A SMOTE (Synthetic Minority Over-sampling Technique) új kisebbségi példákat hoz létre egy kisebbségi pont és a legközelebbi kisebbségi szomszédok közötti interpolációval, ahelyett, hogy egyszerűen megkettőzné őket.

Melyik megközelítés kezeli az egyensúlyhiányt a képzési példák számának megváltoztatása nélkül?

Az osztálysúlyozás érintetlenül hagyja az adatokat, és ehelyett a veszteségfüggvényt erősebben bünteti a kisebbségi osztály hibáiért.

Mi a fő kockázata annak, ha túlmintavételt alkalmazunk, mielőtt az adatokat vonat- és tesztkészletekre bontja?

A felosztás előtti újramintavételezés lehetővé teszi, hogy közel azonos kisebbségi pontok jelenjenek meg mind a vonat-, mind a tesztkészletekben, információszivárogva és túlságosan optimista, irreális teljesítményt produkálva.

Mi a véletlenszerű alulmintavétel fő hátránya?

Az alulmintavétel kiegyensúlyozza az osztályokat a többségi példák kidobásával, ami elvetheti az informatív adatokat, és ronthatja a modell azon képességét, hogy megtanulja a többségi osztályt.