Nierównowaga klas i ponowne próbkowanie
Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.
Przegląd
Resampling rebalances the training data so the model actually learns to spot the minority.
Głębokie nurkowanie
Kiedy klasy są wypaczone, model może osiągnąć dokładność na poziomie 99,9%, zawsze przewidując większość i nigdy nie wychwytując ani jednego oszustwa, co jest bezużyteczne. Ponowne próbkowanie ustala rozkład treningu na dwa szerokie sposoby. Nadpróbkowanie powiela lub syntetyzuje przykłady mniejszości — klasyczna technika SMOTE (technika nadpróbkowania mniejszości syntetycznej) tworzy nowe punkty poprzez interpolację między próbką mniejszości a jej najbliższymi sąsiadami z mniejszości, zamiast ich kopiować. Zamiast tego podpróbkowanie odrzuca większość przykładów (losowo lub mądrze za pomocą metod takich jak łącza Tomka lub NearMiss), aby wyrównać sytuację, kosztem wyrzucenia danych. Alternatywy, które pozwalają uniknąć dotykania danych, obejmują ważenie klas (większe karanie błędów mniejszości w funkcji straty) i dostosowywanie progu decyzyjnego po szkoleniu.
Wgląd techniczny
Najważniejsza zasada: próbuj ponownie tylko zbiór szkoleniowy, nigdy zbiór walidacyjny lub testowy i zawsze próbuj ponownie w obrębie fałdów walidacji krzyżowej. Nadmierne próbkowanie przed podziałem powoduje wycieki niemalże zduplikowanych punktów w zestawie testowym i zawyża wyniki. Ponieważ dokładność nie ma tutaj znaczenia, ocena powinna opierać się na precyzji, przypominaniu, F1, AUC precyzyjnego przypominania lub współczynniku korelacji Matthewsa – metrykach, które pozostają uczciwe, gdy klasa dodatnia jest rzadka.
Wpływ strategiczny
Koszt i budżet
Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.
Jaśniejsze decyzje
Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.
Kontrola jakości
Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.
Przyszłość braku równowagi klas i ponownego próbkowania
Ponowne próbkowanie jest coraz bardziej zautomatyzowane w potokach ML, a biblioteki takie jak niezrównoważone uczenie się integrują się bezpośrednio z walidacją krzyżową. Badania zmierzają w kierunku uczenia się uwzględniającego koszty i dostosowanych funkcji strat — takich jak utrata ogniskowa, która zmniejsza wagę prostych przykładów większości — które często przewyższają pierwotne ponowne próbkowanie w głębokich sieciach. W przypadku danych tabelarycznych i obrazów modele generatywne, które syntetyzują realistyczne próbki mniejszości, stają się bardziej wyrafinowanym następcą interpolacji w stylu SMOTE.
Implementacja w świecie rzeczywistym
Szkolenie wykrywacza oszustw związanych z kartami kredytowymi, w przypadku których rzeczywiste oszustwa stanowią znacznie mniej niż 1% transakcji, przy użyciu narzędzia SMOTE w celu wzmocnienia rzadkich przypadków oszustw
Budowa modelu medycznego dla rzadkiej choroby występującej jedynie u kilku procent pacjentów, przy zastosowaniu wag klas, tak aby pominięte przypadki były surowo karane
Wykrywanie wadliwych elementów na linii produkcyjnej, na której prawie wszystkie produkty przechodzą kontrolę, i pobieranie próbek „dobrych” w celu zrównoważenia szkoleń
Oznaczanie rzadkich włamań do sieci w dziennikach cyberbezpieczeństwa zdominowanych przez normalny ruch, oceniane za pomocą AUC Precision-Recall zamiast dokładności
Zagrożenia i poręcze
Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.
Koszty infrastruktury i utrzymania są często niedoszacowane.
W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.
Plan wdrożenia
Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.
Test porównawczy w realistycznych warunkach obciążenia i danych.
Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.
Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Class Imbalance and Resampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Sieci syjamskie i utrata trójek
Często zadawane pytania
What is Class Imbalance and Resampling?
Nierównowaga klas ma miejsce, gdy jeden wynik znacznie przewyższa liczbę innych – np. 99,9% legalnych transakcji w porównaniu z 0,1% oszustw – co skłania modele do ignorowania rzadkiej, ale ważnej klasy. Ponowne próbkowanie ponownie równoważy dane szkoleniowe, dzięki czemu model faktycznie uczy się dostrzegać mniejszość.
Dlaczego zwykła dokładność jest słabą miarą w przypadku wysoce niezrównoważonego problemu klasyfikacji?
Jeśli 99,9% przypadków jest negatywnych, model, który zawsze przewiduje wynik negatywny, uzyskuje dokładność na poziomie 99,9%, wyłapując zero wyników pozytywnych, więc dokładność ukrywa całkowitą porażkę w rzadkiej klasie.
Co robi SMOTE?
SMOTE (technika syntetycznego nadmiernego próbkowania mniejszości) tworzy nowe przykłady mniejszości poprzez interpolację między punktem mniejszości a jego najbliższymi sąsiadami mniejszości, zamiast po prostu je powielać.
Które podejście radzi sobie z brakiem równowagi BEZ zmiany liczby przykładów szkoleniowych?
Ważenie klas pozostawia dane nietknięte, a zamiast tego sprawia, że funkcja straty w większym stopniu karze błędy w klasie mniejszości.
Jakie jest główne ryzyko zastosowania nadmiernego próbkowania przed podziałem danych na zbiory pociągowe i testowe?
Ponowne próbkowanie przed podziałem pozwala na pojawienie się niemal identycznych punktów mniejszościowych zarówno w zestawie pociągowym, jak i testowym, powodując wyciek informacji i wytwarzanie nadmiernie optymistycznych, nierealistycznych wyników.
Jaka jest główna wada losowego podpróbkowania?
Podpróbkowanie równoważy klasy poprzez odrzucanie większości przykładów, co może odrzucić dane informacyjne i zaszkodzić zdolności modelu do uczenia się klasy większości.