PRZEWODNIK techniczny

Nierównowaga klas i ponowne próbkowanie

Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Resampling rebalances the training data so the model actually learns to spot the minority.

Głębokie nurkowanie

Kiedy klasy są wypaczone, model może osiągnąć dokładność na poziomie 99,9%, zawsze przewidując większość i nigdy nie wychwytując ani jednego oszustwa, co jest bezużyteczne. Ponowne próbkowanie ustala rozkład treningu na dwa szerokie sposoby. Nadpróbkowanie powiela lub syntetyzuje przykłady mniejszości — klasyczna technika SMOTE (technika nadpróbkowania mniejszości syntetycznej) tworzy nowe punkty poprzez interpolację między próbką mniejszości a jej najbliższymi sąsiadami z mniejszości, zamiast ich kopiować. Zamiast tego podpróbkowanie odrzuca większość przykładów (losowo lub mądrze za pomocą metod takich jak łącza Tomka lub NearMiss), aby wyrównać sytuację, kosztem wyrzucenia danych. Alternatywy, które pozwalają uniknąć dotykania danych, obejmują ważenie klas (większe karanie błędów mniejszości w funkcji straty) i dostosowywanie progu decyzyjnego po szkoleniu.

Wgląd techniczny

Najważniejsza zasada: próbuj ponownie tylko zbiór szkoleniowy, nigdy zbiór walidacyjny lub testowy i zawsze próbuj ponownie w obrębie fałdów walidacji krzyżowej. Nadmierne próbkowanie przed podziałem powoduje wycieki niemalże zduplikowanych punktów w zestawie testowym i zawyża wyniki. Ponieważ dokładność nie ma tutaj znaczenia, ocena powinna opierać się na precyzji, przypominaniu, F1, AUC precyzyjnego przypominania lub współczynniku korelacji Matthewsa – metrykach, które pozostają uczciwe, gdy klasa dodatnia jest rzadka.

Wpływ strategiczny

Koszt i budżet

Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.

Jaśniejsze decyzje

Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.

Kontrola jakości

Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.

Przyszłość braku równowagi klas i ponownego próbkowania

Ponowne próbkowanie jest coraz bardziej zautomatyzowane w potokach ML, a biblioteki takie jak niezrównoważone uczenie się integrują się bezpośrednio z walidacją krzyżową. Badania zmierzają w kierunku uczenia się uwzględniającego koszty i dostosowanych funkcji strat — takich jak utrata ogniskowa, która zmniejsza wagę prostych przykładów większości — które często przewyższają pierwotne ponowne próbkowanie w głębokich sieciach. W przypadku danych tabelarycznych i obrazów modele generatywne, które syntetyzują realistyczne próbki mniejszości, stają się bardziej wyrafinowanym następcą interpolacji w stylu SMOTE.

Implementacja w świecie rzeczywistym

Szkolenie wykrywacza oszustw związanych z kartami kredytowymi, w przypadku których rzeczywiste oszustwa stanowią znacznie mniej niż 1% transakcji, przy użyciu narzędzia SMOTE w celu wzmocnienia rzadkich przypadków oszustw

Budowa modelu medycznego dla rzadkiej choroby występującej jedynie u kilku procent pacjentów, przy zastosowaniu wag klas, tak aby pominięte przypadki były surowo karane

Wykrywanie wadliwych elementów na linii produkcyjnej, na której prawie wszystkie produkty przechodzą kontrolę, i pobieranie próbek „dobrych” w celu zrównoważenia szkoleń

Oznaczanie rzadkich włamań do sieci w dziennikach cyberbezpieczeństwa zdominowanych przez normalny ruch, oceniane za pomocą AUC Precision-Recall zamiast dokładności

Zagrożenia i poręcze

Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.

Koszty infrastruktury i utrzymania są często niedoszacowane.

W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.

Plan wdrożenia

1

Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.

2

Test porównawczy w realistycznych warunkach obciążenia i danych.

3

Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.

4

Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Class Imbalance and Resampling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Sieci syjamskie i utrata trójek

Często zadawane pytania

What is Class Imbalance and Resampling?

Nierównowaga klas ma miejsce, gdy jeden wynik znacznie przewyższa liczbę innych – np. 99,9% legalnych transakcji w porównaniu z 0,1% oszustw – co skłania modele do ignorowania rzadkiej, ale ważnej klasy. Ponowne próbkowanie ponownie równoważy dane szkoleniowe, dzięki czemu model faktycznie uczy się dostrzegać mniejszość.

Dlaczego zwykła dokładność jest słabą miarą w przypadku wysoce niezrównoważonego problemu klasyfikacji?

Jeśli 99,9% przypadków jest negatywnych, model, który zawsze przewiduje wynik negatywny, uzyskuje dokładność na poziomie 99,9%, wyłapując zero wyników pozytywnych, więc dokładność ukrywa całkowitą porażkę w rzadkiej klasie.

Co robi SMOTE?

SMOTE (technika syntetycznego nadmiernego próbkowania mniejszości) tworzy nowe przykłady mniejszości poprzez interpolację między punktem mniejszości a jego najbliższymi sąsiadami mniejszości, zamiast po prostu je powielać.

Które podejście radzi sobie z brakiem równowagi BEZ zmiany liczby przykładów szkoleniowych?

Ważenie klas pozostawia dane nietknięte, a zamiast tego sprawia, że ​​funkcja straty w większym stopniu karze błędy w klasie mniejszości.

Jakie jest główne ryzyko zastosowania nadmiernego próbkowania przed podziałem danych na zbiory pociągowe i testowe?

Ponowne próbkowanie przed podziałem pozwala na pojawienie się niemal identycznych punktów mniejszościowych zarówno w zestawie pociągowym, jak i testowym, powodując wyciek informacji i wytwarzanie nadmiernie optymistycznych, nierealistycznych wyników.

Jaka jest główna wada losowego podpróbkowania?

Podpróbkowanie równoważy klasy poprzez odrzucanie większości przykładów, co może odrzucić dane informacyjne i zaszkodzić zdolności modelu do uczenia się klasy większości.