Klasse-onbalans en herbemonstering
Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.
Overzicht
Resampling rebalances the training data so the model actually learns to spot the minority.
Diepe duik
Wanneer de klassen scheef zijn, kan een model een nauwkeurigheid van 99,9% bereiken door altijd de meerderheid te voorspellen en nooit één enkele fraude te ontdekken, wat nutteloos is. Resampling corrigeert de trainingsverdeling op twee brede manieren. Oversampling dupliceert of synthetiseert minderheidsvoorbeelden - de klassieke SMOTE (Synthetic Minority Over-sampling Technique) creëert nieuwe punten door te interpoleren tussen een minderheidssample en de dichtstbijzijnde minderheidsburen in plaats van ze te kopiëren. Bij undersampling worden de meerderheidsvoorbeelden genegeerd (willekeurig, of slim via methoden als Tomek-links of NearMiss) om de zaken gelijk te trekken, ten koste van het weggooien van gegevens. Alternatieven die voorkomen dat de gegevens worden aangeraakt, zijn onder meer klassenweging (waarbij minderheidsfouten meer worden bestraft in de verliesfunctie) en het aanpassen van de beslissingsdrempel na de training.
Technisch inzicht
Een cruciale regel: resample alleen de trainingsset, nooit de validatie- of testset, en resample altijd binnen de kruisvalidatieplooien. Overbemonstering vóór het splitsen lekt bijna dubbele punten in de testset en verhoogt de scores. Omdat nauwkeurigheid hier zinloos is, moet de evaluatie vertrouwen op precisie, herinnering, F1, de Precision-Recall AUC of de Matthews-correlatiecoëfficiënt – meetgegevens die eerlijk blijven als de positieve klasse zeldzaam is.
Strategische impact
Cost and budget
Architectuurbeslissingen bepalen jarenlang de prestaties en bedrijfskosten.
Clearer decisions
Technisch onderwijs helpt teams bij het kiezen van de juiste stapel, niet alleen de nieuwste.
Quality control
Betere technische keuzes verminderen het aantal betrouwbaarheidsincidenten in de productie.
De toekomst van klassenonevenwicht en resampling
Resampling wordt steeds meer geautomatiseerd binnen ML-pijplijnen, waarbij bibliotheken zoals onevenwichtig leren rechtstreeks worden geïntegreerd in kruisvalidatie. Onderzoek verschuift naar kostengevoelig leren en op maat gemaakte verliesfuncties – zoals focal loss, waarbij eenvoudige meerderheidsvoorbeelden worden verkleind – die vaak beter presteren dan ruwe resampling op diepe netwerken. Voor tabel- en beeldgegevens komen generatieve modellen die realistische minderheidsmonsters synthetiseren naar voren als een meer geavanceerde opvolger van interpolatie in SMOTE-stijl.
Implementatie in de echte wereld
Het trainen van een creditcardfraudedetector waarbij echte fraude ruim onder de 1% van de transacties voorkomt, waarbij SMOTE wordt gebruikt om de zeldzame gevallen van fraude te versterken
Het bouwen van een medisch model voor een zeldzame ziekte die slechts bij een paar procent van de patiënten voorkomt, waarbij klassegewichten worden toegepast, zodat gemiste gevallen zwaar worden bestraft
Het detecteren van defecte artikelen op een productielijn waar bijna alle producten de inspectie doorstaan, waarbij de 'goede' artikelen te weinig worden bemonsterd om de training in evenwicht te brengen
Het markeren van zeldzame netwerkinbraken in cyberbeveiligingslogboeken die worden gedomineerd door normaal verkeer, geëvalueerd met Precision-Recall AUC in plaats van nauwkeurigheid
Risico's en vangrails
Het optimaliseren van één benchmark kan bredere systeemzwakheden verbergen.
Infrastructuur- en onderhoudskosten worden vaak onderschat.
De lacunes op het gebied van beveiliging en waarneembaarheid kunnen groter worden naarmate systemen complexer worden.
Implementatie routekaart
Definieer latentie-, kwaliteits- en kostendoelen vóór implementatie.
Benchmark onder realistische belasting- en gegevensomstandigheden.
Instrumentbewaking op fouten, drift en gebruikersimpact.
Bereid rollback- en incidentresponspaden voor voordat u gaat schalen.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Class Imbalance and Resampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Siamese netwerken en tripletverlies
Frequently asked questions
What is Class Imbalance and Resampling?
Er is sprake van een onevenwicht tussen klassen als de ene uitkomst veel groter is dan de andere – zoals 99,9% legitieme transacties versus 0,1% fraude – waardoor modellen de zeldzame maar belangrijke klasse negeren. Resampling brengt de trainingsgegevens opnieuw in evenwicht, zodat het model daadwerkelijk de minderheid leert herkennen.
Waarom is pure nauwkeurigheid een slechte maatstaf voor een zeer onevenwichtig classificatieprobleem?
Als 99,9% van de gevallen negatief is, krijgt een model dat altijd negatief voorspelt een nauwkeurigheid van 99,9% terwijl het nul-positieve resultaten behaalt. De nauwkeurigheid verbergt dus een totale mislukking in de zeldzame klasse.
Wat doet SMOTE?
SMOTE (Synthetic Minority Over-sampling Technique) creëert nieuwe minderheidsvoorbeelden door te interpoleren tussen een minderheidspunt en de dichtstbijzijnde minderheidsburen, in plaats van ze eenvoudigweg te dupliceren.
Welke aanpak pakt onbalans aan ZONDER het aantal trainingsvoorbeelden te veranderen?
Door klassenweging blijven de gegevens onaangeroerd en worden fouten voor de minderheidsklasse in plaats daarvan zwaarder bestraft door de verliesfunctie.
Wat is een belangrijk risico bij het toepassen van oversampling voordat uw gegevens worden opgesplitst in trein- en testsets?
Door opnieuw te samplen vóór de splitsing verschijnen vrijwel identieke minderheidspunten in zowel trein- als testsets, waardoor informatie lekt en te optimistische, onrealistische prestaties worden geproduceerd.
Wat is het belangrijkste nadeel van willekeurige onderbemonstering?
Onderbemonstering brengt klassen in evenwicht door meerderheidsvoorbeelden weg te gooien, waardoor informatieve gegevens kunnen worden weggegooid en het vermogen van het model om de meerderheidsklasse te leren wordt aangetast.