Als nächstesNächster Leitfaden
Bootstrap-Resampling
Technisch
Technischer Leitfaden
Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.
Resampling rebalances the training data so the model actually learns to spot the minority.
Wenn die Klassen verzerrt sind, kann ein Modell eine Genauigkeit von 99,9 % erreichen, indem es immer die Mehrheit vorhersagt und niemals einen einzigen Betrug erkennt, was nutzlos ist. Resampling korrigiert die Trainingsverteilung auf zwei Arten. Oversampling dupliziert oder synthetisiert Minderheitsbeispiele – die klassische SMOTE (Synthetic Minority Oversampling Technique) erstellt neue Punkte durch Interpolation zwischen einer Minderheitsstichprobe und ihren nächsten Minderheitsnachbarn, anstatt sie zu kopieren. Stattdessen werden bei der Unterabtastung Mehrheitsbeispiele (zufällig oder intelligent über Methoden wie Tomek-Links oder NearMiss) verworfen, um die Ergebnisse auszugleichen, allerdings auf Kosten der Datenvernichtung. Zu den Alternativen, die eine Berührung der Daten vermeiden, gehören die Klassengewichtung (wobei Minderheitsfehler in der Verlustfunktion stärker bestraft werden) und die Anpassung der Entscheidungsschwelle nach dem Training.
Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.
Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.
Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.
Das Resampling wird innerhalb von ML-Pipelines zunehmend automatisiert, wobei Bibliotheken wie imbalanced-learn direkt in die Kreuzvalidierung integriert werden. Die Forschung verlagert sich in Richtung kostensensitives Lernen und maßgeschneiderte Verlustfunktionen – wie z. B. Fokusverlust, der einfache Mehrheitsbeispiele herabsetzt –, die in tiefen Netzwerken oft eine bessere Leistung als grobes Resampling erbringen. Für Tabellen- und Bilddaten erweisen sich generative Modelle, die realistische Minderheitsstichproben synthetisieren, als ausgefeiltere Nachfolger der Interpolation im SMOTE-Stil.
Schulung eines Kreditkartenbetrugsdetektors, bei dem echter Betrug weit unter 1 % der Transaktionen ausmacht, unter Verwendung von SMOTE, um die seltenen Betrugsfälle zu verstärken
Erstellen eines medizinischen Modells für eine seltene Krankheit, die nur bei wenigen Prozent der Patienten auftritt, unter Verwendung von Klassengewichtungen, sodass übersehene Fälle stark bestraft werden
Erkennen fehlerhafter Artikel in einer Fertigungslinie, in der fast alle Produkte die Prüfung bestehen, wobei die „guten“ Artikel unterbewertet werden, um die Schulung auszugleichen
Kennzeichnung seltener Netzwerkeinbrüche in Cybersicherheitsprotokollen, die von normalem Datenverkehr dominiert werden, bewertet mit Precision-Recall AUC statt mit Genauigkeit
Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.
Infrastruktur- und Wartungskosten werden oft unterschätzt.
Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.
Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.
Benchmark unter realistischen Last- und Datenbedingungen.
Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.
Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Von einem Klassenungleichgewicht spricht man, wenn ein Ergebnis das andere bei weitem übersteigt – etwa 99,9 % legitime Transaktionen gegenüber 0,1 % Betrug –, was Modelle dazu verleitet, die seltene, aber wichtige Klasse zu ignorieren. Durch Resampling werden die Trainingsdaten neu ausbalanciert, sodass das Modell tatsächlich lernt, die Minderheit zu erkennen.
Wenn 99,9 % der Fälle negativ sind, erreicht ein Modell, das immer Negatives vorhersagt, eine Genauigkeit von 99,9 %, während es keine positiven Ergebnisse erfasst, sodass die Genauigkeit einen Totalausfall in der seltenen Klasse verbirgt.
SMOTE (Synthetic Minority Oversampling Technique) erstellt neue Minderheitsbeispiele durch Interpolation zwischen einem Minderheitspunkt und seinen nächsten Minderheitsnachbarn, anstatt sie einfach zu duplizieren.
Durch die Klassengewichtung bleiben die Daten unberührt und die Verlustfunktion bestraft stattdessen Fehler in der Minderheitsklasse stärker.
Durch erneutes Abtasten vor der Aufteilung erscheinen nahezu identische Minderheitspunkte sowohl im Zug- als auch im Testsatz, wodurch Informationen verloren gehen und eine übermäßig optimistische, unrealistische Leistung entsteht.
Durch Unterabtastung werden Klassen ausgeglichen, indem Mehrheitsbeispiele verworfen werden. Dadurch können informative Daten verworfen werden und die Fähigkeit des Modells, die Mehrheitsklasse zu lernen, beeinträchtigt werden.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
Bootstrap-Resampling
Technisch