GUIDE Technique

Déséquilibre de classe et rééchantillonnage

Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.

2 minutes de lectureDernière mise à jour

Aperçu

Resampling rebalances the training data so the model actually learns to spot the minority.

Plongée profonde

Lorsque les classes sont asymétriques, un modèle peut atteindre une précision de 99,9 % en prédisant toujours la majorité et en ne détectant jamais une seule fraude, ce qui est inutile. Le rééchantillonnage corrige la répartition de la formation de deux manières principales. Le suréchantillonnage duplique ou synthétise les exemples minoritaires – la technique classique SMOTE (Synthetic Minority Over-sampling Technique) crée de nouveaux points en interpolant entre un échantillon minoritaire et ses voisins minoritaires les plus proches plutôt que de les copier. Le sous-échantillonnage élimine à la place les exemples majoritaires (au hasard ou intelligemment via des méthodes telles que les liens Tomek ou NearMiss) pour égaliser les choses, au prix de la suppression des données. Les alternatives qui évitent de toucher aux données incluent la pondération des classes (pénalisant davantage les erreurs minoritaires dans la fonction de perte) et l'ajustement du seuil de décision après la formation.

Aperçu technique

Une règle essentielle : rééchantillonnez uniquement l'ensemble d'entraînement, jamais l'ensemble de validation ou de test, et rééchantillonnez toujours à l'intérieur des plis de validation croisée. Le suréchantillonnage avant la division entraîne des fuites de points presque en double dans l'ensemble de test et gonfle les scores. Parce que l’exactitude n’a aucun sens ici, l’évaluation doit s’appuyer sur la précision, le rappel, la F1, l’AUC de rappel de précision ou le coefficient de corrélation de Matthews – des mesures qui restent honnêtes lorsque la classe positive est rare.

Impact stratégique

Coût et budget

Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.

Décisions plus claires

La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.

Contrôle qualité

De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.

L’avenir du déséquilibre des classes et du rééchantillonnage

Le rééchantillonnage est de plus en plus automatisé dans les pipelines ML, avec des bibliothèques comme déséquilibred-learn s'intégrant directement dans la validation croisée. La recherche s'oriente vers un apprentissage sensible aux coûts et des fonctions de perte personnalisées, telles que la perte focale, qui minimise les exemples majoritaires faciles, qui surpassent souvent le rééchantillonnage brut sur les réseaux profonds. Pour les données tabulaires et images, les modèles génératifs qui synthétisent des échantillons minoritaires réalistes apparaissent comme un successeur plus sophistiqué de l'interpolation de style SMOTE.

Mise en œuvre dans le monde réel

Former un détecteur de fraude par carte de crédit où la fraude véritable représente bien moins de 1 % des transactions, en utilisant SMOTE pour amplifier les cas de fraude rares

Construire un modèle médical pour une maladie rare présente chez seulement quelques pour cent des patients, en appliquant des pondérations de classe afin que les cas manqués soient lourdement pénalisés

Détection des articles défectueux sur une chaîne de fabrication où presque tous les produits passent l'inspection, en sous-échantillonnant les « bons » articles pour équilibrer la formation

Signalement des intrusions réseau rares dans les journaux de cybersécurité dominés par le trafic normal, évalués avec Precision-Recall AUC au lieu de la précision

Risques et garde-fous

L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.

Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.

Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.

Feuille de route de mise en œuvre

1

Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.

2

Benchmark dans des conditions de charge et de données réalistes.

3

Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.

4

Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Class Imbalance and Resampling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Réseaux siamois et perte de triplet

Questions fréquemment posées

What is Class Imbalance and Resampling?

Le déséquilibre de classe se produit lorsqu’un résultat dépasse largement un autre – comme 99,9 % de transactions légitimes contre 0,1 % de fraude – ce qui incite les modèles à ignorer cette classe rare mais importante. Le rééchantillonnage rééquilibre les données d'entraînement afin que le modèle apprenne réellement à repérer la minorité.

Pourquoi la simple précision est-elle une mauvaise mesure pour un problème de classification très déséquilibré ?

Si 99,9 % des cas sont négatifs, un modèle qui prédit toujours le négatif obtient une précision de 99,9 % tout en détectant zéro positif, de sorte que la précision cache un échec total sur la classe rare.

Que fait SMOTE ?

SMOTE (Synthetic Minority Over-sampling Technique) crée de nouveaux exemples minoritaires en interpolant entre un point minoritaire et ses voisins minoritaires les plus proches, plutôt que de simplement les dupliquer.

Quelle approche gère le déséquilibre SANS modifier le nombre d’exemples de formation ?

La pondération des classes laisse les données intactes et fait en sorte que la fonction de perte pénalise plus lourdement les erreurs sur la classe minoritaire.

Quel est le principal risque lié à l’application d’un suréchantillonnage avant de diviser vos données en ensembles d’entraînement et de test ?

Le rééchantillonnage avant la scission laisse apparaître des points minoritaires presque identiques dans les ensembles de train et de test, ce qui entraîne des fuites d'informations et produit des performances trop optimistes et irréalistes.

Quel est le principal inconvénient du sous-échantillonnage aléatoire ?

Le sous-échantillonnage équilibre les classes en supprimant les exemples majoritaires, ce qui peut éliminer les données informatives et nuire à la capacité du modèle à apprendre la classe majoritaire.