Squilibrio di classe e ricampionamento
Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.
Panoramica
Resampling rebalances the training data so the model actually learns to spot the minority.
Immersione profonda
When classes are skewed, a model can hit 99.9% accuracy by always predicting the majority and never catching a single fraud, which is useless. Il ricampionamento fissa la distribuzione dell'addestramento in due modi generali. Il sovracampionamento duplica o sintetizza esempi minoritari: il classico SMOTE (Synthetic Minority Over-sampling Technique) crea nuovi punti interpolando tra un campione minoritario e i suoi vicini minoritari più vicini invece di copiarli. Il sottocampionamento invece scarta gli esempi della maggioranza (in modo casuale o in modo intelligente tramite metodi come i collegamenti Tomek o NearMiss) per pareggiare le cose, a costo di buttare via i dati. Le alternative che evitano di toccare i dati includono la ponderazione della classe (penalizzare maggiormente gli errori di minoranza nella funzione di perdita) e l’adeguamento della soglia decisionale dopo la formazione.
Approfondimento tecnico
Una regola fondamentale: ricampionare solo il set di training, mai il set di validazione o di test, e ricampionare sempre all'interno delle pieghe di convalida incrociata. Il sovracampionamento prima della suddivisione fa filtrare punti quasi duplicati nel set di test e aumenta i punteggi. Poiché in questo caso l'accuratezza non ha senso, la valutazione dovrebbe basarsi su precisione, richiamo, F1, AUC precisione-richiamo o coefficiente di correlazione di Matthews: parametri che rimangono onesti quando la classe positiva è rara.
Impatto strategico
Costo e budget
Le decisioni relative all'architettura determinano prestazioni e costi operativi per anni.
Decisioni più chiare
La formazione tecnica aiuta i team a scegliere lo stack giusto, non solo quello più nuovo.
Controllo di qualità
Migliori scelte ingegneristiche riducono gli incidenti legati all’affidabilità nella produzione.
Il futuro dello squilibrio di classe e del ricampionamento
Il ricampionamento è sempre più automatizzato all'interno delle pipeline ML, con librerie come l'apprendimento sbilanciato che si integrano direttamente nella convalida incrociata. La ricerca si sta spostando verso l’apprendimento sensibile ai costi e funzioni di perdita su misura – come la perdita focale, che ridimensiona gli esempi di maggioranza facile – che spesso superano il ricampionamento grezzo su reti profonde. Per i dati tabellari e di immagine, i modelli generativi che sintetizzano campioni minoritari realistici stanno emergendo come successori più sofisticati dell’interpolazione in stile SMOTE.
Implementazione nel mondo reale
Formazione di un rilevatore di frodi con carte di credito in cui le frodi autentiche sono ben al di sotto dell'1% delle transazioni, utilizzando SMOTE per amplificare i rari casi di frode
Costruire un modello medico per una malattia rara presente solo in una piccola percentuale di pazienti, applicando i pesi delle classi in modo che i casi persi siano pesantemente penalizzati
Rilevamento di articoli difettosi su una linea di produzione in cui quasi tutti i prodotti superano l'ispezione, sottocampionando gli articoli "buoni" per bilanciare la formazione
Segnalazione di rare intrusioni di rete nei log di sicurezza informatica dominati dal traffico normale, valutati con Precision-Recall AUC anziché con accuratezza
Rischi e guardrail
L'ottimizzazione di un benchmark può nascondere debolezze di sistema più ampie.
I costi delle infrastrutture e della manutenzione sono spesso sottostimati.
Le lacune in termini di sicurezza e osservabilità possono aumentare man mano che i sistemi diventano più complessi.
Tabella di marcia per l'implementazione
Definire obiettivi di latenza, qualità e costi prima dell'implementazione.
Benchmark in condizioni di carico e dati realistiche.
Monitoraggio dello strumento per errori, deriva e impatto sull'utente.
Preparare percorsi di rollback e risposta agli incidenti prima della scalabilità.
Continua a esplorare
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Class Imbalance and Resampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Prossima guida
Reti siamesi e perdita di triplette
Domande frequenti
What is Class Imbalance and Resampling?
Lo squilibrio di classe si verifica quando un risultato supera di gran lunga un altro – come il 99,9% di transazioni legittime contro lo 0,1% di frode – che induce i modelli a ignorare la classe rara ma importante. Il ricampionamento riequilibra i dati di addestramento in modo che il modello impari effettivamente a individuare la minoranza.
Perché la semplice accuratezza è una metrica inadeguata per un problema di classificazione altamente sbilanciato?
Se il 99,9% dei casi è negativo, un modello che prevede sempre il negativo ottiene una precisione del 99,9% mentre rileva zero positivi, quindi la precisione nasconde il fallimento totale nella classe rara.
Cosa fa SMOTE?
SMOTE (Synthetic Minority Over-sampling Technique) crea nuovi esempi di minoranza interpolando tra un punto di minoranza e i suoi vicini di minoranza più vicini, anziché semplicemente duplicarli.
Quale approccio gestisce lo squilibrio SENZA modificare il numero di esempi di formazione?
La ponderazione della classe lascia i dati intatti e fa invece sì che la funzione di perdita penalizzi più pesantemente gli errori sulla classe di minoranza.
Qual è il rischio principale derivante dall'applicazione del sovracampionamento prima di suddividere i dati in set di training e test?
Il ricampionamento prima della suddivisione fa sì che vengano visualizzati punti minoritari quasi identici sia nei set di training che in quelli di test, perdendo informazioni e producendo prestazioni eccessivamente ottimistiche e non realistiche.
Qual è il principale svantaggio del sottocampionamento casuale?
Il sottocampionamento bilancia le classi eliminando gli esempi di maggioranza, il che può scartare dati informativi e compromettere la capacità del modello di apprendere la classe di maggioranza.