GUIDA TECNICA

Squilibrio di classe e ricampionamento

Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.

2 minuti di letturaUltimo aggiornamento

Panoramica

Resampling rebalances the training data so the model actually learns to spot the minority.

Immersione profonda

When classes are skewed, a model can hit 99.9% accuracy by always predicting the majority and never catching a single fraud, which is useless. Il ricampionamento fissa la distribuzione dell'addestramento in due modi generali. Il sovracampionamento duplica o sintetizza esempi minoritari: il classico SMOTE (Synthetic Minority Over-sampling Technique) crea nuovi punti interpolando tra un campione minoritario e i suoi vicini minoritari più vicini invece di copiarli. Il sottocampionamento invece scarta gli esempi della maggioranza (in modo casuale o in modo intelligente tramite metodi come i collegamenti Tomek o NearMiss) per pareggiare le cose, a costo di buttare via i dati. Le alternative che evitano di toccare i dati includono la ponderazione della classe (penalizzare maggiormente gli errori di minoranza nella funzione di perdita) e l’adeguamento della soglia decisionale dopo la formazione.

Approfondimento tecnico

Una regola fondamentale: ricampionare solo il set di training, mai il set di validazione o di test, e ricampionare sempre all'interno delle pieghe di convalida incrociata. Il sovracampionamento prima della suddivisione fa filtrare punti quasi duplicati nel set di test e aumenta i punteggi. Poiché in questo caso l'accuratezza non ha senso, la valutazione dovrebbe basarsi su precisione, richiamo, F1, AUC precisione-richiamo o coefficiente di correlazione di Matthews: parametri che rimangono onesti quando la classe positiva è rara.

Impatto strategico

Costo e budget

Le decisioni relative all'architettura determinano prestazioni e costi operativi per anni.

Decisioni più chiare

La formazione tecnica aiuta i team a scegliere lo stack giusto, non solo quello più nuovo.

Controllo di qualità

Migliori scelte ingegneristiche riducono gli incidenti legati all’affidabilità nella produzione.

Il futuro dello squilibrio di classe e del ricampionamento

Il ricampionamento è sempre più automatizzato all'interno delle pipeline ML, con librerie come l'apprendimento sbilanciato che si integrano direttamente nella convalida incrociata. La ricerca si sta spostando verso l’apprendimento sensibile ai costi e funzioni di perdita su misura – come la perdita focale, che ridimensiona gli esempi di maggioranza facile – che spesso superano il ricampionamento grezzo su reti profonde. Per i dati tabellari e di immagine, i modelli generativi che sintetizzano campioni minoritari realistici stanno emergendo come successori più sofisticati dell’interpolazione in stile SMOTE.

Implementazione nel mondo reale

Formazione di un rilevatore di frodi con carte di credito in cui le frodi autentiche sono ben al di sotto dell'1% delle transazioni, utilizzando SMOTE per amplificare i rari casi di frode

Costruire un modello medico per una malattia rara presente solo in una piccola percentuale di pazienti, applicando i pesi delle classi in modo che i casi persi siano pesantemente penalizzati

Rilevamento di articoli difettosi su una linea di produzione in cui quasi tutti i prodotti superano l'ispezione, sottocampionando gli articoli "buoni" per bilanciare la formazione

Segnalazione di rare intrusioni di rete nei log di sicurezza informatica dominati dal traffico normale, valutati con Precision-Recall AUC anziché con accuratezza

Rischi e guardrail

L'ottimizzazione di un benchmark può nascondere debolezze di sistema più ampie.

I costi delle infrastrutture e della manutenzione sono spesso sottostimati.

Le lacune in termini di sicurezza e osservabilità possono aumentare man mano che i sistemi diventano più complessi.

Tabella di marcia per l'implementazione

1

Definire obiettivi di latenza, qualità e costi prima dell'implementazione.

2

Benchmark in condizioni di carico e dati realistiche.

3

Monitoraggio dello strumento per errori, deriva e impatto sull'utente.

4

Preparare percorsi di rollback e risposta agli incidenti prima della scalabilità.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Class Imbalance and Resampling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Reti siamesi e perdita di triplette

Domande frequenti

What is Class Imbalance and Resampling?

Lo squilibrio di classe si verifica quando un risultato supera di gran lunga un altro – come il 99,9% di transazioni legittime contro lo 0,1% di frode – che induce i modelli a ignorare la classe rara ma importante. Il ricampionamento riequilibra i dati di addestramento in modo che il modello impari effettivamente a individuare la minoranza.

Perché la semplice accuratezza è una metrica inadeguata per un problema di classificazione altamente sbilanciato?

Se il 99,9% dei casi è negativo, un modello che prevede sempre il negativo ottiene una precisione del 99,9% mentre rileva zero positivi, quindi la precisione nasconde il fallimento totale nella classe rara.

Cosa fa SMOTE?

SMOTE (Synthetic Minority Over-sampling Technique) crea nuovi esempi di minoranza interpolando tra un punto di minoranza e i suoi vicini di minoranza più vicini, anziché semplicemente duplicarli.

Quale approccio gestisce lo squilibrio SENZA modificare il numero di esempi di formazione?

La ponderazione della classe lascia i dati intatti e fa invece sì che la funzione di perdita penalizzi più pesantemente gli errori sulla classe di minoranza.

Qual è il rischio principale derivante dall'applicazione del sovracampionamento prima di suddividere i dati in set di training e test?

Il ricampionamento prima della suddivisione fa sì che vengano visualizzati punti minoritari quasi identici sia nei set di training che in quelli di test, perdendo informazioni e producendo prestazioni eccessivamente ottimistiche e non realistiche.

Qual è il principale svantaggio del sottocampionamento casuale?

Il sottocampionamento bilancia le classi eliminando gli esempi di maggioranza, il che può scartare dati informativi e compromettere la capacità del modello di apprendere la classe di maggioranza.