Sınıf Dengesizliği ve Yeniden Örnekleme
Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.
Genel Bakış
Resampling rebalances the training data so the model actually learns to spot the minority.
Derin Dalış
Sınıflar çarpık olduğunda, bir model her zaman çoğunluğu tahmin ederek ve tek bir sahtekarlığı bile yakalamadan %99,9 doğruluğa ulaşabilir ki bu da işe yaramaz. Yeniden örnekleme, eğitim dağılımını iki geniş yolla düzeltir. Aşırı örnekleme, azınlık örneklerini kopyalar veya sentezler - klasik SMOTE (Sentetik Azınlık Aşırı Örnekleme Tekniği), bir azınlık örneği ile en yakın azınlık komşuları arasında bunları kopyalamak yerine enterpolasyon yaparak yeni noktalar oluşturur. Bunun yerine yetersiz örnekleme, verileri çöpe atma pahasına işleri eşitlemek için çoğunluk örneklerini (rastgele veya Tomek bağlantıları veya NearMiss gibi yöntemlerle akıllı bir şekilde) atar. Verilere dokunmaktan kaçınan alternatifler arasında sınıf ağırlıklandırması (kayıp fonksiyonunda azınlık hatalarının daha fazla cezalandırılması) ve eğitim sonrasında karar eşiğinin ayarlanması yer alır.
Teknik Bilgi
Kritik bir kural: yalnızca eğitim kümesini yeniden örnekleyin, hiçbir zaman doğrulama veya test kümesini yeniden örnekleyin ve her zaman çapraz doğrulama katlamalarının içinde yeniden örnekleyin. Bölmeden önce aşırı örnekleme, test setine neredeyse kopya noktaların sızmasına neden olur ve puanları şişirir. Doğruluk burada anlamsız olduğundan değerlendirme, pozitif sınıf nadir olduğunda dürüst kalan ölçümler olan hassasiyete, geri çağırmaya, F1'e, Hassasiyet-Geri Çağırma AUC'sine veya Matthews Korelasyon Katsayısı'na dayanmalıdır.
Stratejik Etki
Maliyet ve bütçe
Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.
Daha net kararlar
Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.
Quality control
Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.
Sınıf Dengesizliğinin Geleceği ve Yeniden Örnekleme
Yeniden örnekleme, dengesiz öğrenme gibi kitaplıkların doğrudan çapraz doğrulamaya entegre edilmesiyle, ML işlem hatları içinde giderek daha fazla otomatik hale getiriliyor. Araştırmalar, genellikle derin ağlarda kaba yeniden örneklemeden daha iyi performans gösteren, kolay çoğunluk örneklerinin ağırlığını azaltan odak kaybı gibi, maliyete duyarlı öğrenmeye ve özelleştirilmiş kayıp işlevlerine doğru kayıyor. Tablo ve görüntü verileri için gerçekçi azınlık örneklerini sentezleyen üretken modeller, SMOTE tarzı enterpolasyonun daha karmaşık bir halefi olarak ortaya çıkıyor.
Gerçek Dünya Uygulaması
Gerçek sahtekarlığın işlemlerin %1'inin çok altında olduğu bir kredi kartı sahtekarlığı dedektörünü eğitmek ve nadir görülen dolandırıcılık vakalarını güçlendirmek için SMOTE'u kullanmak
Hastaların yalnızca yüzde birkaçında görülen nadir bir hastalık için tıbbi bir model oluşturmak, sınıf ağırlıkları uygulayarak gözden kaçırılan vakaların ağır şekilde cezalandırılmasını sağlamak
Neredeyse tüm ürünlerin muayeneden geçtiği bir üretim hattındaki kusurlu ürünleri tespit etmek, eğitimi dengelemek için 'iyi' ürünlerden daha az örnek almak
Doğruluk yerine Precision-Recall AUC ile değerlendirilen, normal trafiğin hakim olduğu siber güvenlik günlüklerindeki nadir ağ izinsiz girişlerini işaretleme
Riskler ve Korkuluklar
Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.
Altyapı ve bakım maliyetleri genellikle hafife alınır.
Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.
Uygulama Yol Haritası
Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.
Gerçekçi yük ve veri koşulları altında kıyaslama yapın.
Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.
Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Class Imbalance and Resampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Siyam Ağları ve Üçlü Kaybı
Sık sorulan sorular
What is Class Imbalance and Resampling?
Sınıf dengesizliği, bir sonucun diğerinden çok daha fazla olması durumudur (örneğin %99,9 meşru işlemlere karşılık %0,1 dolandırıcılık) ve bu da modellerin nadir fakat önemli sınıfı göz ardı etmesini sağlar. Yeniden örnekleme, eğitim verilerini yeniden dengeler, böylece model aslında azınlığı tespit etmeyi öğrenir.
Düz doğruluk neden oldukça dengesiz bir sınıflandırma problemi için zayıf bir ölçümdür?
Vakaların %99,9'u negatifse, her zaman negatifi tahmin eden bir model sıfır pozitif yakalarken %99,9 doğruluk elde eder, böylece doğruluk nadir sınıftaki toplam başarısızlığı gizler.
SMOTE ne işe yarar?
SMOTE (Sentetik Azınlık Aşırı Örnekleme Tekniği), bir azınlık noktası ile onun en yakın azınlık komşuları arasında onları kopyalamak yerine enterpolasyon yaparak yeni azınlık örnekleri oluşturur.
Hangi yaklaşım, eğitim örneklerinin sayısını değiştirmeden dengesizliği ele alır?
Sınıf ağırlıklandırma verilere dokunulmaz ve bunun yerine kayıp fonksiyonunun azınlık sınıfındaki hataları daha ağır şekilde cezalandırmasını sağlar.
Verilerinizi eğitim ve test kümelerine bölmeden önce aşırı örnekleme uygulamanın önemli riski nedir?
Bölmeden önce yeniden örnekleme, hem eğitim hem de test setlerinde neredeyse aynı azınlık noktalarının görünmesine, bilgi sızdırılmasına ve aşırı iyimser, gerçekçi olmayan performans üretilmesine neden olur.
Rastgele yetersiz örneklemenin ana dezavantajı nedir?
Yetersiz örnekleme, çoğunluk örneklerini atarak sınıfları dengeler; bu da bilgilendirici verileri atabilir ve modelin çoğunluk sınıfını öğrenme becerisine zarar verebilir.