Teknik KILAVUZ

Sınıf Dengesizliği ve Yeniden Örnekleme

Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.

2 min readSon güncelleme

Genel Bakış

Resampling rebalances the training data so the model actually learns to spot the minority.

Derin Dalış

Sınıflar çarpık olduğunda, bir model her zaman çoğunluğu tahmin ederek ve tek bir sahtekarlığı bile yakalamadan %99,9 doğruluğa ulaşabilir ki bu da işe yaramaz. Yeniden örnekleme, eğitim dağılımını iki geniş yolla düzeltir. Aşırı örnekleme, azınlık örneklerini kopyalar veya sentezler - klasik SMOTE (Sentetik Azınlık Aşırı Örnekleme Tekniği), bir azınlık örneği ile en yakın azınlık komşuları arasında bunları kopyalamak yerine enterpolasyon yaparak yeni noktalar oluşturur. Bunun yerine yetersiz örnekleme, verileri çöpe atma pahasına işleri eşitlemek için çoğunluk örneklerini (rastgele veya Tomek bağlantıları veya NearMiss gibi yöntemlerle akıllı bir şekilde) atar. Verilere dokunmaktan kaçınan alternatifler arasında sınıf ağırlıklandırması (kayıp fonksiyonunda azınlık hatalarının daha fazla cezalandırılması) ve eğitim sonrasında karar eşiğinin ayarlanması yer alır.

Teknik Bilgi

Kritik bir kural: yalnızca eğitim kümesini yeniden örnekleyin, hiçbir zaman doğrulama veya test kümesini yeniden örnekleyin ve her zaman çapraz doğrulama katlamalarının içinde yeniden örnekleyin. Bölmeden önce aşırı örnekleme, test setine neredeyse kopya noktaların sızmasına neden olur ve puanları şişirir. Doğruluk burada anlamsız olduğundan değerlendirme, pozitif sınıf nadir olduğunda dürüst kalan ölçümler olan hassasiyete, geri çağırmaya, F1'e, Hassasiyet-Geri Çağırma AUC'sine veya Matthews Korelasyon Katsayısı'na dayanmalıdır.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

Sınıf Dengesizliğinin Geleceği ve Yeniden Örnekleme

Yeniden örnekleme, dengesiz öğrenme gibi kitaplıkların doğrudan çapraz doğrulamaya entegre edilmesiyle, ML işlem hatları içinde giderek daha fazla otomatik hale getiriliyor. Araştırmalar, genellikle derin ağlarda kaba yeniden örneklemeden daha iyi performans gösteren, kolay çoğunluk örneklerinin ağırlığını azaltan odak kaybı gibi, maliyete duyarlı öğrenmeye ve özelleştirilmiş kayıp işlevlerine doğru kayıyor. Tablo ve görüntü verileri için gerçekçi azınlık örneklerini sentezleyen üretken modeller, SMOTE tarzı enterpolasyonun daha karmaşık bir halefi olarak ortaya çıkıyor.

Gerçek Dünya Uygulaması

Gerçek sahtekarlığın işlemlerin %1'inin çok altında olduğu bir kredi kartı sahtekarlığı dedektörünü eğitmek ve nadir görülen dolandırıcılık vakalarını güçlendirmek için SMOTE'u kullanmak

Hastaların yalnızca yüzde birkaçında görülen nadir bir hastalık için tıbbi bir model oluşturmak, sınıf ağırlıkları uygulayarak gözden kaçırılan vakaların ağır şekilde cezalandırılmasını sağlamak

Neredeyse tüm ürünlerin muayeneden geçtiği bir üretim hattındaki kusurlu ürünleri tespit etmek, eğitimi dengelemek için 'iyi' ürünlerden daha az örnek almak

Doğruluk yerine Precision-Recall AUC ile değerlendirilen, normal trafiğin hakim olduğu siber güvenlik günlüklerindeki nadir ağ izinsiz girişlerini işaretleme

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Class Imbalance and Resampling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Siyam Ağları ve Üçlü Kaybı

Sık sorulan sorular

What is Class Imbalance and Resampling?

Sınıf dengesizliği, bir sonucun diğerinden çok daha fazla olması durumudur (örneğin %99,9 meşru işlemlere karşılık %0,1 dolandırıcılık) ve bu da modellerin nadir fakat önemli sınıfı göz ardı etmesini sağlar. Yeniden örnekleme, eğitim verilerini yeniden dengeler, böylece model aslında azınlığı tespit etmeyi öğrenir.

Düz doğruluk neden oldukça dengesiz bir sınıflandırma problemi için zayıf bir ölçümdür?

Vakaların %99,9'u negatifse, her zaman negatifi tahmin eden bir model sıfır pozitif yakalarken %99,9 doğruluk elde eder, böylece doğruluk nadir sınıftaki toplam başarısızlığı gizler.

SMOTE ne işe yarar?

SMOTE (Sentetik Azınlık Aşırı Örnekleme Tekniği), bir azınlık noktası ile onun en yakın azınlık komşuları arasında onları kopyalamak yerine enterpolasyon yaparak yeni azınlık örnekleri oluşturur.

Hangi yaklaşım, eğitim örneklerinin sayısını değiştirmeden dengesizliği ele alır?

Sınıf ağırlıklandırma verilere dokunulmaz ve bunun yerine kayıp fonksiyonunun azınlık sınıfındaki hataları daha ağır şekilde cezalandırmasını sağlar.

Verilerinizi eğitim ve test kümelerine bölmeden önce aşırı örnekleme uygulamanın önemli riski nedir?

Bölmeden önce yeniden örnekleme, hem eğitim hem de test setlerinde neredeyse aynı azınlık noktalarının görünmesine, bilgi sızdırılmasına ve aşırı iyimser, gerçekçi olmayan performans üretilmesine neden olur.

Rastgele yetersiz örneklemenin ana dezavantajı nedir?

Yetersiz örnekleme, çoğunluk örneklerini atarak sınıfları dengeler; bu da bilgilendirici verileri atabilir ve modelin çoğunluk sınıfını öğrenme becerisine zarar verebilir.