Veri Arttırma
Veri artırma, görüntüleri çevirmek veya kırpmak gibi mevcut örneklerin değiştirilmiş kopyalarını oluşturarak bir eğitim setini yapay olarak genişletir.
Genel Bakış
It matters because more varied data reduces overfitting and helps models generalize to inputs they have not seen.
Derin Dalış
Veri artırma, halihazırda sahip olduğunuz verilere etiketi koruyan dönüşümler uygulayarak yeni eğitim örnekleri oluşturur. Görüntüler için bu, döndürmeler, çevirmeler, kırpmalar, renk kaymaları, bulanıklaştırma ve gürültü ekleme anlamına gelir; pikselleri değiştiren ancak doğru yanıt olmayan değişiklikler (ters çevrilmiş bir kedi hala bir kedidir). Metin için kullanılan teknikler arasında eşanlamlı değiştirme, geri çeviri (başka bir dile ve geri çeviri) ve rastgele sözcük silme veya değiştirme yer alır. Ses için arka plan gürültüsü, ses perdesi değişimi veya zaman uzatmalı klipler ekleyebilirsiniz. Amaç, modele önemli olan değişmezlikleri, yani bir nesnenin kimliğinin konumuna, ışığına veya ifadesine bağlı olmadığını öğretmektir. Bu, modelleri daha sağlam hale getirir ve etiketli verilerin az olduğu durumlarda özellikle değerlidir, çünkü her gerçek örnek fiilen çok sayıda olur. Modern işlem hatları genellikle her eğitim döneminde büyütmeleri anında rastgele hale getirir.
Teknik Bilgi
Arttırma işe yarar çünkü değişmezlikler hakkındaki ön bilgiyi doğrudan eğitime aktarır: modele bir örneğin birçok dönüştürülmüş versiyonunu göstererek, onu alakasız varyasyonları göz ardı eden özellikleri öğrenmeye teşvik edersiniz. En önemlisi, dönüşümler etiketi korumalıdır; '6'yı '9'a çevirmek yanlış şeyi öğretecektir. Gelişmiş yöntemler basit düzenlemelerin ötesine geçer: Mixup, iki görüntüyü ve etiketlerini harmanlar, Cutout maskeleri bölgeleri ve AutoAugment gibi öğrenilmiş politikalar, belirli bir veri kümesi için en iyi dönüşüm kombinasyonlarını arar.
Stratejik Etki
Daha net kararlar
Açık teknik iddiaları pazarlama dilinden ayırmanıza yardımcı olur.
Maliyet ve bütçe
Para veya zaman harcamadan önce daha iyi uygulama soruları sorabilirsiniz.
Ekip ve iş akışı
Ortak anlayışa sahip ekipler daha iyi ürün, politika ve öğrenme kararları verir.
Veri Arttırmanın Geleceği
Sınır, üretken ve öğrenilmiş güçlendirmedir: sadece eskileri dönüştürmek yerine tamamen yeni, gerçekçi eğitim örneklerini sentezlemek için difüzyon modellerini veya GAN'ları kullanmak. Otomatik artırma araması (AutoAugment, RandAugment) manuel ayarlamayı azaltıyor ve artırma artık modellerin aynı girişin iki artırılmış görünümünün eşleşmesi gerektiğini tanıyarak öğrendiği kendi kendini denetleyen öğrenmenin merkezinde yer alıyor. Özellikle gerçek veri toplamanın zor olduğu nadir sınıflar ve mahremiyete duyarlı alanlar için, sentetik veri üretimiyle çizgiyi bulanıklaştırmaya devam edecek olan artışları bekleyin.
Gerçek Dünya Uygulaması
Bir görüntü sınıflandırıcı, rastgele döndürülen, kırpılan ve renkleri titreşen fotoğraflar üzerinde eğitim alarak, açı veya ışıktan bağımsız olarak nesneleri tanır.
Bir NLP ekibi, cümleleri başka sözcüklerle ifade etmek ve küçük bir duygu analizi veri kümesini genişletmek için geri çeviriyi (İngilizce'den Almanca'ya ve geriye) kullanıyor.
Bir konuşma modeli, arka plandaki kafe gürültüsünü ekler ve gürültülü gerçek dünya koşullarında doğru kalmasını sağlamak için kayıtların perdesini değiştirir.
Tıbbi bir yapay zeka, yeni hastalar olmadan kıt etiketli örnekleri çoğaltmak için elastik deformasyonlar uygular ve sınırlı sayıdaki MRI taramalarına geçiş yapar.
Riskler ve Korkuluklar
Farklı ekipler aynı terimi farklı şekilde kullanabilir; bu nedenle kapsamı erken tanımlayın.
Gerçek dünya performansı dengesizken karşılaştırmalar güçlü görünebilir.
Veri kalitesini ve değerlendirme planlarını göz ardı etmek çoğu zaman hassas sonuçlar doğurur.
Uygulama Yol Haritası
İhtiyacınız olan sonucun sade bir dille tanımlanmasıyla başlayın.
Test etmeden önce bir başarı ölçüsü ve bir başarısızlık koşulu seçin.
Gösterişli bir demo seti yerine, temsili verilerle küçük bir pilot çalışma yürütün.
Veri Artırmanın nerede yardımcı olduğunu ve daha basit yöntemlerin nerede daha iyi olduğunu belgeleyin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Data Augmentation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Yapay Zeka ve Veri
Sık sorulan sorular
What is Data Augmentation?
Veri artırma, görüntüleri çevirmek veya kırpmak gibi mevcut örneklerin değiştirilmiş kopyalarını oluşturarak bir eğitim setini yapay olarak genişletir. Bu önemlidir çünkü daha çeşitli veriler aşırı uyumu azaltır ve modellerin görmedikleri girdilere genelleştirilmesine yardımcı olur.
Veri artırmanın temel amacı nedir?
Büyütme, aşırı uyumu azaltmak ve modelin görünmeyen girdileri ele almasına yardımcı olmak için mevcut verilerin çeşitli, değiştirilmiş kopyalarını oluşturur.
Aşağıdakilerden hangisi yaygın bir görüntü büyütme tekniğidir?
Çevirme, kırpma, döndürme ve renk değiştirme, etiketi korurken pikselleri değiştiren standart görüntü büyütme işlemleridir.
Metin büyütmede geri çeviri ne işe yarar?
Geri çeviri, metni başka bir dil üzerinden ve geriye doğru çalıştırarak anlamı koruyan, yeniden ifade edilmiş bir versiyon sağlar.
Arttırmalar neden 'etiket koruyucu' olmalıdır?
Bir dönüşüm doğru cevabı değiştirmemelidir; örneğin '6'yı '9'a çevirmek, örneğin yanlış etiketlenmesine neden olur.
Mixup tekniği ne işe yarar?
Mixup, giriş çiftlerini ve etiketlerini doğrusal olarak birleştirerek yeni örnekler oluşturarak karar sınırlarının daha yumuşak olmasını sağlar.