Maskelenmiş Otomatik Kodlayıcılar
Maskeli Otomatik Kodlayıcılar (MAE), resmin büyük kısmı gizlendikten sonra görüntüleri yeniden yapılandırmak için görme modelini öğreten, kendi kendini denetleyen bir yöntemdir.
Genel Bakış
By learning to fill in the blanks, the model builds rich visual understanding without any human labels.
Derin Dalış
Kaiming He ve Meta AI'deki meslektaşları tarafından 2021'de tanıtılan Maskeli Otomatik Kodlayıcılar, bir görüntüyü alıp onu küçük parçalara böler ve bunların çok büyük bir kısmını, genellikle %75'ini rastgele gizler. Vision Transformer kodlayıcı yalnızca görünür parçaları işlerken, hafif kod çözücü eksik olanların orijinal piksellerini yeniden oluşturmaya çalışır. Çok fazla şey gizli olduğundan, model yakındaki pikselleri kolayca kopyalayamaz ve şekiller ve nesne parçaları gibi anlamlı yapıları öğrenmesi gerekir. Kodlayıcının maskelenmiş yamaları atlaması, eğitimi hızlı ve belleği verimli hale getirir. Ön eğitimden sonra kod çözücü atılır ve kodlayıcı güçlü bir şekilde sınıflandırma, tespit ve bölümleme görevlerine aktarılır.
Teknik Bilgi
İşin püf noktası asimetridir: Ağır kodlayıcı yamaların yalnızca maskelenmemiş %25'ini görür, küçük kod çözücü ise geri kalanını yeniden oluşturur. Yamalar düzleştirilir, doğrusal olarak gömülür ve konumsal kodlamalar verilir. Yeniden yapılandırma kaybı, yalnızca maskelenmiş yamalarda, tipik olarak normalleştirilmiş piksel değerlerinde hesaplanan ortalama karesel hatadır. Yüksek maskeleme oranları, düşük seviyeli enterpolasyon yerine anlamsal öğrenmeyi zorlar ve kodlayıcı kesimlerinde maskelenmiş belirteçlerin atlanması, tam görüntünün işlenmesi yerine dramatik bir şekilde hesaplama yapılmasını sağlar.
Stratejik Etki
Speed and scale
Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.
Build choices
Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.
Ekip ve iş akışı
Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.
Maskelenmiş Otomatik Kodlayıcıların Geleceği
MAE tarzı maskeli rekonstrüksiyon, modaliteler arasında varsayılan bir ön eğitim tarifi haline geliyor. Araştırmacılar bunu etiketlerin az ve pahalı olduğu video (uzay-zaman küplerini gizleme), ses spektrogramları, tıbbi taramalar ve uydu görüntülerine kadar genişletiyor. Çok modlu temel modeller, daha verimli kod çözücüler ve bilgilendirici bölgeleri hedefleyen uyarlanabilir maskeleme için dille daha sıkı birleşim bekleyin. Bilgi işlem büyüdükçe, büyük etiketsiz görüntü koleksiyonları üzerinde maskelenmiş ön eğitim, maliyetli insan açıklamalarına olan bağımlılığı azaltırken aşağı akış doğruluğunu artırmaya devam etmelidir.
Gerçek Dünya Uygulaması
Milyonlarca etiketsiz fotoğraf üzerinde Vision Transformer'ı önceden eğitme ve ardından güçlü bir doğrulukla ImageNet sınıflandırması için ince ayar yapma
Uzman açıklamasının pahalı ve sınırlı olduğu etiketlenmemiş tıbbi taramalardan (X-ışınları, MRI'lar) öğrenme özellikleri
Eylem tanıma modellerini önceden eğitmek için uzay-zaman yamalarını maskeleyerek yöntemi videoya uyarlama (VideoMAE)
Arazi kullanımı haritalandırmasını ve manuel etiketler olmadan değişiklik tespitini desteklemek için uydu ve hava görüntüleri üzerine ön eğitim
Riskler ve Korkuluklar
Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.
Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.
Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.
Uygulama Yol Haritası
Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.
Gerçek üretim koşullarıyla eşleşen verilerle test edin.
Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.
Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Masked Autoencoders quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Muse Maskeli Üretken Görüntüleme
Sık sorulan sorular
What is Masked Autoencoders?
Maskeli Otomatik Kodlayıcılar (MAE), resmin büyük kısmı gizlendikten sonra görüntüleri yeniden yapılandırmak için görme modelini öğreten, kendi kendini denetleyen bir yöntemdir. Model, boşlukları doldurmayı öğrenerek herhangi bir insan etiketi olmaksızın zengin bir görsel anlayış oluşturur.
Maskeli Otomatik Kodlayıcıda kendi kendini denetleyen temel görev nedir?
MAE, çoğu görüntü parçasını gizler ve modeli, hiçbir insan etiketi gerektirmeden eksik pikselleri yeniden oluşturacak şekilde eğitir.
Orijinal MAE tipik olarak görüntü eklerinin yaklaşık olarak ne kadarını maskeliyor?
Orijinal MAE yamaların yaklaşık %75'ini maskeler; bu yüksek oran, modeli komşuları kopyalamak yerine anlamlı yapıyı öğrenmeye zorlar.
MAE kodlayıcı neden yalnızca görünür (maskelenmemiş) yamaları işliyor?
Kodlayıcıda maskelenmiş belirteçlerin atlanması, yamaların yalnızca küçük bir kısmını işlediğinden işlem ve belleği büyük ölçüde azaltır.
MAE ön eğitimi tamamlandıktan sonra kod çözücüye ne olur?
Hafif kod çözücü yalnızca ön eğitim sırasında yeniden yapılandırma için gereklidir; daha sonra öğrenilen kodlayıcı, algılama gibi görevlere aktarılır.
MAE yeniden yapılandırma için genellikle hangi kayıp fonksiyonunu kullanır?
MAE, yalnızca maskelenmiş yamalarda hesaplanan, tahmin edilen ve gerçek piksel değerleri arasındaki ortalama karesel hatayı en aza indirir.