Görsel Yapay Zeka KILAVUZU

Maskelenmiş Otomatik Kodlayıcılar

Maskeli Otomatik Kodlayıcılar (MAE), resmin büyük kısmı gizlendikten sonra görüntüleri yeniden yapılandırmak için görme modelini öğreten, kendi kendini denetleyen bir yöntemdir.

2 min readSon güncelleme

Genel Bakış

By learning to fill in the blanks, the model builds rich visual understanding without any human labels.

Derin Dalış

Kaiming He ve Meta AI'deki meslektaşları tarafından 2021'de tanıtılan Maskeli Otomatik Kodlayıcılar, bir görüntüyü alıp onu küçük parçalara böler ve bunların çok büyük bir kısmını, genellikle %75'ini rastgele gizler. Vision Transformer kodlayıcı yalnızca görünür parçaları işlerken, hafif kod çözücü eksik olanların orijinal piksellerini yeniden oluşturmaya çalışır. Çok fazla şey gizli olduğundan, model yakındaki pikselleri kolayca kopyalayamaz ve şekiller ve nesne parçaları gibi anlamlı yapıları öğrenmesi gerekir. Kodlayıcının maskelenmiş yamaları atlaması, eğitimi hızlı ve belleği verimli hale getirir. Ön eğitimden sonra kod çözücü atılır ve kodlayıcı güçlü bir şekilde sınıflandırma, tespit ve bölümleme görevlerine aktarılır.

Teknik Bilgi

İşin püf noktası asimetridir: Ağır kodlayıcı yamaların yalnızca maskelenmemiş %25'ini görür, küçük kod çözücü ise geri kalanını yeniden oluşturur. Yamalar düzleştirilir, doğrusal olarak gömülür ve konumsal kodlamalar verilir. Yeniden yapılandırma kaybı, yalnızca maskelenmiş yamalarda, tipik olarak normalleştirilmiş piksel değerlerinde hesaplanan ortalama karesel hatadır. Yüksek maskeleme oranları, düşük seviyeli enterpolasyon yerine anlamsal öğrenmeyi zorlar ve kodlayıcı kesimlerinde maskelenmiş belirteçlerin atlanması, tam görüntünün işlenmesi yerine dramatik bir şekilde hesaplama yapılmasını sağlar.

Stratejik Etki

Speed and scale

Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.

Build choices

Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.

Ekip ve iş akışı

Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.

Maskelenmiş Otomatik Kodlayıcıların Geleceği

MAE tarzı maskeli rekonstrüksiyon, modaliteler arasında varsayılan bir ön eğitim tarifi haline geliyor. Araştırmacılar bunu etiketlerin az ve pahalı olduğu video (uzay-zaman küplerini gizleme), ses spektrogramları, tıbbi taramalar ve uydu görüntülerine kadar genişletiyor. Çok modlu temel modeller, daha verimli kod çözücüler ve bilgilendirici bölgeleri hedefleyen uyarlanabilir maskeleme için dille daha sıkı birleşim bekleyin. Bilgi işlem büyüdükçe, büyük etiketsiz görüntü koleksiyonları üzerinde maskelenmiş ön eğitim, maliyetli insan açıklamalarına olan bağımlılığı azaltırken aşağı akış doğruluğunu artırmaya devam etmelidir.

Gerçek Dünya Uygulaması

Milyonlarca etiketsiz fotoğraf üzerinde Vision Transformer'ı önceden eğitme ve ardından güçlü bir doğrulukla ImageNet sınıflandırması için ince ayar yapma

Uzman açıklamasının pahalı ve sınırlı olduğu etiketlenmemiş tıbbi taramalardan (X-ışınları, MRI'lar) öğrenme özellikleri

Eylem tanıma modellerini önceden eğitmek için uzay-zaman yamalarını maskeleyerek yöntemi videoya uyarlama (VideoMAE)

Arazi kullanımı haritalandırmasını ve manuel etiketler olmadan değişiklik tespitini desteklemek için uydu ve hava görüntüleri üzerine ön eğitim

Riskler ve Korkuluklar

Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.

Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.

Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.

Uygulama Yol Haritası

1

Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.

2

Gerçek üretim koşullarıyla eşleşen verilerle test edin.

3

Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.

4

Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Masked Autoencoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Muse Maskeli Üretken Görüntüleme

Sık sorulan sorular

What is Masked Autoencoders?

Maskeli Otomatik Kodlayıcılar (MAE), resmin büyük kısmı gizlendikten sonra görüntüleri yeniden yapılandırmak için görme modelini öğreten, kendi kendini denetleyen bir yöntemdir. Model, boşlukları doldurmayı öğrenerek herhangi bir insan etiketi olmaksızın zengin bir görsel anlayış oluşturur.

Maskeli Otomatik Kodlayıcıda kendi kendini denetleyen temel görev nedir?

MAE, çoğu görüntü parçasını gizler ve modeli, hiçbir insan etiketi gerektirmeden eksik pikselleri yeniden oluşturacak şekilde eğitir.

Orijinal MAE tipik olarak görüntü eklerinin yaklaşık olarak ne kadarını maskeliyor?

Orijinal MAE yamaların yaklaşık %75'ini maskeler; bu yüksek oran, modeli komşuları kopyalamak yerine anlamlı yapıyı öğrenmeye zorlar.

MAE kodlayıcı neden yalnızca görünür (maskelenmemiş) yamaları işliyor?

Kodlayıcıda maskelenmiş belirteçlerin atlanması, yamaların yalnızca küçük bir kısmını işlediğinden işlem ve belleği büyük ölçüde azaltır.

MAE ön eğitimi tamamlandıktan sonra kod çözücüye ne olur?

Hafif kod çözücü yalnızca ön eğitim sırasında yeniden yapılandırma için gereklidir; daha sonra öğrenilen kodlayıcı, algılama gibi görevlere aktarılır.

MAE yeniden yapılandırma için genellikle hangi kayıp fonksiyonunu kullanır?

MAE, yalnızca maskelenmiş yamalarda hesaplanan, tahmin edilen ve gerçek piksel değerleri arasındaki ortalama karesel hatayı en aza indirir.