Görsel Yapay Zeka KILAVUZU

Swin Transformatörü

Swin Transformer, görüntüleri kaydırılmış, hiyerarşik pencerelerde işleyerek dikkatin yüksek çözünürlüklü görüntüler arasında ölçeklenecek kadar verimli olmasını sağlayan bir vizyon Transformatörüdür.

2 min readSon güncelleme

Genel Bakış

It works as a general-purpose backbone for classification, detection, and segmentation.

Derin Dalış

Standart Görüş Transformatörleri, tüm görüntü yamalarında dikkati hesaplar; bu da, algılama gibi yoğun görevler için bir engel olarak görüntü boyutuyla birlikte karesel olarak artar. Microsoft Araştırması tarafından 2021'de tanıtılan Swin (Kaydırılmış Pencereler), bunun yerine görüntüyü çakışmayan küçük pencerelere böler ve öz dikkati yalnızca her pencerede hesaplayarak maliyetin görüntü boyutuyla doğrusal olarak artmasını sağlar. Bilginin pencere sınırlarını geçmesine izin vermek için, alternatif katmanlar pencere ızgarasını kaydırır, böylece ayrılan yamalar artık bir pencereyi paylaşır. Swin aynı zamanda bir hiyerarşi de oluşturur: küçük yamalarla başlar ve bunları aşamalı olarak birleştirerek, mevcut tespit ve segmentasyon çerçevelerine düzgün bir şekilde yerleşen CNN'ye benzer çok ölçekli özellik haritaları üretir.

Teknik Bilgi

Swin'in verimliliği pencere tabanlı çok kafalı öz-dikkatten (W-MSA) gelir: dikkat sabit pencerelerle (örneğin 7x7 yamalar) sınırlıdır, dolayısıyla karmaşıklık yamaların sayısına göre karesel olarak değil doğrusal olarak ölçeklenir. Bir sonraki blok, kaydırılmış pencere dikkatini (SW-MSA) kullanır ve pencere bölümünü yarım pencere kadar değiştirerek pencereler arası bağlantıların oluşmasını sağlar. Yama birleştirici katmanlar, komşu yamaları aşamalar arasında birleştirerek, bir özellik piramidi oluşturmak için uzamsal çözünürlüğü yarıya indirir ve kanalları ikiye katlar.

Stratejik Etki

Speed and scale

Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.

Build choices

Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.

Ekip ve iş akışı

Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.

Swin Transformer'ın Geleceği

Swin, hiyerarşik, yerellik bilincine sahip Transformers'ların evrensel görüş omurgaları olarak CNN'lere rakip olabileceğini veya onları yenebileceğini gösterdi ve Swin V2 bunu milyarlarca parametreli modellere ve çok yüksek çözünürlüklere itti. Evrişimsel tümevarımsal önyargıların dikkatle, daha verimli dikkat değişkenleriyle ve multimodal ve video modellerini besleyen Swin tarzı omurgalarla harmanlanmaya devam etmesini bekleyin. Görmeye yönelik temel modeller olgunlaştıkça, çok ölçekli özellikler üreten hiyerarşik tasarımlar yoğun tahmin görevleri için özellikle değerli olmaya devam ediyor.

Gerçek Dünya Uygulaması

Önceden eğitilmiş bir omurga olarak yüksek doğruluklu ImageNet sınıflandırması

Mask R-CNN ve Cascade R-CNN gibi çerçevelerde nesne algılama ve örnek segmentasyonu omurgaları

Sokak sahnelerinin ve uydu görüntülerinin semantik segmentasyonu

Yüksek çözünürlüğün ve çok ölçekli ayrıntıların önemli olduğu tıbbi görüntü analizi

Riskler ve Korkuluklar

Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.

Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.

Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.

Uygulama Yol Haritası

1

Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.

2

Gerçek üretim koşullarıyla eşleşen verilerle test edin.

3

Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.

4

Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Swin Transformer quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Difüzyon Transformatörleri

Sık sorulan sorular

What is Swin Transformer?

Swin Transformer, görüntüleri kaydırılmış, hiyerarşik pencerelerde işleyerek dikkatin yüksek çözünürlüklü görüntüler arasında ölçeklenecek kadar verimli olmasını sağlayan bir vizyon Transformatörüdür. Sınıflandırma, tespit ve segmentasyon için genel amaçlı bir omurga olarak çalışır.

Swin Transformer'daki 'Swin' ne anlama geliyor?

Swin, yerel dikkat pencerelerinin katmanlar arasında bilgi alışverişine olanak sağlayan mekanizma olan Kaydırılmış Pencereler anlamına gelir.

Yerel pencerelerde kişisel dikkati hesaplamak neden faydalıdır?

Dikkatin sabit boyutlu pencerelerle sınırlandırılması, küresel dikkatin ikinci dereceden büyümesinin aksine, hesaplama maliyetinin görüntü boyutuyla doğrusal olarak artmasına neden olur.

Swin bilginin ayrı pencereler arasında taşınmasına nasıl izin veriyor?

Alternatif katmanlar, pencere ızgarasını bir pencerenin yarısı kadar kaydırır, böylece daha önce farklı pencerelerde bulunan yamalar birbirini takip edebilir.

Yama birleştirme katmanları Swin aşamaları arasında ne yapar?

Yama birleştirme, uzamsal çözünürlüğü ve çift kanal derinliğini yarıya indirmek için komşu yamaları birleştirerek çok ölçekli bir hiyerarşi oluşturur.

Swin'in hiyerarşik, çok ölçekli çıktısı neden özellikle faydalıdır?

Çok ölçekli özellik haritaları CNN omurgalarını taklit eder, böylece Swin, Mask R-CNN gibi yoğun tahmin çerçeveleriyle kolayca entegre olur.