Görsel Yapay Zeka KILAVUZU

Herhangi Bir Modeli Segmentlere Ayırın

Her Şeyi Segmente Ayırma Modeli (SAM), Meta AI'nin görüntü segmentasyonuna yönelik temel modelidir: bir nokta, kutu veya kaba bir ipucu verildiğinde, karşılık gelen nesnenin ana hatlarını anında çizer.

2 min readSon güncelleme

Genel Bakış

It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.

Derin Dalış

Meta AI tarafından 2023'te piyasaya sürülen SAM, segmentasyonu istenebilir bir sorun olarak yeniden çerçevelendiriyor: ona bir istem (tıklama, kutu, maske veya metinden türetilmiş ipucu) verirsiniz ve bir veya daha fazla nesne maskesi döndürür. Gücü kısmen ölçekten geliyor: Döngü içi model açıklama motoruyla oluşturulmuş, 11 milyon görüntüde 1 milyardan fazla maskeden oluşan bir veri kümesi olan SA-1B üzerinde eğitildi. Mimari olarak SAM, görüntü başına bir kez çalıştırılan yoğun bir görüntü kodlayıcıya, hafif bir istem kodlayıcıya ve hızlı bir maske kod çözücüye sahiptir; böylece tek bir gömülü görüntü, gerçek zamanlı olarak etkileşimli olarak yeniden yönlendirilebilir. Birçok göreve sıfır atış aktarımı sağlar. 2024'te piyasaya sürülen SAM 2, nesneleri kareler arasında takip ederek bunu videoya da genişletiyor.

Teknik Bilgi

SAM, yoğun bir görüntü yerleştirme sağlamak için genellikle maskeli otomatik kodlamayla önceden eğitilmiş bir Vision Transformer (ViT) görüntü kodlayıcı kullanır. İstemler belirteçlere kodlanır ve çapraz dikkat özelliğine sahip transformatör tabanlı bir kod çözücü, istem belirteçlerini çıktı maskelerine eklenmiş görüntü ve güven puanlarıyla birleştirir. Belirsizliği çözmek için (bir tıklama bir düğme, bir gömlek veya bir kişi anlamına gelebilir), SAM aynı anda birkaç geçerli maskeyi tahmin eder ve bunları sıralayarak alt kullanım veya ekstra istemlerin belirsizliği ortadan kaldırmasına olanak tanır.

Stratejik Etki

Speed and scale

Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.

Build choices

Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.

Ekip ve iş akışı

Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.

Her Şeyi Segmente Alma Modelinin Geleceği

SAM, açıklama araçları, tıbbi görüntüleme, robot teknolojisi ve AR ardışık düzenleri için varsayılan bir omurga haline geldi ve genellikle açık sözlüklü "ada göre bölümleme" iş akışları için dedektörler veya metin modelleriyle eşleştirildi. Cihaz üzerinde kullanım için daha hafif, daha hızlı değişkenler (MobileSAM, EfficientSAM), tamamen metin odaklı segmentasyon için dille daha derin entegrasyon ve video ve 3D'ye yönelik sürekli genişleme bekleyebilirsiniz. Bir temel modeli olarak, yerleştirmeleri diğer sistemleri besleyen bir algı katmanı olarak giderek daha fazla yeniden kullanılıyor.

Gerçek Dünya Uygulaması

Görüntü açıklaması platformları, etiketleyicilerin bir kez tıklamasına ve hassas nesne maskelerini otomatik olarak oluşturmasına olanak sağlamak için SAM'i kullanarak etiketleme süresini kısaltır.

Araştırmacılar, CT ve MRI taramalarındaki organları ve tümörleri özetlemek için SAM'i (örn. MedSAM) uyarlıyor.

Fotoğraf ve video düzenleyiciler, tek bir tıklamayla konuları kesmek veya arka planları kaldırmak için SAM'i entegre eder.

SAM 2, AR efektleri ve robotik algılama için nesneleri video kareleri boyunca izler ve bölümlere ayırır.

Riskler ve Korkuluklar

Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.

Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.

Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.

Uygulama Yol Haritası

1

Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.

2

Gerçek üretim koşullarıyla eşleşen verilerle test edin.

3

Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.

4

Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Segment Anything Model quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Tutarlılık Modelleri

Sık sorulan sorular

What is Segment Anything Model?

Her Şeyi Segmente Ayırma Modeli (SAM), Meta AI'nin görüntü segmentasyonuna yönelik temel modelidir: bir nokta, kutu veya kaba bir ipucu verildiğinde, karşılık gelen nesnenin ana hatlarını anında çizer. Eğitim sırasında hiç görmediği nesnelere ve görüntülere genelleme yapmak için tasarlandı ve segmentasyonu hızlı bir görev haline getirdi.

Hangi temel fikir SAM'i segmentasyon için 'temel model' yapar?

SAM, segmentasyonu istenebilir olarak yeniden çerçevelendiriyor ve eğitim seti dışındaki nesnelere ve görüntülere sıfır atış aktarımı için tasarlandı.

SAM'i eğitmek için kullanılan SA-1B veri kümesi kabaca ne kadar büyüktür?

SA-1B, döngü içi model açıklama motoruyla oluşturulmuş yaklaşık 11 milyon görüntüde 1 milyardan fazla maske içerir.

SAM neden mimarisini ağır görüntü kodlayıcı ve hafif hızlı kodlayıcı/kod çözücü olarak ikiye ayırıyor?

Pahalı görüntü kodlaması bir kez çalıştırılır; daha sonra ucuz istem kodlaması ve maske kod çözme, aynı görüntünün hızlı, etkileşimli yeniden yönlendirilmesine olanak tanır.

SAM, birden fazla nesne anlamına gelebilecek tek bir tıklama gibi belirsiz bir istemi nasıl ele alır?

SAM, puanlarla birlikte çeşitli aday maskeleri üretir, böylece belirsizlik, sıralama veya ek istemlerle çözülebilir.

SAM, giriş görüntüsünü kodlamak için ne tür bir omurga kullanır?

SAM'in görüntü kodlayıcısı, genellikle maskeli otomatik kodlamayla önceden eğitilmiş ve yoğun bir görüntü yerleştirme üreten bir Vision Transformer'dır.