Görsel Yapay Zeka KILAVUZU

DerinlikHer Şey Monoküler Derinlik

DepthAnything, özel bir donanıma ihtiyaç duymadan, her pikselin tek bir sıradan fotoğraftan ne kadar uzakta olduğunu tahmin eden bir temel modeldir.

2 min readSon güncelleme

Genel Bakış

It made robust, general-purpose depth sensing cheap and accessible for anything from phones to robots.

Derin Dalış

DepthAnything (2024, TikTok/ByteDance ve HKU'daki araştırmacılar da dahil olmak üzere araştırmacılar tarafından yayınlandı) monoküler derinlik tahminini ele alıyor: bir RGB görüntüsünden bir derinlik haritası tahmin etmek. Buluşun atılımı ölçekti: Ekip, yalnızca mevcut sınırlı etiketli derinlik verilerine güvenmek yerine, bir öğretmen modeli kullanarak yaklaşık 62 milyon etiketsiz fotoğrafı otomatik olarak etiketleyen bir motor geliştirdi ve ardından bir öğrenciyi bu devasa külliyat konusunda eğitti. Bu, iç mekan, dış mekan ve olağandışı sahnelerde güçlü sıfır çekim genellemesi sağlar. Orijinal, göreceli derinliği verir (hangi pikseller daha yakın veya daha uzaktır, tam metre değil). DepthAnything V2 (2024 ortası), öğretmeni mükemmel temel gerçeğe sahip sentetik veriler konusunda eğiterek, ardından gerçek görüntülere dönüştürerek, bulanık kenarları ve şeffaf nesne hatalarını düzelterek ince ayrıntıları keskinleştirdi.

Teknik Bilgi

DPT tarzı yoğun bir tahmin kafasını besleyen bir DINOv2 görüntü transformatörü kodlayıcı kullanır. İşin püf noktası, yarı denetimli damıtmadır: Etiketli veriler konusunda eğitim almış bir öğretmen, milyonlarca etiketsiz görüntüyü sahte etiketlerle etiketler ve öğrenci her ikisinden de öğrenir. V2, gürültülü gerçek etiketleri, piksel açısından mükemmel derinliğe sahip sentetik verilerle değiştirir, ardından gerçek fotoğraflara geri döner, keskin sınırları korurken, gerçek derinlik açıklamalarının kıtlığını ve gürültüsünü ortadan kaldırır.

Stratejik Etki

Speed and scale

Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.

Build choices

Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.

Ekip ve iş akışı

Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.

Derinliğin GeleceğiHer Şey Monoküler Derinlik

Özel LiDAR'ın çok maliyetli veya hantal olduğu durumlarda AR gözlüklerine, akıllı telefon kameralarına ve robot teknolojisine daha sıkı entegrasyon bekleyebilirsiniz. Gerçek ölçüler üreten metrik değişkenler ve geçici olarak sabit derinliğe sahip (kareler arasında titreme olmayan) video modelleri hızla gelişiyor. Bu modeller cihazda gerçek zamanlı olarak çalışacak şekilde küçüldükçe, tek kameralı 3D algılama, uzaysal hesaplamayı, otonom navigasyonu ve üretken 3D sahne yeniden yapılandırmasını besleyen varsayılan bir yetenek haline gelecektir.

Gerçek Dünya Uygulaması

Tek lensli akıllı telefon portre fotoğraflarında gerçekçi arka plan bulanıklığı (bokeh) sağlamak için derinlik haritaları oluşturma.

LiDAR veya stereo kameraları olmayan düşük maliyetli drone ve robotlar için 3 boyutlu engel algılaması sağlanması.

Görüntü oluşturucuların sahne geometrisini koruması için ControlNet için derinlik koşullandırma haritaları oluşturma.

2D fotoğrafları ve filmleri VR ve stereoskopik ekranlar için 3D veya paralaks efektlerine dönüştürme.

Riskler ve Korkuluklar

Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.

Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.

Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.

Uygulama Yol Haritası

1

Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.

2

Gerçek üretim koşullarıyla eşleşen verilerle test edin.

3

Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.

4

Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DepthAnything Monocular Depth quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Monoküler Derinlik Tahmini

Sık sorulan sorular

What is DepthAnything Monocular Depth?

DepthAnything, özel bir donanıma ihtiyaç duymadan, her pikselin tek bir sıradan fotoğraftan ne kadar uzakta olduğunu tahmin eden bir temel modeldir. Sağlam, genel amaçlı derinlik algılamayı ucuz ve telefonlardan robotlara kadar her şey için erişilebilir hale getirdi.

'Monoküler' derinlik tahmini ne anlama geliyor?

Monoküler, derinliğin stereo çifti veya aktif sensör olmadan tek (mono) kamera görüntüsünden çıkarıldığı anlamına gelir.

Güçlü bir genelleme elde etmek için DepthAnything'in ana stratejisi neydi?

Ekip, on milyonlarca etiketsiz fotoğrafı sözde etiketleyen bir veri motoru oluşturarak eğitim ölçeğini önemli ölçüde genişletti.

DepthAnything hangi omurga kodlayıcıyı temel alıyor?

DepthAnything, DPT tarzı yoğun bir tahmin kafasıyla eşleştirilmiş bir DINOv2 ViT kodlayıcı kullanır.

Orijinal DepthAnything öncelikle ne tür bir derinlik sağlıyor?

Temel model, mutlak metrik mesafeler yerine göreceli derinlik sıralamasını tahmin eder.

DepthAnything V2 ince ayrıntıları ve kenarları nasıl geliştirdi?

V2, öğretmene tam derinlikli sentetik görüntüler konusunda eğitim verdi, ardından daha keskin sınırlar için gerçek fotoğraflara dönüştürüldü.