DerinlikHer Şey Monoküler Derinlik
DepthAnything, özel bir donanıma ihtiyaç duymadan, her pikselin tek bir sıradan fotoğraftan ne kadar uzakta olduğunu tahmin eden bir temel modeldir.
Genel Bakış
It made robust, general-purpose depth sensing cheap and accessible for anything from phones to robots.
Derin Dalış
DepthAnything (2024, TikTok/ByteDance ve HKU'daki araştırmacılar da dahil olmak üzere araştırmacılar tarafından yayınlandı) monoküler derinlik tahminini ele alıyor: bir RGB görüntüsünden bir derinlik haritası tahmin etmek. Buluşun atılımı ölçekti: Ekip, yalnızca mevcut sınırlı etiketli derinlik verilerine güvenmek yerine, bir öğretmen modeli kullanarak yaklaşık 62 milyon etiketsiz fotoğrafı otomatik olarak etiketleyen bir motor geliştirdi ve ardından bir öğrenciyi bu devasa külliyat konusunda eğitti. Bu, iç mekan, dış mekan ve olağandışı sahnelerde güçlü sıfır çekim genellemesi sağlar. Orijinal, göreceli derinliği verir (hangi pikseller daha yakın veya daha uzaktır, tam metre değil). DepthAnything V2 (2024 ortası), öğretmeni mükemmel temel gerçeğe sahip sentetik veriler konusunda eğiterek, ardından gerçek görüntülere dönüştürerek, bulanık kenarları ve şeffaf nesne hatalarını düzelterek ince ayrıntıları keskinleştirdi.
Teknik Bilgi
DPT tarzı yoğun bir tahmin kafasını besleyen bir DINOv2 görüntü transformatörü kodlayıcı kullanır. İşin püf noktası, yarı denetimli damıtmadır: Etiketli veriler konusunda eğitim almış bir öğretmen, milyonlarca etiketsiz görüntüyü sahte etiketlerle etiketler ve öğrenci her ikisinden de öğrenir. V2, gürültülü gerçek etiketleri, piksel açısından mükemmel derinliğe sahip sentetik verilerle değiştirir, ardından gerçek fotoğraflara geri döner, keskin sınırları korurken, gerçek derinlik açıklamalarının kıtlığını ve gürültüsünü ortadan kaldırır.
Stratejik Etki
Speed and scale
Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.
Build choices
Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.
Ekip ve iş akışı
Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.
Derinliğin GeleceğiHer Şey Monoküler Derinlik
Özel LiDAR'ın çok maliyetli veya hantal olduğu durumlarda AR gözlüklerine, akıllı telefon kameralarına ve robot teknolojisine daha sıkı entegrasyon bekleyebilirsiniz. Gerçek ölçüler üreten metrik değişkenler ve geçici olarak sabit derinliğe sahip (kareler arasında titreme olmayan) video modelleri hızla gelişiyor. Bu modeller cihazda gerçek zamanlı olarak çalışacak şekilde küçüldükçe, tek kameralı 3D algılama, uzaysal hesaplamayı, otonom navigasyonu ve üretken 3D sahne yeniden yapılandırmasını besleyen varsayılan bir yetenek haline gelecektir.
Gerçek Dünya Uygulaması
Tek lensli akıllı telefon portre fotoğraflarında gerçekçi arka plan bulanıklığı (bokeh) sağlamak için derinlik haritaları oluşturma.
LiDAR veya stereo kameraları olmayan düşük maliyetli drone ve robotlar için 3 boyutlu engel algılaması sağlanması.
Görüntü oluşturucuların sahne geometrisini koruması için ControlNet için derinlik koşullandırma haritaları oluşturma.
2D fotoğrafları ve filmleri VR ve stereoskopik ekranlar için 3D veya paralaks efektlerine dönüştürme.
Riskler ve Korkuluklar
Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.
Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.
Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.
Uygulama Yol Haritası
Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.
Gerçek üretim koşullarıyla eşleşen verilerle test edin.
Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.
Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DepthAnything Monocular Depth quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Monoküler Derinlik Tahmini
Sık sorulan sorular
What is DepthAnything Monocular Depth?
DepthAnything, özel bir donanıma ihtiyaç duymadan, her pikselin tek bir sıradan fotoğraftan ne kadar uzakta olduğunu tahmin eden bir temel modeldir. Sağlam, genel amaçlı derinlik algılamayı ucuz ve telefonlardan robotlara kadar her şey için erişilebilir hale getirdi.
'Monoküler' derinlik tahmini ne anlama geliyor?
Monoküler, derinliğin stereo çifti veya aktif sensör olmadan tek (mono) kamera görüntüsünden çıkarıldığı anlamına gelir.
Güçlü bir genelleme elde etmek için DepthAnything'in ana stratejisi neydi?
Ekip, on milyonlarca etiketsiz fotoğrafı sözde etiketleyen bir veri motoru oluşturarak eğitim ölçeğini önemli ölçüde genişletti.
DepthAnything hangi omurga kodlayıcıyı temel alıyor?
DepthAnything, DPT tarzı yoğun bir tahmin kafasıyla eşleştirilmiş bir DINOv2 ViT kodlayıcı kullanır.
Orijinal DepthAnything öncelikle ne tür bir derinlik sağlıyor?
Temel model, mutlak metrik mesafeler yerine göreceli derinlik sıralamasını tahmin eder.
DepthAnything V2 ince ayrıntıları ve kenarları nasıl geliştirdi?
V2, öğretmene tam derinlikli sentetik görüntüler konusunda eğitim verdi, ardından daha keskin sınırlar için gerçek fotoğraflara dönüştürüldü.