Görsel Yapay Zeka KILAVUZU

Görsel SLAM

Visual SLAM, hareketli bir kameranın bilinmeyen bir alanın haritasını oluşturmasına ve aynı zamanda bu harita içindeki kendi konumunu izlemesine olanak tanır.

2 min readSon güncelleme

Genel Bakış

It is the spatial backbone of robots, drones, AR headsets, and self-driving features.

Derin Dalış

SLAM, Eşzamanlı Yerelleştirme ve Haritalama anlamına gelir ve görsel varyant, bunu lidar veya radar yerine (veya yanında) kameralar kullanarak çözer. Kamera hareket ettikçe sistem, köşeler ve kenarlar gibi ayırt edici özellikleri tespit eder, bunları kareler arasında eşleştirir ve hem sahnenin 3 boyutlu yapısını hem de kameranın yörüngesini tahmin etmek için bu noktaların görünen hareketini kullanır. İşin zor kısmı tavuk-yumurta birleşimidir: Nerede olduğunuzu bilmek için bir haritaya ihtiyacınız vardır, ancak haritayı oluşturmak için nerede olduğunuzu bilmeniz gerekir. Visual SLAM bu sorunu ortaklaşa ele alır ve genellikle binlerce noktayı ve pozu aynı anda hassaslaştırır. GPS'in başarısız olduğu iç mekanlarda çalışan ARKit, ARCore, Meta Quest'in içten dışa takibine, Mars gezicilerine ve depo robotlarına güç sağlar.

Teknik Bilgi

Tipik bir boru hattının, özellikleri kareden kareye izleyen bir ön ucu (ORB, SIFT veya doğrudan fotometrik yöntemleri kullanarak) ve haritayı optimize eden bir arka ucu vardır. Paket ayarlama, birçok kamera pozunda ve 3D noktada yeniden yansıtma hatasını birlikte en aza indirirken döngü kapatma, kameranın bir yeri tekrar ziyaret ettiğini algılar ve birikmiş sapmayı düzeltir. Monoküler SLAM mutlak ölçeği kurtaramaz, bu nedenle bunu düzeltmek için stereo kameralar veya eylemsiz ölçüm birimi (IMU) birleştirilir.

Stratejik Etki

Speed and scale

Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.

Build choices

Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.

Ekip ve iş akışı

Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.

Görsel SLAM'in Geleceği

Alan, elle hazırlanmış özellik eşleştirmesinden öğrenilen özelliklere, öğrenilen derinliğe ve daha sağlam olan uçtan uca sinirsel SLAM'e, dokusuz duvarlara, hareket bulanıklığına ve değişen ışığa doğru geçiş yapıyor. Nöral parlaklık alanları ve Gauss sıçraması, seyrek nokta bulutları yerine yoğun, fotogerçekçi haritalar üretmek için SLAM'de bir araya getiriliyor. Telefonlarda ve kulaklıklarda daha sıkı görsel-ataletsel füzyonun yanı sıra nesneleri etiketleyen semantik SLAM'in, robotların yalnızca sahnenin geometrisinde gezinmekle kalmayıp, bir sahne hakkında akıl yürütmesine olanak tanımasını da bekleyebilirsiniz.

Gerçek Dünya Uygulaması

Meta Quest ve Apple Vision Pro kulaklıklarda kullanıcıyı harici baz istasyonları olmayan bir odaya konumlandıran içten dışa konumsal izleme

Apple ARKit ve Google ARCore, sanal mobilyaları veya oyun karakterlerini telefonlardaki gerçek zeminlere ve masalara sabitliyor

NASA'nın Mars gezicileri, GPS'in bulunmadığı arazilerde gezinmek için görsel kilometre ölçümü ve haritalama kullanıyor

Otonom depo robotları ve iç mekan teslimat robotları kat haritaları oluşturuyor ve raflar arasında konum belirliyor

Riskler ve Korkuluklar

Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.

Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.

Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.

Uygulama Yol Haritası

1

Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.

2

Gerçek üretim koşullarıyla eşleşen verilerle test edin.

3

Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.

4

Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Visual SLAM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Görsel Muhakeme

Sık sorulan sorular

What is Visual SLAM?

Visual SLAM, hareketli bir kameranın bilinmeyen bir alanın haritasını oluşturmasına ve aynı zamanda bu harita içindeki kendi konumunu izlemesine olanak tanır. Robotların, dronların, AR kulaklıkların ve otonom sürüş özelliklerinin mekansal omurgasıdır.

SLAM kısaltması ne anlama geliyor?

SLAM, Eşzamanlı Yerelleştirme ve Haritalama anlamına gelir: bir harita oluştururken aynı zamanda içindeki konumunuzu da belirler.

Monoküler (tek kameralı) görsel SLAM neden mutlak ölçeği kendi başına kurtaramıyor?

Tek bir kamerayla ve başka ipucu olmadan, yakındaki küçük bir sahne ile uzaktaki büyük bir sahne aynı görünebilir, dolayısıyla stereo veya IMU olmadan gerçek metrik ölçek belirsizdir.

SLAM sisteminde döngü kapatmanın amacı nedir?

Küçük izleme hataları zamanla sürüklenme olarak birikir; Kameranın bilinen bir noktaya döndüğünü tespit etmek sistemin tüm yörüngeyi düzeltmesine olanak tanır.

Paket ayarlaması SLAM arka ucunda neyi optimize eder?

Paket ayarlama, birçok kamera konumunu ve harita noktasını ortaklaşa iyileştirerek yansıtılan 3B noktaların, özelliklerin görüntülerde gerçekte göründüğü yerlerle en iyi şekilde eşleşmesini sağlar.

Neden bir IMU (eylemsizlik ölçüm birimi) görsel SLAM'de sıklıkla kameralarla birleştirilir?

İvmeölçerler ve jiroskoplar, hareket bulanıklığı yoluyla izlemeyi stabilize eden hareket tahminleri sağlar ve tek bir kameranın yapamayacağı şekilde ölçeğin çözülmesine yardımcı olur.