विज़ुअल एआई गाइड

विजुअल स्लैम

विज़ुअल SLAM एक गतिशील कैमरे को किसी अज्ञात स्थान का मानचित्र बनाने देता है और साथ ही उस मानचित्र के अंदर अपनी स्थिति को ट्रैक करने देता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It is the spatial backbone of robots, drones, AR headsets, and self-driving features.

गहरा गोता

SLAM का मतलब एक साथ स्थानीयकरण और मैपिंग है, और दृश्य संस्करण इसे लिडार या रडार के बजाय (या साथ में) कैमरों का उपयोग करके हल करता है। जैसे ही कैमरा चलता है, सिस्टम कोनों और किनारों जैसी विशिष्ट विशेषताओं का पता लगाता है, उन्हें फ्रेम में मिलाता है, और दृश्य की 3डी संरचना और कैमरे के प्रक्षेपवक्र दोनों का अनुमान लगाने के लिए उन बिंदुओं की स्पष्ट गति का उपयोग करता है। कठिन हिस्सा मुर्गी-और-अंडे का युग्मन है: आपको यह जानने के लिए एक मानचित्र की आवश्यकता है कि आप कहां हैं, लेकिन मानचित्र बनाने के लिए आपको यह जानना होगा कि आप कहां हैं। विज़ुअल SLAM इससे संयुक्त रूप से निपटता है, अक्सर एक ही बार में हजारों बिंदुओं और पोज़ को परिष्कृत करता है। यह ARKit, ARCore, Meta क्वेस्ट की इनसाइड-आउट ट्रैकिंग, मार्स रोवर्स और वेयरहाउस रोबोट को शक्ति प्रदान करता है, जो घर के अंदर काम करते हैं जहां जीपीएस विफल हो जाता है।

तकनीकी अंतर्दृष्टि

एक विशिष्ट पाइपलाइन में एक फ्रंट एंड होता है जो फ्रेम टू फ्रेम (ओआरबी, एसआईएफटी, या डायरेक्ट फोटोमेट्रिक तरीकों का उपयोग करके) सुविधाओं को ट्रैक करता है और एक बैक एंड होता है जो मानचित्र को अनुकूलित करता है। बंडल समायोजन संयुक्त रूप से कई कैमरा पोज़ और 3डी बिंदुओं पर रिप्रोजेक्शन त्रुटि को कम करता है, जबकि लूप क्लोजर यह पता लगाता है कि कैमरा किसी स्थान पर दोबारा जाता है और संचित बहाव को ठीक करता है। मोनोकुलर SLAM पूर्ण पैमाने को पुनर्प्राप्त नहीं कर सकता है, इसलिए इसे ठीक करने के लिए स्टीरियो कैमरे या एक जड़त्वीय माप इकाई (IMU) को फ़्यूज़ किया जाता है।

सामरिक प्रभाव

गति और पैमाना

विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।

विकल्प बनाएं

रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।

टीम और वर्कफ़्लो

संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।

विज़ुअल SLAM का भविष्य

यह क्षेत्र हस्त-निर्मित फीचर मिलान से सीखी गई विशेषताओं, सीखी गई गहराई और एंड-टू-एंड न्यूरल एसएलएएम की ओर स्थानांतरित हो रहा है जो बनावट-रहित दीवारों, मोशन ब्लर और बदलती रोशनी के लिए अधिक मजबूत है। विरल बिंदु बादलों के बजाय घने, फोटोयथार्थवादी मानचित्र बनाने के लिए तंत्रिका चमक क्षेत्रों और गॉसियन स्प्लैटिंग को एसएलएएम में जोड़ा जा रहा है। फोन और हेडसेट पर सख्त दृश्य-जड़त्वीय संलयन की अपेक्षा करें, साथ ही सिमेंटिक एसएलएएम जो वस्तुओं को लेबल करता है, रोबोट को किसी दृश्य के बारे में तर्क करने में सक्षम बनाता है, न कि केवल उसकी ज्यामिति को नेविगेट करने में।

वास्तविक विश्व कार्यान्वयन

Meta क्वेस्ट और ऐप्पल विज़न प्रो हेडसेट पर अंदर-बाहर स्थितीय ट्रैकिंग, बाहरी बेस स्टेशनों के बिना एक कमरे में उपयोगकर्ता का पता लगाना

Apple ARKit और Google ARCore फोन पर वास्तविक फर्श और टेबल पर आभासी फर्नीचर या गेम पात्रों की एंकरिंग कर रहे हैं

नासा के मार्स रोवर्स विज़ुअल ओडोमेट्री और मैपिंग का उपयोग करके उन इलाकों में नेविगेट करते हैं जहां कोई जीपीएस मौजूद नहीं है

स्वायत्त गोदाम रोबोट और इनडोर डिलीवरी रोबोट फर्श के नक्शे बनाते हैं और अलमारियों के बीच स्थानीयकरण करते हैं

जोखिम और रेलिंग

यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।

मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।

जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।

कार्यान्वयन रोडमैप

1

सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।

2

वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।

3

कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।

4

कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Visual SLAM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is Visual SLAM?

विज़ुअल SLAM एक गतिशील कैमरे को किसी अज्ञात स्थान का मानचित्र बनाने देता है और साथ ही उस मानचित्र के अंदर अपनी स्थिति को ट्रैक करने देता है। यह रोबोट, ड्रोन, एआर हेडसेट और सेल्फ-ड्राइविंग सुविधाओं की स्थानिक रीढ़ है।

SLAM का संक्षिप्त रूप क्या है?

SLAM का अर्थ है एक साथ स्थानीयकरण और मानचित्रण: एक ही समय में उसमें अपनी स्थिति का पता लगाते हुए एक मानचित्र बनाना।

मोनोक्युलर (एकल-कैमरा) विज़ुअल SLAM अपने आप पूर्ण पैमाने को पुनर्प्राप्त करने में असमर्थ क्यों है?

एक कैमरे और किसी अन्य संकेत के बिना, पास का एक छोटा दृश्य और दूर का एक बड़ा दृश्य समान दिख सकता है, इसलिए स्टीरियो या आईएमयू के बिना वास्तविक मीट्रिक पैमाना अस्पष्ट है।

SLAM प्रणाली में लूप क्लोजर का उद्देश्य क्या है?

छोटी ट्रैकिंग त्रुटियाँ समय के साथ बहाव के रूप में जमा होती जाती हैं; यह पता लगाने से कि कैमरा किसी ज्ञात स्थान पर वापस आ गया है, सिस्टम को पूरे प्रक्षेप पथ को सही करने की सुविधा मिलती है।

SLAM बैकएंड में बंडल समायोजन क्या अनुकूलित करता है?

बंडल समायोजन संयुक्त रूप से कई कैमरा स्थितियों और मानचित्र बिंदुओं को परिष्कृत करता है ताकि अनुमानित 3डी बिंदु सबसे अच्छे से मेल खाते हों जहां छवियां वास्तव में छवियों में दिखाई देती हैं।

विज़ुअल SLAM में IMU (जड़त्वीय माप इकाई) को अक्सर कैमरों के साथ क्यों जोड़ा जाता है?

एक्सेलेरोमीटर और जाइरोस्कोप गति अनुमान प्रदान करते हैं जो मोशन ब्लर के माध्यम से ट्रैकिंग को स्थिर करते हैं और स्केल को हल करने में मदद करते हैं, जो एक अकेला कैमरा नहीं कर सकता है।