विज़ुअल एआई गाइड

DUSt3R सघन 3D पुनर्निर्माण

DUSt3R ज्ञात कैमरा स्थिति या अंशांकन की आवश्यकता के बिना कुछ सामान्य तस्वीरों से सघन 3D ज्यामिति का पुनर्निर्माण करता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It collapses the traditional multi-step photogrammetry pipeline into a single neural network that just outputs 3D points.

गहरा गोता

क्लासिक 3डी पुनर्निर्माण (संरचना-से-गति प्लस मल्टी-व्यू स्टीरियो) एक नाजुक श्रृंखला है: सुविधाओं का पता लगाएं, उनका मिलान करें, कैमरा पोज़ का अनुमान लगाएं, त्रिकोण बनाएं, फिर सघन करें। प्रत्येक चरण विफल हो सकता है, और आपको आमतौर पर कई ओवरलैपिंग छवियों और ज्ञात कैमरा इंट्रिनिक्स की आवश्यकता होती है। DUSt3R (वांग एट अल., 2024) पूरी समस्या को नए सिरे से प्रस्तुत करता है। केवल दो छवियों को देखते हुए, एक ट्रांसफार्मर-आधारित नेटवर्क सीधे प्रत्येक के लिए एक 'पॉइंटमैप' को पुनः प्राप्त करता है - एक सघन प्रति-पिक्सेल 3 डी समन्वय, दोनों को एक ही समन्वय फ्रेम में व्यक्त किया गया है। उन संरेखित बिंदु मानचित्रों से आप गहराई, कैमरा पोज़ और मिलान लगभग निःशुल्क पढ़ सकते हैं। दो से अधिक छवियों के लिए, DUSt3R एक वैश्विक संरेखण करता है जो सभी जोड़ीदार पॉइंटमैप को एक सुसंगत बिंदु क्लाउड में जोड़ता है। यह अनकैलिब्रेटेड कैमरों और बहुत कम, व्यापक दूरी वाले दृश्यों के साथ भी काम करता है।

तकनीकी अंतर्दृष्टि

मुख्य आउटपुट पॉइंटमैप है: एक सघन 2डी-टू-3डी मैपिंग जो एक छवि के प्रत्येक पिक्सेल को एक स्पष्ट 3डी स्थान पर रखती है, जिसमें जोड़ी की दोनों छवियां पहले कैमरे के समन्वय फ्रेम में वापस आ जाती हैं। क्योंकि साझा 3डी निर्देशांक में पत्राचार अंतर्निहित है, मुद्रा अनुमान और मिलान पूर्वापेक्षाओं के बजाय डाउनस्ट्रीम रीडआउट बन जाते हैं। दो छवि शाखाओं के बीच क्रॉस-अटेंशन वाला एक विज़न ट्रांसफार्मर नेटवर्क को दोनों दृश्यों के बारे में संयुक्त रूप से तर्क करने देता है, और सामने आई छवियों के बड़े डेटासेट से सीधे ज्यामिति सीखता है।

सामरिक प्रभाव

गति और पैमाना

विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।

विकल्प बनाएं

रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।

टीम और वर्कफ़्लो

संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।

DUSt3R सघन 3D पुनर्निर्माण का भविष्य

DUSt3R ने काम की एक तेजी से आगे बढ़ने वाली लाइन को जन्म दिया - MASt3R मजबूत सघन मिलान जोड़ता है, और फॉलो-अप वास्तविक समय और कई-दृश्य स्केलेबिलिटी की ओर बढ़ता है। प्रवृत्ति स्पष्ट है: हाथ से इंजीनियर की गई नाजुक पाइपलाइनों की जगह शुरू से अंत तक सीखी गई ज्यामिति। उम्मीद करें कि ये पॉइंटमैप मॉडल सीधे SLAM, रोबोटिक्स, AR और यहां तक ​​कि गॉसियन-स्प्लैटिंग इनिशियलाइज़ेशन में फीड होंगे, जिससे कैज़ुअल फ़ोन फ़ोटो लगभग किसी भी कैप्चर से मीट्रिक, सुसंगत 3D उत्पन्न करने के लिए पर्याप्त होंगे।

वास्तविक विश्व कार्यान्वयन

कैमरे की स्थिति का सर्वेक्षण किए बिना किसी कमरे या वस्तु के कुछ आकस्मिक फ़ोन स्नैपशॉट को प्रयोग करने योग्य 3D पॉइंट क्लाउड में बदलना।

बूटस्ट्रैप डाउनस्ट्रीम 3डी पुनर्निर्माण या विरल, अनकैलिब्रेटेड छवियों से गॉसियन स्प्लैटिंग के लिए कैमरा पोज़ और गहराई को पुनर्प्राप्त करना।

अभिलेखीय या इंटरनेट फ़ोटो से दृश्यों का पुनर्निर्माण करना जहां कैमरा अंशांकन डेटा अनुपलब्ध है।

केवल दो या तीन दृष्टिकोणों से रोबोटिक्स और एआर नेविगेशन के लिए तेज़ ज्यामिति अनुमान प्रदान करना।

जोखिम और रेलिंग

यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।

मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।

जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।

कार्यान्वयन रोडमैप

1

सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।

2

वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।

3

कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।

4

कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DUSt3R Dense 3D Reconstruction quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

मैजिक3डी टेक्स्ट-टू-3डी पाइपलाइन

अक्सर पूछे जाने वाले प्रश्नों

What is DUSt3R Dense 3D Reconstruction?

DUSt3R ज्ञात कैमरा स्थिति या अंशांकन की आवश्यकता के बिना कुछ सामान्य तस्वीरों से सघन 3D ज्यामिति का पुनर्निर्माण करता है। यह पारंपरिक मल्टी-स्टेप फोटोग्रामेट्री पाइपलाइन को एक एकल तंत्रिका नेटवर्क में ध्वस्त कर देता है जो सिर्फ 3 डी बिंदुओं को आउटपुट करता है।

क्लासिक संरचना-से-गति के विपरीत, DUSt3R को इनपुट के रूप में किस महत्वपूर्ण जानकारी की आवश्यकता नहीं है?

DUSt3R अनकैलिब्रेटेड कैमरों और अज्ञात पोज़ के साथ काम करता है; यह सीधे कच्ची छवियों से ज्यामिति का अनुमान लगाता है।

वह केंद्रीय आउटपुट क्या है जिसे DUSt3R का नेटवर्क प्रत्येक छवि के लिए पुनः प्राप्त करता है?

DUSt3R एक पॉइंटमैप की भविष्यवाणी करता है, प्रत्येक पिक्सेल को एक सघन 3D समन्वय निर्दिष्ट करता है, जिसमें एक साझा समन्वय फ्रेम में एक जोड़ी की दोनों छवियां होती हैं।

DUSt3R छवि युग्म में, दोनों पॉइंटमैप किस समन्वय फ़्रेम में व्यक्त किए गए हैं?

दोनों छवियों के पॉइंटमैप को पहले कैमरे के समन्वयित फ्रेम में वापस लाया गया है, जो उनकी ज्यामिति को सीधे तुलनीय बनाता है।

DUSt3R कैमरा पोज़ और पिक्सेल मिलान कैसे प्राप्त करता है?

क्योंकि साझा 3डी निर्देशांक में पत्राचार अंतर्निहित है, पोज़ और मिलान को पहले हल करने के बजाय पॉइंटमैप से पढ़ा जाता है।

DUSt3R दो से अधिक इनपुट छवियों को कैसे संभालता है?

एकाधिक दृश्यों के लिए, DUSt3R एक वैश्विक संरेखण चलाता है जो सभी जोड़ीदार पॉइंटमैप को एक सुसंगत बिंदु क्लाउड में फ़्यूज़ करता है।