विज़ुअल एआई गाइड

गहराईकुछ भी एककोशिकीय गहराई

डेप्थएनीथिंग एक फाउंडेशन मॉडल है जो अनुमान लगाता है कि प्रत्येक पिक्सेल एक साधारण फोटो से कितनी दूर है, बिना किसी विशेष हार्डवेयर के।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It made robust, general-purpose depth sensing cheap and accessible for anything from phones to robots.

गहरा गोता

डेप्थएनीथिंग (2024, टिकटॉक/बाइटडांस और एचकेयू सहित शोधकर्ताओं द्वारा जारी) मोनोकुलर गहराई अनुमान से निपटता है: एक आरजीबी छवि से गहराई मानचित्र की भविष्यवाणी करता है। इसकी सफलता बड़े पैमाने पर थी: केवल उपलब्ध सीमित लेबल वाले गहराई डेटा पर भरोसा करने के बजाय, टीम ने एक इंजन बनाया जो एक शिक्षक मॉडल का उपयोग करके लगभग 62 मिलियन गैर-लेबल वाली तस्वीरों को ऑटो-लेबल करता था, फिर इस विशाल कॉर्पस पर एक छात्र को प्रशिक्षित करता था। यह इनडोर, आउटडोर और असामान्य दृश्यों में मजबूत शून्य-शॉट सामान्यीकरण देता है। मूल आउटपुट सापेक्ष गहराई (कौन से पिक्सेल निकट या दूर हैं, सटीक मीटर नहीं)। डेप्थएनीथिंग वी2 (2024 के मध्य) ने सटीक जमीनी सच्चाई के साथ सिंथेटिक डेटा पर शिक्षक को प्रशिक्षित करके, फिर वास्तविक छवियों को डिस्टिल करके, धुंधले किनारों और पारदर्शी-वस्तु त्रुटियों को ठीक करके बारीक विवरणों को तेज किया।

तकनीकी अंतर्दृष्टि

यह एक DPT-शैली सघन भविष्यवाणी हेड को फीड करने वाले DINOv2 विज़न-ट्रांसफॉर्मर एनकोडर का उपयोग करता है। मुख्य चाल अर्ध-पर्यवेक्षित आसवन है: एक शिक्षक लेबल किए गए डेटा छद्म-लेबल पर लाखों गैर-लेबल वाली छवियों को प्रशिक्षित करता है, और एक छात्र दोनों से सीखता है। V2 पिक्सेल-परिपूर्ण गहराई के साथ सिंथेटिक डेटा के लिए शोर वाले वास्तविक लेबलों की अदला-बदली करता है, फिर स्पष्ट सीमाओं को बनाए रखते हुए वास्तविक गहराई एनोटेशन की कमी और शोर को दरकिनार करते हुए वास्तविक तस्वीरों पर वापस लाता है।

सामरिक प्रभाव

गति और पैमाना

विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।

विकल्प बनाएं

रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।

टीम और वर्कफ़्लो

संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।

डेप्थएनीथिंग मोनोकुलर डेप्थ का भविष्य

एआर ग्लास, स्मार्टफोन कैमरे और रोबोटिक्स में सख्त एकीकरण की अपेक्षा करें जहां समर्पित LiDAR बहुत महंगा या भारी है। मीट्रिक वेरिएंट जो वास्तविक मीटर आउटपुट करते हैं, साथ ही अस्थायी रूप से स्थिर गहराई (फ्रेम के बीच कोई झिलमिलाहट नहीं) वाले वीडियो मॉडल तेजी से आगे बढ़ रहे हैं। जैसे ही ये मॉडल वास्तविक समय में डिवाइस पर चलने के लिए सिकुड़ते हैं, एकल-कैमरा 3डी धारणा एक डिफ़ॉल्ट क्षमता बन जाएगी, जो स्थानिक कंप्यूटिंग, स्वायत्त नेविगेशन और जेनरेटिव 3डी दृश्य पुनर्निर्माण को बढ़ावा देगी।

वास्तविक विश्व कार्यान्वयन

सिंगल-लेंस स्मार्टफोन पोर्ट्रेट तस्वीरों में यथार्थवादी पृष्ठभूमि धुंधलापन (बोकेह) लाने के लिए गहराई मानचित्र तैयार करना।

कम लागत वाले ड्रोन और रोबोटों के लिए 3डी बाधा धारणा प्रदान करना जिनमें LiDAR या स्टीरियो कैमरे की कमी है।

कंट्रोलनेट के लिए गहराई कंडीशनिंग मानचित्र बनाना ताकि छवि जनरेटर दृश्य ज्यामिति को संरक्षित कर सकें।

वीआर और स्टीरियोस्कोपिक डिस्प्ले के लिए 2डी फोटो और फिल्मों को 3डी या लंबन प्रभाव में परिवर्तित करना।

जोखिम और रेलिंग

यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।

मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।

जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।

कार्यान्वयन रोडमैप

1

सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।

2

वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।

3

कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।

4

कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DepthAnything Monocular Depth quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

मोनोक्युलर गहराई का अनुमान

अक्सर पूछे जाने वाले प्रश्नों

What is DepthAnything Monocular Depth?

डेप्थएनीथिंग एक फाउंडेशन मॉडल है जो अनुमान लगाता है कि प्रत्येक पिक्सेल एक साधारण फोटो से कितनी दूर है, बिना किसी विशेष हार्डवेयर के। इसने फोन से लेकर रोबोट तक किसी भी चीज़ के लिए मजबूत, सामान्य-उद्देश्यीय गहराई संवेदन को सस्ता और सुलभ बना दिया।

'मोनोकुलर' गहराई अनुमान का क्या मतलब है?

मोनोकुलर का अर्थ है कि गहराई का अनुमान एक (मोनो) कैमरा छवि से लगाया जाता है, जिसमें कोई स्टीरियो जोड़ी या सक्रिय सेंसर नहीं होता है।

मजबूत सामान्यीकरण प्राप्त करने के लिए डेप्थएनीथिंग की मुख्य रणनीति क्या थी?

टीम ने एक डेटा इंजन बनाया जो लाखों बिना लेबल वाली तस्वीरों को छद्म-लेबल करता है, जिससे नाटकीय रूप से प्रशिक्षण पैमाने का विस्तार होता है।

DepthAnything किस बैकबोन एन्कोडर पर निर्मित होता है?

DepthAnything एक DPT-शैली सघन भविष्यवाणी हेड के साथ युग्मित DINOv2 ViT एनकोडर का उपयोग करता है।

मूल DepthAnything मुख्य रूप से किस प्रकार की गहराई आउटपुट करता है?

आधार मॉडल पूर्ण मीट्रिक दूरियों के बजाय सापेक्ष गहराई क्रम की भविष्यवाणी करता है।

DepthAnything V2 ने बारीक विवरण और किनारों को कैसे बेहतर बनाया?

V2 ने शिक्षक को सटीक गहराई के साथ सिंथेटिक छवियों पर प्रशिक्षित किया, फिर स्पष्ट सीमाओं के लिए वास्तविक तस्वीरों का आसवन किया।