मैरीगोल्ड प्रसार गहराई का अनुमान
मैरीगोल्ड अत्यधिक विस्तृत गहराई के मानचित्रों की भविष्यवाणी करने के लिए एक पूर्व-प्रशिक्षित छवि-पीढ़ी प्रसार मॉडल (स्थिर प्रसार) का पुन: उपयोग करता है।
सिंहावलोकन
It shows you can turn a generator's rich visual knowledge into a precise perception tool with surprisingly little training data.
गहरा गोता
मैरीगोल्ड (ईटीएच ज्यूरिख, सीवीपीआर 2024 बेस्ट पेपर ऑनरेबल मेंशन) एक सशर्त पीढ़ी की समस्या के रूप में गहराई के आकलन को फिर से परिभाषित करता है। स्क्रैच से गहराई वाले नेटवर्क को प्रशिक्षित करने के बजाय, यह एक इनपुट छवि पर वातानुकूलित गहराई मानचित्र को 'उत्पन्न' करने के लिए स्थिर प्रसार को ठीक करता है। अंतर्दृष्टि यह है कि फोटोरिअलिस्टिक छवियों को संश्लेषित करने के लिए प्रशिक्षित एक मॉडल पहले से ही अपने अव्यक्त स्थान में दृश्य ज्यामिति, प्रकाश व्यवस्था और संरचना को गहराई से सीख चुका है, जो कि गहराई के लिए उपयोगी है। उल्लेखनीय रूप से, मैरीगोल्ड को केवल सिंथेटिक डेटासेट (जैसे हाइपरसिम और वर्चुअल केआईटीटीआई) पर ठीक से ट्यून किया गया था, फिर भी यह शून्य-शॉट वाली वास्तविक तस्वीरों को अच्छी तरह से सामान्यीकृत करता है। यह असाधारण बारीक विवरण के साथ एफ़िन-अपरिवर्तनीय सापेक्ष गहराई उत्पन्न करता है, हालांकि पुनरावृत्त निरूपण इसे डेप्थएनीथिंग जैसे फ़ीड-फ़ॉरवर्ड मॉडल की तुलना में धीमा बनाता है।
तकनीकी अंतर्दृष्टि
मैरीगोल्ड स्टेबल डिफ्यूजन के अव्यक्त स्थान में काम करता है। छवि और गहराई मानचित्र दोनों एक ही VAE द्वारा एन्कोड किए गए हैं; यू-नेट को स्वच्छ छवि अव्यक्त पर वातानुकूलित गहराई अव्यक्त को दर्शाने के लिए ठीक से ट्यून किया गया है। अनुमान के समय यह मानक पुनरावृत्तीय डीनोइज़िंग लूप चलाता है, फिर गहराई को डिकोड करता है। क्योंकि यह नमूना है, स्थिरता के लिए कई रन जोड़े जा सकते हैं, सटीकता के लिए ट्रेडिंग गणना की जा सकती है। बाद में 'एलसीएम' और वन-स्टेप डिस्टिल्ड संस्करणों ने दर्जनों चरणों को एक ही पास तक कम कर दिया।
सामरिक प्रभाव
गति और पैमाना
विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।
विकल्प बनाएं
रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।
टीम और वर्कफ़्लो
संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।
मैरीगोल्ड डिफ्यूजन गहराई अनुमान का भविष्य
मैरीगोल्ड रेसिपी, घनी भविष्यवाणी के लिए प्रसार को ठीक करती है, गहराई से सतह के सामान्य, आंतरिक छवि अपघटन और सामग्री अनुमान से परे सामान्यीकरण कर रही है। तेज़ आसुत और स्थिरता-मॉडल वेरिएंट फ़ीड-फ़ॉरवर्ड नेटवर्क के साथ गति अंतर को बंद कर रहे हैं, जिससे इंटरैक्टिव टूल में प्रसार-आधारित धारणा व्यवहार्य हो रही है। एक व्यापक प्रवृत्ति की अपेक्षा करें जहां एक पूर्व-प्रशिक्षित जनरेटिव बैकबोन को कई ज्यामिति और धारणा कार्यों के लिए अनुकूलित किया जाता है, जिससे बड़े कार्य-विशिष्ट लेबल वाले डेटासेट की आवश्यकता कम हो जाती है।
वास्तविक विश्व कार्यान्वयन
रीलाइटिंग और 3डी मॉकअप के लिए वास्तुशिल्प और उत्पाद तस्वीरों से बारीक गहराई निकालना।
नियंत्रणीय छवि और वीडियो निर्माण के लिए कंडीशनिंग के रूप में उपयोग किए जाने वाले उच्च-विस्तार गहराई वाले मानचित्र तैयार करना।
मैट और लंबन कार्य में फिल्म और वीएफएक्स टीमों की सहायता करना जहां किनारे की सटीकता मायने रखती है।
एक अनुसंधान आधार रेखा के रूप में कार्य करते हुए यह दर्शाया गया है कि सघन पूर्वानुमान कार्यों के लिए जेनरेटिव पुअर्स को कैसे अनुकूलित किया जाए।
जोखिम और रेलिंग
यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।
मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।
जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।
कार्यान्वयन रोडमैप
सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।
वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।
कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।
कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Marigold Diffusion Depth Estimation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
मोनोक्युलर गहराई का अनुमान
अक्सर पूछे जाने वाले प्रश्नों
What is Marigold Diffusion Depth Estimation?
मैरीगोल्ड अत्यधिक विस्तृत गहराई के मानचित्रों की भविष्यवाणी करने के लिए एक पूर्व-प्रशिक्षित छवि-पीढ़ी प्रसार मॉडल (स्थिर प्रसार) का पुन: उपयोग करता है। यह दिखाता है कि आप आश्चर्यजनक रूप से कम प्रशिक्षण डेटा के साथ जनरेटर के समृद्ध दृश्य ज्ञान को एक सटीक धारणा उपकरण में बदल सकते हैं।
मैरीगोल्ड किस पूर्व-प्रशिक्षित मॉडल पर निर्माण करता है?
मैरीगोल्ड गहराई के नक्शे तैयार करने के लिए स्थिर प्रसार अव्यक्त प्रसार मॉडल को ठीक करता है।
मैरीगोल्ड गहराई आकलन कार्य को कैसे तैयार करता है?
यह गहराई को इनपुट छवि पर 'उत्पन्न' होने वाली चीज़ के रूप में मानता है, प्रसार मशीनरी का पुन: उपयोग करता है।
मैरीगोल्ड के प्रशिक्षण डेटा के बारे में क्या आश्चर्यजनक था?
मैरीगोल्ड को हाइपरसिम और वर्चुअल KITTI जैसे सिंथेटिक डेटा पर ठीक से ट्यून किया गया था, लेकिन यह वास्तविक तस्वीरों के लिए शून्य-शॉट को सामान्यीकृत करता है।
मैरीगोल्ड आमतौर पर फ़ीड-फ़ॉरवर्ड डेप्थ मॉडल की तुलना में धीमा क्यों है?
प्रसार मॉडल कई चरणों को दर्शाते हैं, जिससे एकल फॉरवर्ड पास की तुलना में अनुमान धीमा हो जाता है।
मैरीगोल्ड अपनी प्रसार प्रक्रिया किस स्थान पर करता है?
छवि और गहराई दोनों को वीएई अव्यक्त स्थान में एन्कोड किया गया है जहां यू-नेट दर्शाता है।