शून्य-1-से-3 उपन्यास दृश्य प्रसार
ज़ीरो-1-टू-3 आपके द्वारा मांगे गए कैमरा रोटेशन पर वातानुकूलित एक प्रसार मॉडल का उपयोग करके, किसी वस्तु की एक तस्वीर को किसी भी नए कोण से देखी गई उसी वस्तु की छवियों में बदल देता है।
सिंहावलोकन
It matters because it lets you reconstruct 3D-consistent views without ever scanning the object from multiple sides.
गहरा गोता
जीरो-1-टू-3 (कोलंबिया से, 2023) स्टेबल डिफ्यूजन को फाइन-ट्यून करता है ताकि यह एक इनपुट छवि से शून्य-शॉट उपन्यास दृश्य संश्लेषण कर सके। आप इसे एक एकल चित्र और एक सापेक्ष कैमरा ट्रांसफ़ॉर्म (एक रोटेशन और एक छोटा अनुवाद) फ़ीड करते हैं, और मॉडल उस नए दृष्टिकोण से ऑब्जेक्ट कैसा दिखेगा, यह उत्पन्न करता है। मुख्य विचार यह है कि विशाल वेब छवि संग्रहों पर प्रशिक्षित बड़े 2डी प्रसार मॉडल ने 3डी में वस्तुएं कैसी दिखती हैं, इसके बारे में ज्यामितीय और भौतिक प्राथमिकताओं को अंतर्निहित रूप से अवशोषित कर लिया है। कई नियंत्रित कैमरा कोणों (ऑब्जावर्स का उपयोग करके) से प्रस्तुत वस्तुओं के सिंथेटिक डेटासेट पर फाइन-ट्यूनिंग करके, मॉडल उन पूर्ववर्तियों को स्पष्ट कैमरा नियंत्रण पर मैप करना सीखता है। उत्पन्न दृश्य फिर डाउनस्ट्रीम 3डी पुनर्निर्माण को फ़ीड कर सकते हैं।
तकनीकी अंतर्दृष्टि
स्रोत छवि पर मॉडल की स्थिति दो तरह से होती है: एक सीएलआईपी एम्बेडिंग को क्रॉस-अटेंशन को नियंत्रित करने के लिए सापेक्ष कैमरा पोज़ (एज़िमुथ, ऊंचाई, त्रिज्या) के साथ जोड़ा जाता है, जबकि कच्ची छवि शोर अव्यक्त के लिए चैनल-संबद्ध होती है ताकि बारीक विवरण और पहचान संरक्षित रहे। प्रशिक्षण सीएडी ऑब्जेक्ट्स से प्रदान की गई छवि-पोज़-छवि ट्रिपलेट्स का उपयोग करता है, इसलिए नेटवर्क एक दृष्टिकोण परिवर्तन और परिणामी पिक्सेल परिवर्तन के बीच नियंत्रणीय मैपिंग सीखता है।
सामरिक प्रभाव
गति और पैमाना
विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।
विकल्प बनाएं
रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।
टीम और वर्कफ़्लो
संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।
शून्य-1-से-3 उपन्यास दृश्य प्रसार का भविष्य
शून्य-1-से-3 ने छवि-से-3डी पाइपलाइनों की एक लहर शुरू की। ज़ीरो123-एक्सएल, सिंकड्रीमर और वन-2-3-45 जैसे उत्तराधिकारी मल्टी-व्यू स्थिरता और तेज़, अधिक विश्वसनीय 3डी मेश आउटपुट की ओर बढ़ते हैं, जबकि गॉसियन स्प्लैटिंग और बड़े पुनर्निर्माण मॉडल के साथ एकीकरण पीढ़ी के समय को मिनटों से घटाकर सेकंड कर रहा है। सख्त दृश्य स्थिरता, उच्च रिज़ॉल्यूशन और वास्तविक दुनिया (केवल सिंथेटिक-ऑब्जेक्ट नहीं) सामान्यीकरण की अपेक्षा करें क्योंकि ये दृष्टिकोण-नियंत्रणीय प्रसार मॉडल सामग्री निर्माण के लिए मानक टूल में परिपक्व होते हैं।
वास्तविक विश्व कार्यान्वयन
एकल उत्पाद फोटो के टर्नटेबल दृश्य उत्पन्न करना ताकि ई-कॉमर्स लिस्टिंग आइटम को सभी तरफ से दिखा सके
एआर पूर्वावलोकन के लिए एक कैज़ुअल फोन स्नैपशॉट से किसी ऑब्जेक्ट के बनावट वाले 3डी जाल को बूटस्ट्रैप करना
खेल और फिल्म अवधारणा कलाकारों के लिए किसी चरित्र या प्रोप की सुसंगत बहु-कोण संदर्भ कला बनाना
अनदेखी ज्यामिति को भरने के लिए एनईआरएफ या गॉसियन स्प्लैटिंग पुनर्निर्माण में संश्लेषित उपन्यास दृश्यों को फीड करना
जोखिम और रेलिंग
यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।
मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।
जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।
कार्यान्वयन रोडमैप
सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।
वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।
कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।
कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Zero-1-to-3 Novel View Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
उपन्यास दृश्य संश्लेषण
अक्सर पूछे जाने वाले प्रश्नों
What is Zero-1-to-3 Novel View Diffusion?
ज़ीरो-1-टू-3 आपके द्वारा मांगे गए कैमरा रोटेशन पर वातानुकूलित एक प्रसार मॉडल का उपयोग करके, किसी वस्तु की एक तस्वीर को किसी भी नए कोण से देखी गई उसी वस्तु की छवियों में बदल देता है। यह मायने रखता है क्योंकि यह आपको ऑब्जेक्ट को कई तरफ से स्कैन किए बिना 3डी-सुसंगत दृश्यों को फिर से बनाने की सुविधा देता है।
नया दृश्य उत्पन्न करने के लिए एकल छवि के अलावा शून्य-1-से-3 तक मुख्य इनपुट की क्या आवश्यकता है?
शून्य-1-से-3 एक एकल छवि और एक सापेक्ष कैमरा पोज़ पर वातानुकूलित है, इसलिए आप वांछित दृश्य बिंदु पर रोटेशन और अनुवाद निर्दिष्ट करते हैं।
जीरो-1-टू-3 किस प्रकार के मॉडल को फाइन-ट्यूनिंग करके बनाया गया है?
यह एक बड़े पूर्व-प्रशिक्षित 2डी प्रसार मॉडल को ठीक करता है ताकि यह उन ज्यामितीय प्राथमिकताओं का फायदा उठा सके जो उन मॉडलों ने वेब छवियों से परोक्ष रूप से सीखे हैं।
एक 2डी प्रसार मॉडल शून्य-शॉट उपन्यास दृश्य संश्लेषण क्यों कर सकता है?
बड़े पैमाने पर 2डी प्रशिक्षण इस बात का अंतर्निहित ज्ञान प्रदान करता है कि वस्तुएं 3डी में कैसे दिखाई देती हैं, जिसे फाइन-ट्यूनिंग से कैमरा पोज़ के माध्यम से नियंत्रित किया जा सकता है।
ज़ीरो-1-टू-3 के प्रशिक्षण के लिए 3डी ऑब्जेक्ट का कौन सा डेटासेट केंद्रीय था?
इसे ओब्जावर्स जैसे बड़े सिंथेटिक 3डी ऑब्जेक्ट संग्रह से प्रस्तुत इमेज-पोज़-इमेज ट्रिपलेट्स पर प्रशिक्षित किया गया था।
स्रोत छवि का बारीक विवरण पीढ़ी में कैसे संरक्षित किया जाता है?
कच्ची छवि शोर वाले अव्यक्त (शब्दार्थ के लिए सीएलआईपी एम्बेडिंग के साथ) के साथ चैनल-संबद्ध होती है, इसलिए पहचान और विवरण आगे बढ़ते हैं।