विज़ुअल एआई गाइड

टेक्स्ट-टू-3डी जेनरेशन

टेक्स्ट-टू-3डी पीढ़ी 'एक पुरानी चमड़े की कुर्सी' जैसे लिखित प्रॉम्प्ट को एक पूर्ण 3डी मॉडल में बदल देती है जिसे आप घुमा सकते हैं, रोशन कर सकते हैं और किसी गेम या दृश्य में छोड़ सकते हैं।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It promises to do for 3D assets what image generators did for pictures.

गहरा गोता

टेक्स्ट-टू-3डी सिस्टम एक वाक्य से 3डी प्रतिनिधित्व (एक जाल, बिंदु बादल, या चमक क्षेत्र) उत्पन्न करता है। Google के ड्रीमफ्यूजन (2022) जैसी प्रारंभिक सफलताओं में स्कोर डिस्टिलेशन सैंपलिंग का उपयोग किया गया: 3D डेटा पर प्रशिक्षण के बजाय, उन्होंने एक NeRF को अनुकूलित किया ताकि प्रत्येक प्रस्तुत 2D दृश्य एक जमे हुए 2D छवि प्रसार मॉडल के लिए प्रशंसनीय दिखे। इसने 2डी पूर्व से 3डी आकृतियों को बूटस्ट्रैप किया, लेकिन धीमा था, प्रति वस्तु घंटों का समय लेता था और अक्सर 'जानूस समस्या' उत्पन्न करता था जहां एक प्राणी कई चेहरे विकसित करता है। नए फ़ीड-फ़ॉरवर्ड मॉडल (OpenAI के प्वाइंट-ई और शेप-ई, साथ ही गॉसियन-स्प्लैटिंग और बड़े पुनर्निर्माण मॉडल) सेकंड से लेकर मिनटों में संपत्ति उत्पन्न करते हैं। गुणवत्ता, बहु-दृश्य स्थिरता, स्वच्छ टोपोलॉजी और प्रयोग करने योग्य बनावट सक्रिय चुनौतियां बनी हुई हैं।

तकनीकी अंतर्दृष्टि

ड्रीमफ्यूजन की मुख्य चाल, स्कोर डिस्टिलेशन सैंपलिंग (एसडीएस) के लिए किसी 3डी प्रशिक्षण डेटा की आवश्यकता नहीं है। यह एनईआरएफ के यादृच्छिक दृश्य प्रस्तुत करता है, शोर जोड़ता है, और एक पूर्व-प्रशिक्षित 2डी प्रसार मॉडल से पूछता है कि टेक्स्ट प्रॉम्प्ट की ओर कैसे निरूपित किया जाए। वह डीनोइज़िंग सिग्नल एक ग्रेडिएंट बन जाता है जो एनईआरएफ के मापदंडों को प्रभावित करता है ताकि प्रत्येक दृष्टिकोण प्रॉम्प्ट से मेल खाए। 2डी मॉडल एक आलोचक के रूप में कार्य करता है जो अपने छवि ज्ञान को एक सुसंगत 3डी ऑब्जेक्ट में वितरित करता है।

सामरिक प्रभाव

गति और पैमाना

विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।

विकल्प बनाएं

रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।

टीम और वर्कफ़्लो

संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।

टेक्स्ट-टू-3डी जेनरेशन का भविष्य

धीमी प्रति-ऑब्जेक्ट अनुकूलन से तेज़ फ़ीड-फ़ॉरवर्ड जेनरेटर में बदलाव की अपेक्षा करें जो सेकंड में स्वच्छ टोपोलॉजी, अलग सामग्री और यूवी मानचित्रों के साथ उत्पादन-तैयार जाल उत्सर्जित करते हैं। 3डी गॉसियन स्प्लैटिंग और बड़े पुनर्निर्माण मॉडल इसमें तेजी ला रहे हैं। गेम इंजन, सीएडी और एआर पाइपलाइनों के साथ-साथ टेक्स्ट-टू-4डी (एनिमेटेड, मूविंग ऑब्जेक्ट) में एकीकरण, संवादात्मक परिसंपत्ति निर्माण को नियमित बना देगा, हालांकि हेराफेरी और गेम-स्पेक अनुपालन के लिए मानव सफाई जारी रहेगी।

वास्तविक विश्व कार्यान्वयन

एक गेम स्टूडियो कलाकारों द्वारा नायक की संपत्तियों को परिष्कृत करने से पहले स्तरों को भरने के लिए पाठ संकेतों से पृष्ठभूमि प्रॉप्स (टोकरे, लैंप, पत्ते) का प्रोटोटाइप तैयार करता है।

एक ई-कॉमर्स साइट AR 'आपके कमरे में दृश्य' सुविधाओं के लिए कैटलॉग विवरण से स्वचालित रूप से घूमने योग्य 3D उत्पाद पूर्वावलोकन उत्पन्न करती है।

एक वास्तुकार परिसंपत्ति पुस्तकालयों को ब्राउज़ करने के बजाय 'मिड-सेंचुरी सोफा' टाइप करके फर्नीचर के साथ वॉकथ्रू रेंडर को तुरंत पॉप्युलेट करता है।

एक फिल्म प्री-विज़ टीम अंतिम मॉडल बनाने से पहले कैमरे के कोणों का परीक्षण करने के लिए एक स्क्रिप्ट विवरण से एक दृश्य के सेट ड्रेसिंग को ब्लॉक कर देती है।

जोखिम और रेलिंग

यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।

मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।

जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।

कार्यान्वयन रोडमैप

1

सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।

2

वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।

3

कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।

4

कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Text-to-3D Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

मैजिक3डी टेक्स्ट-टू-3डी पाइपलाइन

अक्सर पूछे जाने वाले प्रश्नों

What is Text-to-3D Generation?

टेक्स्ट-टू-3डी पीढ़ी 'एक पुरानी चमड़े की कुर्सी' जैसे लिखित प्रॉम्प्ट को एक पूर्ण 3डी मॉडल में बदल देती है जिसे आप घुमा सकते हैं, रोशन कर सकते हैं और किसी गेम या दृश्य में छोड़ सकते हैं। यह 3डी संपत्तियों के लिए वही करने का वादा करता है जो छवि जनरेटर ने चित्रों के लिए किया था।

ड्रीमफ्यूजन (2022) का प्रमुख नवाचार क्या था?

ड्रीमफ्यूजन ने एनईआरएफ को अनुकूलित किया ताकि प्रत्येक प्रस्तुत 2डी दृश्य एसडीएस का उपयोग करके और 3डी प्रशिक्षण डेटा की आवश्यकता के बिना एक जमे हुए 2डी छवि प्रसार मॉडल को संतुष्ट कर सके।

टेक्स्ट-टू-3डी में 'जेनस समस्या' क्या है?

दो-मुंह वाले रोमन देवता के नाम पर, जानूस समस्या तब होती है जब किसी वस्तु में अतिरिक्त चेहरे बढ़ जाते हैं क्योंकि प्रत्येक 2डी दृश्य कुछ हद तक स्वतंत्र रूप से अनुकूलित होता है।

कौन सी जोड़ी OpenAI के शुरुआती टेक्स्ट-टू-3D फ़ीड-फ़ॉरवर्ड मॉडल थे?

OpenAI ने प्वाइंट-ई (प्वाइंट क्लाउड) और शेप-ई जारी किया, जो अनुकूलन-आधारित तरीकों की तुलना में बहुत तेजी से 3डी संपत्तियां उत्पन्न करते हैं।

ड्रीमफ़्यूज़न जैसी प्रारंभिक अनुकूलन-आधारित विधियाँ धीमी क्यों थीं?

प्रत्येक ऑब्जेक्ट को कई शोर वाले रेंडरों में एनईआरएफ को पुनरावृत्त रूप से अनुकूलित करने की आवश्यकता होती है, जिसमें अक्सर प्रति परिसंपत्ति घंटों का समय लगता है।

कौन सा आउटपुट स्वरूप इन प्रणालियों द्वारा निर्मित एक विशिष्ट 3D प्रतिनिधित्व नहीं है?

टेक्स्ट-टू-3डी सिस्टम आउटपुट मेश, पॉइंट क्लाउड, या रेडिएंस फ़ील्ड; एमपी3 एक ऑडियो प्रारूप है, 3डी प्रतिनिधित्व नहीं।