अशक्त-पाठ उलटा
नल-टेक्स्ट इनवर्जन एक ऐसी तकनीक है जो आपको स्टेबल डिफ्यूजन जैसे टेक्स्ट-संचालित डिफ्यूजन मॉडल के साथ एक वास्तविक फोटो को संपादित करने देती है, जबकि वह सब कुछ बरकरार रखती है जिसे आपने बदलने के लिए नहीं कहा था।
सिंहावलोकन
It bridges the gap between generating fresh images and faithfully reconstructing and re-editing ones you already have.
गहरा गोता
एक प्रसार मॉडल के साथ एक वास्तविक छवि को संपादित करने के लिए, आपको सबसे पहले उस शोर को खोजने के लिए पीढ़ी प्रक्रिया को पीछे की ओर चलाना होगा जो इसे फिर से बनाएगा। डीडीआईएम व्युत्क्रम नामक एक तेज़ विधि ऐसा करती है लेकिन बह जाती है, इसलिए पुनर्निर्माण थोड़ा गलत दिखता है। क्लासिफायर-मुक्त मार्गदर्शन, जो यह बढ़ाता है कि पाठ कितनी दृढ़ता से छवि को निर्देशित करता है, उस बहाव को बुरी तरह से बढ़ाता है। Google शोधकर्ताओं द्वारा 2022 में पेश किया गया नल-पाठ उलटा, मॉडल को फ़्रीज़ करके और इसके बजाय मार्गदर्शन में उपयोग किए जाने वाले 'शून्य' (खाली) टेक्स्ट एम्बेडिंग को अनुकूलित करके, प्रत्येक डीनोइज़िंग टाइमस्टेप को अनुकूलित करके इसे ठीक करता है। यह पुनर्निर्माण को मूल छवि पर वापस पिन कर देता है ताकि बाद में त्वरित संपादन, जैसे 'कुत्ते' को 'बिल्ली' में बदलना, केवल इच्छित सामग्री को बदल दे।
तकनीकी अंतर्दृष्टि
क्लासिफायर-मुक्त मार्गदर्शन एक सशर्त भविष्यवाणी (संकेत के साथ) और एक बिना शर्त भविष्यवाणी (एक खाली संकेत एम्बेडिंग के साथ) के बीच विस्तार करता है। अशक्त-पाठ उलटा वास्तविक संकेत और वजन को स्थिर रखता है, और ग्रेडिएंट-अनुकूलन लगभग 50 प्रसार चरणों में से प्रत्येक पर केवल उस खाली एम्बेडिंग को करता है ताकि निर्देशित प्रक्षेपवक्र पूर्व-गणना किए गए डीडीआईएम पथ को ट्रैक कर सके। परिणाम पूर्ण मार्गदर्शन शक्ति के साथ लगभग-पिक्सेल-परिपूर्ण पुनर्निर्माण है, जिससे सटीक संपादन चलाने के लिए संकेत मुक्त हो जाता है।
सामरिक प्रभाव
गति और पैमाना
विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।
विकल्प बनाएं
रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।
टीम और वर्कफ़्लो
संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।
अशक्त-पाठ उलटा का भविष्य
शून्य-पाठ उलटा धीमा था क्योंकि यह प्रति-छवि को अनुकूलित करता है, इसलिए नया काम तत्काल, अनुकूलन-मुक्त उलटा की ओर बढ़ता है। नेगेटिव-प्रॉम्प्ट इनवर्जन, डायरेक्ट इनवर्जन और तेज स्थिरता और कुछ-चरण वाले मॉडल पर निर्मित दृष्टिकोण जैसे तरीके एक ही फॉरवर्ड पास में समान निष्ठा का लक्ष्य रखते हैं। उम्मीद करें कि व्युत्क्रम उपभोक्ता फोटो संपादकों के अंदर एक शांत, अंतर्निहित कदम बन जाएगा, जो उपयोगकर्ता को कभी भी गणित देखे बिना विश्वसनीय वास्तविक-छवि संपादन को सक्षम करेगा।
वास्तविक विश्व कार्यान्वयन
एक वास्तविक अवकाश फ़ोटो को संपादित करना ताकि खड़ी कार एक अलग रंग की हो जाए जबकि सड़क, लोग और प्रकाश व्यवस्था अछूती रहे
पृष्ठभूमि या मुद्रा में बदलाव किए बिना किसी पारिवारिक चित्र में वास्तविक पालतू जानवर की नस्ल की अदला-बदली करना
केवल शीघ्र शब्द को संपादित करके एक लैंडस्केप फोटोग्राफ (ग्रीष्मकालीन पत्ते से शरद ऋतु) का मौसम बदलना
अनुसंधान डेमो और संपादन ऐप्स के अंदर उपयोगकर्ता द्वारा अपलोड की गई छवियों पर 'प्रॉम्प्ट-टू-प्रॉम्प्ट' शैली के स्थानीय संपादन को सशक्त बनाना
जोखिम और रेलिंग
यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।
मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।
जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।
कार्यान्वयन रोडमैप
सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।
वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।
कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।
कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Null-Text Inversion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
मेक-ए-वीडियो टेक्स्ट-टू-वीडियो
अक्सर पूछे जाने वाले प्रश्नों
What is Null-Text Inversion?
नल-टेक्स्ट इनवर्जन एक ऐसी तकनीक है जो आपको स्टेबल डिफ्यूजन जैसे टेक्स्ट-संचालित डिफ्यूजन मॉडल के साथ एक वास्तविक फोटो को संपादित करने देती है, जबकि वह सब कुछ बरकरार रखती है जिसे आपने बदलने के लिए नहीं कहा था। यह नई छवियां बनाने और आपके पास पहले से मौजूद छवियों को ईमानदारी से पुनर्निर्माण और पुन: संपादित करने के बीच के अंतर को पाटता है।
नल-पाठ व्युत्क्रम वास्तव में क्या अनुकूलित करता है?
यह मॉडल और वास्तविक प्रॉम्प्ट को स्थिर रखता है और प्रत्येक टाइमस्टेप पर केवल बिना शर्त/शून्य टेक्स्ट एम्बेडिंग को अनुकूलित करता है, जो तेज़ और गैर-विनाशकारी है।
संपादन के लिए उपयोग किए जाने पर सादा डीडीआईएम उलटा अविश्वसनीय क्यों हो जाता है?
डीडीआईएम उलटा छोटी त्रुटियों को जमा करता है, और अच्छे संपादन के लिए आवश्यक मजबूत मार्गदर्शन उस बहाव को बढ़ाता है, जिससे पुनर्निर्माण में गिरावट आती है।
किसी वास्तविक छवि को संपादित करने से पहले उसे उलटने का मुख्य लक्ष्य क्या है?
संपादन के लिए एक शोर बीज और प्रक्षेपवक्र की आवश्यकता होती है जो मूल का पुनर्निर्माण करता है, इसलिए त्वरित परिवर्तन केवल इच्छित सामग्री को बदलते हैं।
मोटे तौर पर नल-पाठ उलटा प्रसार प्रक्रिया में अनुकूलन को कैसे संभालता है?
एक अलग नल-टेक्स्ट एम्बेडिंग को टाइमस्टेप के अनुसार ट्यून किया जाता है ताकि निर्देशित पथ पूर्व-गणना किए गए व्युत्क्रम प्रक्षेपवक्र को बारीकी से ट्रैक कर सके।
शून्य-पाठ व्युत्क्रम को सबसे अधिक किस प्रकार के संपादन दृष्टिकोण के साथ जोड़ा जाता है?
एक बार जब एक वास्तविक छवि को ईमानदारी से उलट दिया जाता है, तो प्रॉम्प्ट-टू-प्रॉम्प्ट जैसी प्रॉम्प्ट-संचालित विधियाँ लक्षित, स्थानीयकृत परिवर्तन कर सकती हैं।