विज़ुअल एआई गाइड

प्रॉम्प्ट-टू-प्रॉम्प्ट क्रॉस-अटेंशन संपादन

प्रॉम्प्ट-टू-प्रॉम्प्ट मॉडल के आंतरिक ध्यान मानचित्रों का पुन: उपयोग करते समय इसके टेक्स्ट प्रॉम्प्ट को बदलकर उत्पन्न छवि को संपादित करता है, इसलिए एक शब्द को बदलने से बाकी दृश्य को बरकरार रखते हुए उस तत्व को बदल दिया जाता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It is editing through words, not pixels.

गहरा गोता

प्रॉम्प्ट-टू-प्रॉम्प्ट (हर्ट्ज़ एट अल., 2022) प्रसार मॉडल में पाठ-संचालित संपादन के लिए एक प्रशिक्षण-मुक्त तकनीक है। मुख्य अंतर्दृष्टि यह है कि क्रॉस-अटेंशन मानचित्र, जो मॉडल को बताते हैं कि प्रत्येक शब्द को किस छवि क्षेत्र को प्रभावित करना चाहिए, दृश्य के स्थानिक लेआउट को एन्कोड करते हैं। जब आप थोड़े से संशोधित प्रॉम्प्ट के साथ एक छवि को पुन: उत्पन्न करते हैं, तो विधि मूल प्रॉम्प्ट के ध्यान मानचित्रों को नए रन में इंजेक्ट करती है। किसी शब्द, जैसे 'साइकिल' को 'मोटरसाइकिल' से बदलने पर, रचना और पृष्ठभूमि को संरक्षित करते हुए उस वस्तु की अदला-बदली हो जाती है। एक शब्द जोड़ने से केवल अपरिवर्तित टोकन पर ध्यान आकर्षित होता है, इसलिए हर चीज में फेरबदल किए बिना एक नई विशेषता दिखाई देती है। आप किसी टोकन के प्रभाव को मजबूत या कमजोर करने के लिए उस पर दोबारा ध्यान भी दे सकते हैं। क्योंकि इसमें किसी फ़ाइन-ट्यूनिंग या मास्क की आवश्यकता नहीं है, यह InstructPix2Pix की डेटा पीढ़ी सहित कई बाद के संपादन तरीकों के लिए एक मूलभूत निर्माण खंड बन गया।

तकनीकी अंतर्दृष्टि

डीनोइज़िंग के दौरान, प्रत्येक टोकन के लिए, क्रॉस-अटेंशन, छवि में जहां वह उपस्थित होता है, उसके स्थानिक मानचित्र की गणना करता है। प्रॉम्प्ट-टू-प्रॉम्प्ट इन मानचित्रों को मूल पीढ़ी से साझा टोकन के लिए संपादित मानचित्र में कॉपी करता है। शब्द अदला-बदली के लिए यह संबंधित टोकन के बीच ध्यान आकर्षित करता है; जोड़े गए शब्दों के लिए यह पुराने मानचित्रों को संरक्षित करता है और केवल नए टोकन को ताज़ा ध्यान आकर्षित करने देता है; पुनर्भारित करना केवल टोकन के ध्यान मूल्यों को मापता है, इसके दृश्य प्रभाव को तीव्र या म्यूट करता है।

सामरिक प्रभाव

गति और पैमाना

विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।

विकल्प बनाएं

रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।

टीम और वर्कफ़्लो

संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।

प्रॉम्प्ट-टू-प्रॉम्प्ट क्रॉस-अटेंशन एडिटिंग का भविष्य

क्रॉस-अटेंशन हेरफेर अब नियंत्रणीय पीढ़ी के उपकरणों के एक पूरे परिवार को रेखांकित करता है, और विचार नए आर्किटेक्चर में ध्यान नियंत्रण और अस्थायी रूप से सुसंगत संपादन के लिए वीडियो प्रसार तक विस्तारित होते हैं। व्युत्क्रम के माध्यम से वास्तविक-छवि संपादन के साथ सख्त एकीकरण, बड़े संरचनात्मक परिवर्तनों की अधिक मजबूत हैंडलिंग और निर्देश मॉडल के साथ संयोजन की अपेक्षा करें ताकि ध्यान देने वाली युक्तियाँ एक सरल प्राकृतिक-भाषा इंटरफ़ेस के तहत अदृश्य रूप से चलें।

वास्तविक विश्व कार्यान्वयन

एक डिजाइनर 'सड़क पर एक लाल कार' को 'सड़क पर एक नीली कार' में बदल देता है और बिल्कुल वही दृश्य लेआउट रखता है।

एक चित्रकार ने परिदृश्य को विविधताओं के बीच उत्तरोत्तर अधिक सर्द बनाने के लिए 'बर्फीले' शब्द पर दोबारा जोर दिया है।

एक कहानीकार एक चरित्र पत्रक के लिए एक समान मुद्रा और पृष्ठभूमि रखने के संकेत में 'शेर' को 'बाघ' से बदल देता है।

एक शोधकर्ता इसका उपयोग निर्देश-अनुसरण करने वाले संपादक के लिए प्रशिक्षण डेटा के रूप में पहले/बाद की जोड़ीदार छवियां उत्पन्न करने के लिए करता है।

जोखिम और रेलिंग

यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।

मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।

जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।

कार्यान्वयन रोडमैप

1

सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।

2

वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।

3

कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।

4

कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Prompt-to-Prompt Cross-Attention Editing quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is Prompt-to-Prompt Cross-Attention Editing?

प्रॉम्प्ट-टू-प्रॉम्प्ट मॉडल के आंतरिक ध्यान मानचित्रों का पुन: उपयोग करते समय इसके टेक्स्ट प्रॉम्प्ट को बदलकर उत्पन्न छवि को संपादित करता है, इसलिए एक शब्द को बदलने से बाकी दृश्य को बरकरार रखते हुए उस तत्व को बदल दिया जाता है। यह शब्दों के माध्यम से संपादन है, पिक्सेल के माध्यम से नहीं।

किसी दृश्य को संरक्षित करने के लिए प्रॉम्प्ट-टू-प्रॉम्प्ट किस आंतरिक जानकारी का पुन: उपयोग करता है?

क्रॉस-अटेंशन मैप्स एनकोड करते हैं जहां प्रत्येक शब्द छवि को प्रभावित करता है, इसलिए उनका पुन: उपयोग संपादन के दौरान लेआउट को सुसंगत रखता है।

क्या प्रॉम्प्ट-टू-प्रॉम्प्ट को मॉडल को ठीक करने की आवश्यकता है?

यह अनुमान के समय ध्यान आकर्षित करता है और इसके लिए किसी अतिरिक्त प्रशिक्षण की आवश्यकता नहीं होती है।

किसी टोकन का ध्यान फिर से बढ़ाने से क्या हासिल होता है?

किसी टोकन के ध्यान मूल्यों को स्केल करना उस अवधारणा को कितनी दृढ़ता से प्रकट करता है, इसे तीव्र या म्यूट कर देता है।

प्रॉम्प्ट-टू-प्रॉम्प्ट को एक मूलभूत तकनीक क्यों माना जाता है?

इसका प्रशिक्षण-मुक्त ध्यान हेरफेर उसके बाद के संपादन अनुसंधान में पुन: उपयोग किया जाने वाला एक बिल्डिंग ब्लॉक बन गया।