विज़ुअल एआई गाइड

कस्टम डिफ्यूजन मल्टी-कॉन्सेप्ट ट्यूनिंग

कस्टम डिफ्यूजन एक हल्की फाइन-ट्यूनिंग विधि है जो कुछ ही तस्वीरों से टेक्स्ट-टू-इमेज मॉडल को आपके कुत्ते या विशिष्ट कुर्सी जैसी नई व्यक्तिगत अवधारणाएं सिखाती है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

Its standout feature is composing several newly learned concepts together in one generated scene.

गहरा गोता

2022 में एडोब और सीएमयू शोधकर्ताओं द्वारा जारी, कस्टम डिफ्यूजन पूरे नेटवर्क को फिर से प्रशिक्षित किए बिना स्टेबल डिफ्यूजन जैसे मॉडल को वैयक्तिकृत करता है। प्रत्येक भार को अपडेट करने के बजाय, यह पता चला कि क्रॉस-अटेंशन परतों में केवल एक छोटा टुकड़ा, कुंजी और मूल्य प्रक्षेपण मैट्रिक्स को अपडेट करना, लगभग 4 से 20 छवियों की एक नई अवधारणा को अवशोषित करने के लिए पर्याप्त है। यह तेज़ (मिनट) ट्यूनिंग रखता है और भंडारण छोटा (गीगाबाइट के बजाय मेगाबाइट) रखता है। महत्वपूर्ण रूप से, यह संयुक्त प्रशिक्षण के माध्यम से या एक सीमित अनुकूलन का उपयोग करके अलग-अलग प्रशिक्षित अवधारणाओं को विलय करके एक साथ कई अवधारणाओं को सीख सकता है। इससे आपको संकेत मिलता है, मान लीजिए, आपकी विशिष्ट डिज़ाइनर कुर्सी पर बैठी आपकी विशिष्ट बिल्ली, कुछ एकल-अवधारणा विधियों को संयोजित करने के लिए संघर्ष करती है।

तकनीकी अंतर्दृष्टि

क्रॉस-अटेंशन वह जगह है जहां टेक्स्ट प्रॉम्प्ट छवि को प्रभावित करता है; टेक्स्ट टोकन प्रश्न बनाते हैं जो कुंजी और मूल्य मैट्रिक्स के माध्यम से प्रसार मॉडल की दृश्य विशेषताओं पर ध्यान देते हैं। कस्टम डिफ्यूजन अधिकांश यू-नेट को फ्रीज कर देता है और केवल उन के और वी अनुमानों को ट्यून करता है, जो शब्दों को उपस्थिति से जोड़ने के लिए सबसे अधिक जिम्मेदार होते हैं। यह मॉडल को ओवरफिटिंग और व्यापक शब्द अर्थ को भूलने से रोकने के लिए अवधारणा की श्रेणी को साझा करने वाली वास्तविक छवियों के नियमितीकरण सेट का भी उपयोग करता है।

सामरिक प्रभाव

गति और पैमाना

विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।

विकल्प बनाएं

रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।

टीम और वर्कफ़्लो

संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।

कस्टम डिफ्यूजन मल्टी-कॉन्सेप्ट ट्यूनिंग का भविष्य

बहु-अवधारणा वैयक्तिकरण LoRA जैसे एडाप्टर पारिस्थितिकी तंत्र के साथ अभिसरण कर रहा है, जहां अनुमान के समय कई छोटे अवधारणा मॉड्यूल मिश्रित किए जा सकते हैं। भविष्य की प्रणालियों का लक्ष्य दर्जनों कस्टम अवधारणाओं को बिना किसी विशेषता ब्लीड (कुर्सी पर बिल्ली का रंग लीक होना) के बिना साफ-सुथरा रूप से तैयार करना है, और बिना किसी अनुकूलन के सेकंड या यहां तक ​​कि एनकोडर-केवल में ट्यूनिंग करना है। उम्मीद करें कि यह ब्रांड-संगत संपत्ति निर्माण, व्यक्तिगत अवतार और ऑन-डिवाइस अनुकूलन को रेखांकित करेगा।

वास्तविक विश्व कार्यान्वयन

मुट्ठी भर तस्वीरों से अपने विशिष्ट पालतू जानवर का मॉडल बनाना सिखाना, फिर उसे नए पोज़, वेशभूषा और सेटिंग्स में तैयार करना

किसी ब्रांड के उत्पाद (स्नीकर या बोतल) और ब्रांड शुभंकर को सीखना, फिर दोनों को एक मार्केटिंग छवि में बनाना

एक व्यक्तिगत कला वस्तु और परिवार के किसी सदस्य की समानता को कैद करना और उन्हें आविष्कृत दृश्यों में एक साथ रखना

इंटीरियर-डिज़ाइन अवधारणाओं का अनुकरण करने के लिए एक कस्टम फर्नीचर टुकड़े को एक कस्टम रूम शैली के साथ जोड़ना

जोखिम और रेलिंग

यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।

मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।

जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।

कार्यान्वयन रोडमैप

1

सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।

2

वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।

3

कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।

4

कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Custom Diffusion Multi-Concept Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

रोबोट नियंत्रण के लिए प्रसार नीति

अक्सर पूछे जाने वाले प्रश्नों

What is Custom Diffusion Multi-Concept Tuning?

कस्टम डिफ्यूजन एक हल्की फाइन-ट्यूनिंग विधि है जो कुछ ही तस्वीरों से टेक्स्ट-टू-इमेज मॉडल को आपके कुत्ते या विशिष्ट कुर्सी जैसी नई व्यक्तिगत अवधारणाएं सिखाती है। इसकी असाधारण विशेषता कई नई सीखी गई अवधारणाओं को एक उत्पन्न दृश्य में एक साथ संकलित करना है।

डिफ्यूजन मॉडल का कौन सा भाग कस्टम डिफ्यूजन मुख्य रूप से फाइन-ट्यून करता है?

यह केवल क्रॉस-अटेंशन K और V मैट्रिसेस को अपडेट करता है, जो शब्दों को उपस्थिति से बांधता है, जिससे ट्यूनिंग तेज रहती है और सेव की गई फ़ाइल छोटी हो जाती है।

एकल-अवधारणा विधियों की तुलना में कस्टम डिफ्यूज़न सबसे उल्लेखनीय क्या है?

इसकी हस्ताक्षर क्षमता बहु-अवधारणा पीढ़ी है, जो कई वैयक्तिकृत विषयों को एक साथ जोड़ती है।

एक अवधारणा को सीखने के लिए कस्टम डिफ्यूजन को मोटे तौर पर कितने उदाहरण छवियों की आवश्यकता होती है?

यह छोटी-छोटी छवियों से सीखता है, जिससे रोजमर्रा के उपयोगकर्ताओं के लिए वैयक्तिकरण व्यावहारिक हो जाता है।

कस्टम डिफ्यूज़न अवधारणा की व्यापक श्रेणी से नियमितीकरण छवियों के एक सेट का उपयोग क्यों करता है?

नियमितीकरण छवियां श्रेणी शब्द के सामान्य अर्थ को बरकरार रखती हैं ताकि मॉडल केवल नई अवधारणा तक सीमित न हो जाए।

दो अलग-अलग प्रशिक्षित कस्टम डिफ्यूजन अवधारणाओं को एक साथ कैसे उपयोग किया जा सकता है?

संयुक्त संकेतों को सक्षम करते हुए, स्वतंत्र रूप से सीखी गई अवधारणाओं को एक बंद-फ़ॉर्म विवश अनुकूलन के माध्यम से विलय किया जा सकता है।