अव्यक्त प्रसार मॉडल
अव्यक्त प्रसार मॉडल कच्चे पिक्सेल के बजाय संपीड़ित अव्यक्त स्थान में प्रसार प्रक्रिया चलाकर छवियां उत्पन्न करते हैं, जिससे गणना लागत कम हो जाती है।
सिंहावलोकन
They are the engine behind Stable Diffusion and most modern open-source image generators.
गहरा गोता
एक मानक प्रसार मॉडल एक शोर प्रक्रिया को उलटना सीखता है: यह शुद्ध शोर से शुरू होता है और धीरे-धीरे एक छवि में बदल जाता है। इसे सीधे पिक्सेल पर करना महंगा है क्योंकि 512x512 छवि में सैकड़ों हजारों मान होते हैं। 2022 में रोम्बच और सहकर्मियों द्वारा पेश किया गया अव्यक्त प्रसार, सबसे पहले एक छवि को एक छोटे अव्यक्त ग्रिड (अक्सर 64x64x4, लगभग 48x छोटा) में संपीड़ित करने के लिए एक पूर्व-प्रशिक्षित वैरिएबल ऑटोएनकोडर (वीएई) का उपयोग करता है। प्रसार यू-नेट तब क्रॉस-अटेंशन के माध्यम से पाठ द्वारा निर्देशित, उस कॉम्पैक्ट अव्यक्त स्थान के अंदर निंदा करना सीखता है। अंत में VAE डिकोडर पूर्ण-रिज़ॉल्यूशन पिक्सेल का पुनर्निर्माण करता है। यह अवधारणात्मक संपीड़न अगोचर विवरण को त्यागते हुए अर्थपूर्ण रूप से सार्थक जानकारी रखता है, जिससे उपभोक्ता जीपीयू पर उच्च गुणवत्ता वाली पीढ़ी संभव हो जाती है।
तकनीकी अंतर्दृष्टि
मुख्य चाल अवधारणात्मक संपीड़न को जेनरेटिव मॉडलिंग से अलग करना है। वीएई उच्च-आवृत्ति पिक्सेल विवरण को एक बार संभालता है, और यू-नेट केवल निम्न-आयामी अव्यक्त वितरण को मॉडल करता है। टेक्स्ट कंडीशनिंग को क्रॉस-अटेंशन परतों के माध्यम से इंजेक्ट किया जाता है, जहां यू-नेट की स्थानिक विशेषताएं सीएलआईपी जैसे टेक्स्ट एनकोडर से टोकन एम्बेडिंग में भाग लेती हैं। क्योंकि अव्यक्त पिक्सेल से लगभग 48 गुना छोटे होते हैं, प्रत्येक डीनोइज़िंग चरण मेमोरी और एफएलओपी दोनों में नाटकीय रूप से सस्ता होता है।
सामरिक प्रभाव
गति और पैमाना
विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।
विकल्प बनाएं
रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।
टीम और वर्कफ़्लो
संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।
अव्यक्त प्रसार मॉडल का भविष्य
अव्यक्त प्रसार छवियों से परे वीडियो (स्टेबल वीडियो डिफ्यूजन), 3डी एसेट्स और ऑडियो स्पेक्ट्रोग्राम में विस्तारित हो रहा है, सभी एक ही कंप्रेस-फिर-डीनोइस रेसिपी का उपयोग कर रहे हैं। अनुसंधान आसवन और स्थिरता मॉडल के माध्यम से कम नमूनाकरण चरणों की ओर जोर दे रहा है, बेहतर वीएई जो ठीक पाठ और चेहरों को संरक्षित करते हैं, और स्थिर प्रसार 3 जैसे सुधारित-प्रवाह फॉर्मूलेशन जो तेज, तेज परिणामों के लिए पीढ़ी प्रक्षेपवक्र को सीधा करते हैं।
वास्तविक विश्व कार्यान्वयन
एकल उपभोक्ता जीपीयू पर टेक्स्ट प्रॉम्प्ट से कलाकृति और अवधारणा डिजाइन उत्पन्न करने वाला स्थिर प्रसार
Adobe और Canva अव्यक्त प्रसार बैकबोन पर निर्मित टेक्स्ट-टू-इमेज और जेनरेटिव-फिल सुविधाओं को सशक्त बनाते हैं
प्री-प्रोडक्शन में तेजी लाने के लिए गेम स्टूडियो बनावट मानचित्र, स्प्राइट और पर्यावरण अवधारणा कला का उत्पादन कर रहे हैं
स्टॉक-इमेज और मार्केटिंग टीमें बिना फोटोशूट के ऑन-ब्रांड उत्पाद मॉकअप और विज्ञापन दृश्य तैयार कर रही हैं
जोखिम और रेलिंग
यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।
मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।
जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।
कार्यान्वयन रोडमैप
सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।
वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।
कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।
कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Latent Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
वीडियो प्रसार मॉडल
अक्सर पूछे जाने वाले प्रश्नों
What is Latent Diffusion Models?
अव्यक्त प्रसार मॉडल कच्चे पिक्सेल के बजाय संपीड़ित अव्यक्त स्थान में प्रसार प्रक्रिया चलाकर छवियां उत्पन्न करते हैं, जिससे गणना लागत कम हो जाती है। वे स्थिर प्रसार और अधिकांश आधुनिक ओपन-सोर्स छवि जनरेटर के पीछे के इंजन हैं।
पिक्सेल-स्पेस डिफ्यूजन की तुलना में अव्यक्त डिफ्यूजन मॉडल का मुख्य नवाचार क्या है?
अव्यक्त प्रसार वीएई का उपयोग करके छवियों को एक छोटे अव्यक्त स्थान में संपीड़ित करता है, इसलिए महंगा डीनोइज़िंग पूर्ण पिक्सेल की तुलना में बहुत कम मूल्यों पर होता है।
कौन सा घटक किसी छवि को अव्यक्त स्थान में संपीड़ित करता है और बाद में उसका पुनर्निर्माण करता है?
एक पूर्व-प्रशिक्षित VAE छवि को एक कॉम्पैक्ट अव्यक्त ग्रिड में एन्कोड करता है और इसका डिकोडर अंत में पूर्ण-रिज़ॉल्यूशन पिक्सेल का पुनर्निर्माण करता है।
अव्यक्त प्रसार में टेक्स्ट को आम तौर पर डीनोइज़िंग यू-नेट में कैसे इंजेक्ट किया जाता है?
टेक्स्ट एनकोडर से टोकन एम्बेडिंग को क्रॉस-अटेंशन लेयर्स में फीड किया जाता है, जिससे स्थानिक विशेषताएं प्रॉम्प्ट पर ध्यान दे पाती हैं।
अव्यक्त स्थान में संचालन से कम्प्यूटेशनल लागत कम क्यों हो जाती है?
रुको - सही कारण यह है कि अव्यक्त ग्रिड पिक्सेल छवि की तुलना में बहुत छोटा (अक्सर ~48x) होता है, इसलिए प्रत्येक डीनोइज़िंग चरण के लिए बहुत कम एफएलओपी और मेमोरी की आवश्यकता होती है।
किस व्यापक रूप से उपयोग किए जाने वाले ओपन-सोर्स मॉडल ने अव्यक्त प्रसार को लोकप्रिय बनाया?
2022 में जारी स्टेबल डिफ्यूजन ने उपभोक्ता हार्डवेयर और बड़े पैमाने पर अपनाने के लिए अव्यक्त प्रसार लाया।