VQGAN और कोडबुक छवि संश्लेषण
VQGAN छवियों को एक सीखे गए कोडबुक से खींचे गए अलग-अलग टोकन के ग्रिड में संपीड़ित करता है, जिससे एक ट्रांसफार्मर छवियों को उसी तरह उत्पन्न करता है जैसे भाषा मॉडल पाठ उत्पन्न करते हैं।
गहरा गोता
VQGAN, 2021 के पेपर 'टैमिंग ट्रांसफॉर्मर्स फॉर हाई-रिज़ॉल्यूशन इमेज सिंथेसिस' में पेश किया गया, एक वेक्टर-क्वांटाइज्ड ऑटोएनकोडर (VQVAE) को प्रतिकूल और अवधारणात्मक प्रशिक्षण के साथ जोड़ता है। एक एनकोडर एक छवि को फीचर वैक्टर के एक छोटे ग्रिड में मैप करता है; प्रत्येक वेक्टर को 1024 असतत कोडों की सीखी गई कोडबुक में निकटतम प्रविष्टि में स्नैप किया जाता है, जिससे छवि पूर्णांक टोकन के अनुक्रम में बदल जाती है। एक डिकोडर उन टोकन से छवि का पुनर्निर्माण करता है, जिसे GAN विभेदक और अवधारणात्मक हानि के साथ प्रशिक्षित किया जाता है ताकि पुनर्निर्माण धुंधले होने के बजाय स्पष्ट दिखे। क्योंकि छवियां अब अलग-अलग टोकन अनुक्रम हैं, एक ऑटोरेग्रेसिव ट्रांसफार्मर उन्हें भाषा की तरह मॉडल कर सकता है, एक-एक करके टोकन की भविष्यवाणी कर सकता है। CLIP मार्गदर्शन के साथ जोड़े जाने पर VQGAN ने शुरुआती टेक्स्ट-टू-इमेज आर्ट टूल को प्रसिद्ध रूप से संचालित किया।
तकनीकी अंतर्दृष्टि
मुख्य ऑपरेशन वेक्टर परिमाणीकरण है: निरंतर एनकोडर आउटपुट को उनके निकटतम कोडबुक वैक्टर द्वारा प्रतिस्थापित किया जाता है, एक 'स्ट्रेट-थ्रू' ग्रेडिएंट अनुमानक के साथ ताकि एनकोडर गैर-विभेदक लुकअप के बावजूद भी सीख सके। ऑटोएनकोडर के शीर्ष पर एक पैच-आधारित GAN विभेदक जोड़ने से VQGAN को बनावट को कुरकुरा रखते हुए VQVAE की तुलना में बहुत छोटे टोकन ग्रिड (जैसे 16x16) का उपयोग करने की सुविधा मिलती है, जिससे ट्रांसफार्मर मॉडलिंग को सुव्यवस्थित बनाया जा सकता है।
सामरिक प्रभाव
गति और पैमाना
विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।
विकल्प बनाएं
रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।
टीम और वर्कफ़्लो
संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।
VQGAN और कोडबुक इमेज सिंथेसिस का भविष्य
VQGAN की असतत-टोकन रेसिपी टोकन-आधारित छवि और वीडियो मॉडल की नींव बन गई, मास्कजीआईटी से लेकर मल्टीमॉडल सिस्टम तक जो छवि और टेक्स्ट टोकन को एक ट्रांसफार्मर में मिलाते हैं। अनुसंधान अब बड़े, परिमित-स्केलर या लुकअप-मुक्त कोडबुक की ओर जोर दे रहा है जो कोडबुक पतन से बचते हैं और एकीकृत मॉडल की ओर जहां समान शब्दावली छवियों, ऑडियो और भाषा तक फैली हुई है, जो किसी भी पीढ़ी को सक्षम बनाती है।
वास्तविक विश्व कार्यान्वयन
एक फोटो को कोडबुक टोकन के 16x16 ग्रिड में एन्कोड करना ताकि एक ट्रांसफार्मर इसे मॉडल और पुन: उत्पन्न कर सके
2021 में वायरल हुई असली 'VQGAN+CLIP' AI कला बनाने के लिए CLIP मार्गदर्शन के साथ VQGAN को जोड़ना
कुशल भंडारण या डाउनस्ट्रीम जेनरेटर प्रशिक्षण के लिए छवियों को कॉम्पैक्ट असतत कोड में संपीड़ित करना
मास्कजीआईटी और मल्टीमॉडल ट्रांसफॉर्मर जैसे बड़े टोकन-आधारित जेनरेटर के अंदर इमेज टोकनाइज़र के रूप में कार्य करना
जोखिम और रेलिंग
यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।
मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।
जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।
कार्यान्वयन रोडमैप
सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।
वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।
कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।
कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VQGAN and Codebook Image Synthesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
स्पेड सिमेंटिक इमेज सिंथेसिस
अक्सर पूछे जाने वाले प्रश्नों
What is VQGAN and Codebook Image Synthesis?
VQGAN छवियों को एक सीखे गए कोडबुक से खींचे गए अलग-अलग टोकन के ग्रिड में संपीड़ित करता है, जिससे एक ट्रांसफार्मर छवियों को उसी तरह उत्पन्न करता है जैसे भाषा मॉडल पाठ उत्पन्न करते हैं।
किसी छवि को अलग टोकन के रूप में दर्शाने के लिए VQGAN क्या उपयोग करता है?
VQGAN एक सीखी हुई कोडबुक में निकटतम प्रविष्टियों के लिए एनकोडर सुविधाओं को परिमाणित करता है, छवि को अलग कोड सूचकांकों के अनुक्रम में बदल देता है।
VQGAN, VQVAE के शीर्ष पर GAN विभेदक क्यों जोड़ता है?
प्रतिकूल और अवधारणात्मक नुकसान VQGAN को एक कॉम्पैक्ट टोकन ग्रिड से स्पष्ट छवियों का पुनर्निर्माण करने देते हैं, जिसे VQVAE अकेले धुंधला कर देता है।
एक बार जब एक छवि टोकन का अनुक्रम बन जाती है, तो कौन सा मॉडल नई छवियां उत्पन्न करता है?
चूँकि छवियाँ अलग-अलग टोकन अनुक्रम बन जाती हैं, एक ट्रांसफार्मर पाठ उत्पन्न करने की तरह, उन्हें ऑटोरेग्रेसिव रूप से मॉडल कर सकता है।
कौन सी तकनीक ग्रेडियेंट को गैर-विभेदनीय परिमाणीकरण चरण के माध्यम से प्रवाहित करने देती है?
वेक्टर परिमाणीकरण गैर-विभेदित है, इसलिए VQGAN एनकोडर को प्रशिक्षित करने के लिए एक स्ट्रेट-थ्रू ग्रेडिएंट अनुमानक का उपयोग करता है।
VQGAN ने 2021 में किस प्रसिद्ध AI कला प्रवृत्ति को बनाने में मदद की?
VQGAN को CLIP मार्गदर्शन के साथ जोड़ने से व्यापक रूप से साझा की जाने वाली 'VQGAN+CLIP' कला का निर्माण हुआ जिसने पाठ-संचालित छवि निर्माण को लोकप्रिय बनाया।