विज़ुअल एआई गाइड

वीक्यू-वीएई और असतत अव्यक्त

वीक्यू-वीएई छवियों, ऑडियो या वीडियो को निरंतर संख्याओं के बजाय सीखी गई कोडबुक से निकाले गए अलग-अलग कोड के एक छोटे ग्रिड में संपीड़ित करता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

This discrete bottleneck lets powerful sequence models like Transformers treat media as 'tokens', much like words.

गहरा गोता

2017 में डीपमाइंड में वैन डेन ओर्ड और उनके सहयोगियों द्वारा पेश किया गया वीक्यू-वीएई (वेक्टर क्वांटाइज्ड वेरिएशनल ऑटोएनकोडर), एक ऑटोएनकोडर है जिसका अव्यक्त स्थान अलग है। एक एनकोडर एक छवि को निरंतर वैक्टर के ग्रिड में बदल देता है; फिर प्रत्येक वेक्टर को एम्बेडिंग (वेक्टर परिमाणीकरण) की सीखी हुई कोडबुक में उसकी निकटतम प्रविष्टि में ले जाया जाता है। डिकोडर उन परिमाणित कोडों से छवि का पुनर्निर्माण करता है। क्योंकि अव्यक्त अब सूचकांकों की एक सीमित शब्दावली है, एक अलग मॉडल उनके वितरण को सीख सकता है और नई सामग्री उत्पन्न कर सकता है। यह दो-चरणीय नुस्खा DALL-E 1, संगीत के लिए ज्यूकबॉक्स और VQGAN को शक्ति प्रदान करता है, जो तेज पुनर्निर्माण के लिए एक अवधारणात्मक और प्रतिकूल हानि जोड़ता है। VQ-VAE-2 ने उच्च-निष्ठा वाली छवियां बनाने के लिए कई रिज़ॉल्यूशन को स्टैक्ड किया।

तकनीकी अंतर्दृष्टि

परिमाणीकरण चरण (आर्गमिन निकटतम-पड़ोसी लुकअप) गैर-विभेदित है, इसलिए वीक्यू-वीएई एक स्ट्रेट-थ्रू अनुमानक का उपयोग करता है: ग्रेडिएंट्स को डिकोडर इनपुट से सीधे एनकोडर आउटपुट में कॉपी किया जाता है जैसे कि परिमाणीकरण पहचान थी। प्रशिक्षण में पुनर्निर्माण हानि, एनकोडर आउटपुट की ओर एम्बेडिंग खींचने वाली कोडबुक हानि, और एनकोडर को उसके चुने हुए कोड के प्रति प्रतिबद्ध रखने की प्रतिबद्धता हानि शामिल है। एक आम विफलता कोडबुक पतन है, जहां केवल कुछ कोड का उपयोग किया जाता है।

सामरिक प्रभाव

गति और पैमाना

विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।

विकल्प बनाएं

रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।

टीम और वर्कफ़्लो

संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।

वीक्यू-वीएई और असतत अव्यक्त का भविष्य

असतत अव्यक्त एकीकृत मल्टीमॉडल मॉडल की ओर धकेलने के केंद्र में हैं जो छवियों, ऑडियो और वीडियो को पाठ के समान शब्दावली में चिह्नित करते हैं। अवशिष्ट और परिमित स्केलर परिमाणीकरण, बड़ी कोडबुक और बेहतर उपयोग संतुलन जैसे सुधार पतन को कम कर रहे हैं और निष्ठा को बढ़ा रहे हैं। चूंकि मॉडलों का लक्ष्य सभी तौर-तरीकों को समझना और उत्पन्न करना है, वीक्यू-वीएई विचारों पर निर्मित मजबूत टोकन एक मूलभूत घटक बने रहेंगे, जो तेजी से प्रतिस्पर्धा करेंगे और निरंतर अव्यक्त प्रसार दृष्टिकोण के साथ संयोजन करेंगे।

वास्तविक विश्व कार्यान्वयन

DALL-E 1 ने एक अलग VQ-VAE टोकननाइज़र का उपयोग किया ताकि एक ट्रांसफार्मर कोडबुक सूचकांकों के अनुक्रम के रूप में छवियां उत्पन्न कर सके।

VQGAN ने कला निर्माण के लिए स्पष्ट, उच्च-रिज़ॉल्यूशन छवि टोकन का उत्पादन करने के लिए प्रतिकूल और अवधारणात्मक नुकसान के साथ VQ-VAE को संयोजित किया।

OpenAI के ज्यूकबॉक्स ने कच्चे ऑडियो में VQ-VAE लागू किया, जेनरेटिव मॉडलिंग के लिए संगीत को अलग कोड में संपीड़ित किया।

VQ-VAE-2 ने अपने युग के GAN की प्रतिद्वंद्वी विविध, उच्च-निष्ठा छवियों को संश्लेषित करने के लिए पदानुक्रमित असतत अव्यक्तों को एकत्रित किया।

जोखिम और रेलिंग

यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।

मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।

जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।

कार्यान्वयन रोडमैप

1

सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।

2

वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।

3

कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।

4

कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQ-VAE and Discrete Latents quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

अव्यक्त सम्मिश्रण और छवि प्रक्षेप

अक्सर पूछे जाने वाले प्रश्नों

What is VQ-VAE and Discrete Latents?

वीक्यू-वीएई छवियों, ऑडियो या वीडियो को निरंतर संख्याओं के बजाय सीखी गई कोडबुक से निकाले गए अलग-अलग कोड के एक छोटे ग्रिड में संपीड़ित करता है। यह असतत बाधा ट्रांसफार्मर जैसे शक्तिशाली अनुक्रम मॉडल को मीडिया को शब्दों की तरह 'टोकन' के रूप में व्यवहार करने देती है।

VQ-VAE का अव्यक्त स्थान मानक VAE से क्या भिन्न है?

वीक्यू-वीएई निरंतर अव्यक्त को वेक्टर परिमाणीकरण के माध्यम से सीखी गई कोडबुक से निकाले गए अलग-अलग कोड से बदल देता है।

VQ-VAE गैर-विभेदनीय परिमाणीकरण चरण के माध्यम से ग्रेडिएंट्स को कैसे पास करता है?

स्ट्रेट-थ्रू अनुमानक डिकोडर-इनपुट ग्रेडिएंट को सीधे एनकोडर आउटपुट पर कॉपी करता है, परिमाणीकरण को बैकवर्ड पास के लिए पहचान के रूप में मानता है।

'कोडबुक पतन' क्या है?

कोडबुक पतन तब होता है जब मॉडल केवल कुछ कोड पर निर्भर करता है, जिससे अधिकांश कोडबुक बर्बाद हो जाती है और विविधता को नुकसान पहुंचता है।

ट्रांसफॉर्मर के साथ जेनरेटिव मॉडलिंग के लिए असतत अव्यक्त क्यों उपयोगी हैं?

अलग-अलग सूचकांक एक सीमित शब्दावली बनाते हैं, इसलिए ट्रांसफॉर्मर जैसे अनुक्रम मॉडल शब्दों की तरह ही उनके वितरण को सीख और नमूना कर सकते हैं।

VQGAN ने मूल VQ-VAE रेसिपी के शीर्ष पर क्या जोड़ा?

VQGAN एक विभेदक और अवधारणात्मक हानि के साथ VQ-VAE को संवर्धित करता है, जिससे स्पष्ट, अधिक विस्तृत पुनर्निर्मित टोकन प्राप्त होते हैं।