विज़ुअल एआई गाइड

नकाबपोश ऑटोएन्कोडर्स

मास्क्ड ऑटोएन्कोडर्स (एमएई) एक स्व-पर्यवेक्षित विधि है जो अधिकांश चित्र छुप जाने के बाद छवियों को फिर से बनाने के लिए एक विज़न मॉडल सिखाती है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

By learning to fill in the blanks, the model builds rich visual understanding without any human labels.

गहरा गोता

2021 में Meta AI में कैमिंग हे और उनके सहयोगियों द्वारा पेश किए गए मास्क्ड ऑटोएन्कोडर्स, एक छवि लेते हैं, इसे छोटे पैच में विभाजित करते हैं, और बेतरतीब ढंग से उनमें से एक बहुत बड़े अंश को छिपाते हैं, अक्सर 75%। एक विज़न ट्रांसफॉर्मर एनकोडर केवल दृश्यमान पैच को संसाधित करता है, जबकि एक हल्का डिकोडर गायब हुए पैच के मूल पिक्सेल को फिर से बनाने का प्रयास करता है। क्योंकि बहुत कुछ छिपा हुआ है, मॉडल आसानी से आस-पास के पिक्सेल की प्रतिलिपि नहीं बना सकता है और उसे आकृतियों और वस्तु भागों जैसी सार्थक संरचना सीखनी होगी। एनकोडर स्किपिंग मास्क्ड पैच प्रशिक्षण को तेज़ और मेमोरी कुशल बनाता है। प्रीट्रेनिंग के बाद, डिकोडर को हटा दिया जाता है और एनकोडर वर्गीकरण, पता लगाने और विभाजन कार्यों में दृढ़ता से स्थानांतरित हो जाता है।

तकनीकी अंतर्दृष्टि

मुख्य चाल विषमता है: भारी एनकोडर केवल 25% पैच को देखता है, जबकि एक छोटा डिकोडर बाकी को फिर से बनाता है। पैच चपटे होते हैं, रैखिक रूप से एम्बेडेड होते हैं, और स्थितीय एन्कोडिंग दिए जाते हैं। पुनर्निर्माण हानि माध्य वर्ग त्रुटि है जिसकी गणना केवल छिपे हुए पैच पर की जाती है, आमतौर पर सामान्यीकृत पिक्सेल मानों पर। उच्च मास्किंग अनुपात निम्न-स्तरीय इंटरपोलेशन के बजाय सिमेंटिक सीखने को मजबूर करते हैं, और एनकोडर कट्स में मास्क्ड टोकन को छोड़ना पूरी छवि को संसाधित करने की तुलना में नाटकीय रूप से गणना करता है।

सामरिक प्रभाव

गति और पैमाना

विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।

विकल्प बनाएं

रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।

टीम और वर्कफ़्लो

संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।

नकाबपोश ऑटोएन्कोडर्स का भविष्य

एमएई-शैली का मुखौटा पुनर्निर्माण सभी तौर-तरीकों में एक डिफ़ॉल्ट पूर्व-प्रशिक्षण नुस्खा बनता जा रहा है। शोधकर्ता इसे वीडियो (स्पेसटाइम क्यूब्स को छिपाना), ऑडियो स्पेक्ट्रोग्राम, मेडिकल स्कैन और सैटेलाइट इमेजरी तक विस्तारित कर रहे हैं, जहां लेबल दुर्लभ और महंगे हैं। मल्टीमॉडल फाउंडेशन मॉडल, अधिक कुशल डिकोडर और सूचनात्मक क्षेत्रों को लक्षित करने वाली अनुकूली मास्किंग के लिए भाषा के साथ सख्त संलयन की अपेक्षा करें। जैसे-जैसे गणना बढ़ती है, विशाल बिना लेबल वाले छवि संग्रहों पर नकाबपोश प्रीट्रेनिंग को महंगे मानव एनोटेशन पर निर्भरता को कम करते हुए डाउनस्ट्रीम सटीकता में सुधार करना चाहिए।

वास्तविक विश्व कार्यान्वयन

लाखों बिना लेबल वाली तस्वीरों पर एक विज़न ट्रांसफॉर्मर को पूर्व-प्रशिक्षित करना, फिर इसे मजबूत सटीकता के साथ इमेजनेट वर्गीकरण के लिए ठीक करना

बिना लेबल वाले मेडिकल स्कैन (एक्स-रे, एमआरआई) से सीखने की सुविधाएँ जहाँ विशेषज्ञ एनोटेशन महंगा और सीमित है

क्रिया-पहचान मॉडल को पूर्व-प्रशिक्षित करने के लिए स्पेसटाइम पैच को मास्क करके वीडियो में विधि को अपनाना (वीडियोएमएई)

भूमि-उपयोग मानचित्रण और मैन्युअल लेबल के बिना परिवर्तन का पता लगाने में सहायता के लिए उपग्रह और हवाई इमेजरी पर पूर्व प्रशिक्षण

जोखिम और रेलिंग

यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।

मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।

जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।

कार्यान्वयन रोडमैप

1

सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।

2

वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।

3

कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।

4

कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Masked Autoencoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

म्यूज़ियम मास्क्ड जेनरेटिव इमेजिंग

अक्सर पूछे जाने वाले प्रश्नों

What is Masked Autoencoders?

मास्क्ड ऑटोएन्कोडर्स (एमएई) एक स्व-पर्यवेक्षित विधि है जो अधिकांश चित्र छुप जाने के बाद छवियों को फिर से बनाने के लिए एक विज़न मॉडल सिखाती है। रिक्त स्थानों को भरना सीखकर, मॉडल बिना किसी मानवीय लेबल के समृद्ध दृश्य समझ बनाता है।

मास्क्ड ऑटोएन्कोडर में मुख्य स्व-पर्यवेक्षित कार्य क्या है?

एमएई अधिकांश छवि पैच छुपाता है और मॉडल को लापता पिक्सल को फिर से बनाने के लिए प्रशिक्षित करता है, जिसके लिए किसी मानव लेबल की आवश्यकता नहीं होती है।

मूल एमएई आम तौर पर छवि पैच का कितना अंश छुपाता है?

मूल एमएई लगभग 75% पैच को छुपाता है, एक उच्च अनुपात जो मॉडल को पड़ोसियों की नकल करने के बजाय सार्थक संरचना सीखने के लिए मजबूर करता है।

एमएई एनकोडर केवल दृश्यमान (अनमास्क्ड) पैच को ही क्यों प्रोसेस करता है?

एनकोडर में मास्क्ड टोकन छोड़ने से गणना और मेमोरी बहुत कम हो जाती है, क्योंकि यह पैच के केवल एक छोटे से हिस्से को संभालता है।

एमएई प्रीट्रेनिंग पूरी होने के बाद डिकोडर का क्या होता है?

हल्के डिकोडर की आवश्यकता केवल प्रीट्रेनिंग के दौरान पुनर्निर्माण के लिए होती है; इसके बाद सीखा हुआ एनकोडर पता लगाने जैसे कार्यों में स्थानांतरित हो जाता है।

एमएई आमतौर पर पुनर्निर्माण के लिए किस हानि फ़ंक्शन का उपयोग करता है?

एमएई पूर्वानुमानित और वास्तविक पिक्सेल मानों के बीच माध्य वर्ग त्रुटि को न्यूनतम करता है, जिसकी गणना केवल छिपे हुए पैच पर की जाती है।