विज़ुअल एआई गाइड

विजन ट्रांसफार्मर

विज़न ट्रांसफॉर्मर (ViTs) ट्रांसफॉर्मर आर्किटेक्चर को लागू करते हैं जो छवियों को ChatGPT को शक्ति प्रदान करता है, एक तस्वीर को पिक्सल के ग्रिड के बजाय पैच के अनुक्रम के रूप में मानता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

उन्होंने साबित कर दिया कि अत्याधुनिक छवि पहचान हासिल करने के लिए आपको कनवल्शन की आवश्यकता नहीं है।

गहरा गोता

वर्षों तक, कन्वेन्शनल न्यूरल नेटवर्क (सीएनएन) एक छवि में छोटे फिल्टर को स्कैन करके कंप्यूटर दृष्टि पर हावी रहे। Google के 2020 के पेपर 'एन इमेज इज़ वर्थ 16x16 वर्ड्स' ने एक छवि को निश्चित पैच में काटकर, आमतौर पर 16x16 पिक्सेल में, प्रत्येक को एक वेक्टर में समतल करके, और परिणामी अनुक्रम को एक मानक ट्रांसफार्मर में फीड करके इसे चुनौती दी। प्रत्येक पैच एक वाक्य में एक शब्द की तरह, एक 'टोकन' बन जाता है। मॉडल तब आत्म-ध्यान का उपयोग करता है ताकि प्रत्येक पैच सीधे हर दूसरे पैच से संबंधित हो सके, लंबी दूरी के रिश्तों को कैप्चर कर सके, एक छोटा कन्वेन्शनल फ़िल्टर एक चरण में नहीं देख सकता है। पकड़: वीआईटी डेटा के भूखे हैं क्योंकि उनमें सीएनएन की अंतर्निहित धारणाओं का अभाव है। जेएफटी-300एम जैसे विशाल डेटासेट पर प्रशिक्षित, उन्होंने आधुनिक दृष्टि अनुसंधान को नया आकार देते हुए सर्वश्रेष्ठ सीएनएन की बराबरी की या उसे हराया।

तकनीकी अंतर्दृष्टि

एक वीआईटी एक छवि को गैर-अतिव्यापी पैच में विभाजित करता है, प्रत्येक को एक एम्बेडिंग में रैखिक रूप से प्रोजेक्ट करता है, और स्थितीय एन्कोडिंग जोड़ता है ताकि मॉडल को पता चले कि प्रत्येक पैच मूल छवि में कहां है। एक विशेष सीखने योग्य 'क्लास टोकन' पहले से जोड़ा गया है; इसका अंतिम प्रतिनिधित्व वर्गीकरण को संचालित करता है। स्टैक्ड आत्म-ध्यान परतें प्रत्येक पैच को अन्य सभी से जानकारी का वजन करने देती हैं, जिससे परत एक से एक वैश्विक ग्रहणशील क्षेत्र मिलता है। क्योंकि पैच की संख्या के साथ ध्यान चतुष्कोणीय रूप से बढ़ता है, उच्च-रिज़ॉल्यूशन वाली छवियां महंगी हो जाती हैं, यही कारण है कि पैच आकार और कुशल ध्यान वेरिएंट मायने रखते हैं।

सामरिक प्रभाव

गति और पैमाना

विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।

विकल्प बनाएं

रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।

टीम और वर्कफ़्लो

संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।

विज़न ट्रांसफॉर्मर्स का भविष्य

वीआईटी और सीएनएन-ट्रांसफॉर्मर हाइब्रिड अब अग्रणी दृष्टि प्रणालियों को शक्ति प्रदान करते हैं, और आर्किटेक्चर मल्टीमॉडल मॉडल को रेखांकित करता है जो सीएलआईपी और आधुनिक दृष्टि-भाषा सहायकों जैसे पाठ के साथ छवियों को जोड़ता है। उच्च-रिज़ॉल्यूशन और वीडियो के लिए ध्यान को सस्ता बनाने के साथ-साथ स्व-पर्यवेक्षित पूर्व-प्रशिक्षण (जैसे नकाबपोश-छवि मॉडलिंग) पर निरंतर काम की अपेक्षा करें, जो भारी लेबल-डेटा भूख को कम करता है। जैसे-जैसे गणना बढ़ती है, 'भाषा मॉडल' और 'विज़न मॉडल' के बीच की रेखा धुंधली होती जाती है, ट्रांसफार्मर अलग-अलग विशेष डिजाइनों के बजाय तौर-तरीकों में एक साझा रीढ़ के रूप में काम करते हैं।

वास्तविक विश्व कार्यान्वयन

Google की छवि वर्गीकरण और खोज रैंकिंग प्रणालियाँ जिन्होंने ViT के CNN के साथ प्रतिस्पर्धी साबित होने के बाद ट्रांसफार्मर बैकबोन को अपनाया

सीएलआईपी और अन्य छवि-पाठ मॉडल जो छवियों को एन्कोड करने के लिए वीआईटी का उपयोग करते हैं ताकि फ़ोटो और कैप्शन का एक साझा स्थान में मिलान किया जा सके

मेडिकल इमेजिंग अनुसंधान केवल स्थानीय बनावट के बजाय पूरे स्कैन में पैटर्न का पता लगाने के लिए वीआईटी का उपयोग करता है

स्व-ड्राइविंग और रोबोटिक्स धारणा स्टैक जो दृश्य के पूरे क्षेत्र में दृश्य को समझने के लिए वीआईटी-शैली का ध्यान जोड़ते हैं

जोखिम और रेलिंग

यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।

मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।

जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।

कार्यान्वयन रोडमैप

1

सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।

2

वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।

3

कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।

4

कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Vision Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

सीएलआईपी और विजन-भाषा मॉडल

अक्सर पूछे जाने वाले प्रश्नों

विज़न ट्रांसफार्मर क्या है?

विज़न ट्रांसफॉर्मर (ViTs) ट्रांसफॉर्मर आर्किटेक्चर को लागू करते हैं जो छवियों को ChatGPT को शक्ति प्रदान करता है, एक तस्वीर को पिक्सल के ग्रिड के बजाय पैच के अनुक्रम के रूप में मानता है। उन्होंने साबित कर दिया कि अत्याधुनिक छवि पहचान हासिल करने के लिए आपको कनवल्शन की आवश्यकता नहीं है।

विज़न ट्रांसफार्मर प्रारंभ में इनपुट छवि को कैसे संसाधित करता है?

एक ViT छवि को निश्चित पैच (अक्सर 16x16 पिक्सेल) में विभाजित करता है, प्रत्येक पैच को एक टोकन के रूप में एम्बेड करता है, और अनुक्रम को एक ट्रांसफार्मर में फीड करता है।

कौन सा मुख्य तंत्र वीआईटी को एक छवि के दूर के हिस्सों को एक दूसरे से जोड़ने देता है?

आत्म-ध्यान प्रत्येक पैच को सीधे हर दूसरे पैच से जानकारी का वजन करने देता है, जिससे पहली परत से एक वैश्विक दृश्य मिलता है।

सादे विज़न ट्रांसफार्मर को उत्कृष्टता प्राप्त करने के लिए आमतौर पर बहुत बड़े प्रशिक्षण डेटासेट की आवश्यकता क्यों होती है?

सीएनएन के विपरीत, वीआईटी स्थानीयता या अनुवाद अपरिवर्तनीयता को नहीं मानते हैं, इसलिए उन्हें बड़ी मात्रा में डेटा से इन पैटर्न को सीखना होगा।

विज़न ट्रांसफार्मर में स्थितीय एन्कोडिंग का उद्देश्य क्या है?

आत्म-ध्यान क्रम-अज्ञेयवादी है, इसलिए स्थितीय एन्कोडिंग प्रत्येक पैच के स्थानिक स्थान को पुनर्स्थापित करती है।

कौन सा कथन कंप्यूटर विज़न पर ViT के प्रभाव को सबसे अच्छी तरह दर्शाता है?

वीआईटी ने प्रदर्शित किया कि पर्याप्त डेटा और पैमाने के साथ एक शुद्ध ट्रांसफार्मर, सर्वोत्तम कनवल्शनल नेटवर्क को प्रतिद्वंद्वी या उससे आगे बढ़ा सकता है।