विज़ुअल एआई गाइड

दृश्य प्रश्न उत्तर

विज़ुअल क्वेश्चन आंसरिंग (VQA) एक सिस्टम को किसी छवि के बारे में प्राकृतिक-भाषा के प्रश्नों का मुक्त रूप में उत्तर देने देता है, जैसे 'कितने लोग टोपी पहन रहे हैं?' सही उत्तर देने के लिए चित्र और प्रश्न दोनों को संयुक्त रूप से समझने की आवश्यकता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

गहरा गोता

विज़ुअल प्रश्न उत्तर देना कंप्यूटर दृष्टि और प्राकृतिक भाषा प्रसंस्करण को जोड़ता है: एक छवि और एक प्रश्न दिया जाता है, मॉडल एक उत्तर देता है, जो एक शब्द, एक छोटा वाक्यांश, या हां/नहीं प्रतिक्रिया हो सकता है। इस कार्य को VQA डेटासेट (एंटोल एट अल., 2015) और इसके परिष्कृत VQA v2.0 संस्करण द्वारा लोकप्रिय बनाया गया, जिसने मॉडलों को केवल पाठ से अनुमान लगाने से हतोत्साहित करने के लिए संतुलित उत्तर दिए। सिस्टम छवि और प्रश्न को एन्कोड करते हैं, दो अभ्यावेदन को जोड़ते हैं, और फिर एक निश्चित उत्तर शब्दावली पर वर्गीकृत करके ऐतिहासिक रूप से एक उत्तर की भविष्यवाणी करते हैं। आज, GPT-4V, LLaVA और PaLI जैसे बड़े दृष्टि-भाषा मॉडल ओपन-एंडेड VQA को संभालते हैं, वस्तुओं, विशेषताओं, गणनाओं, स्थानिक संबंधों और यहां तक ​​कि छवियों के अंदर लिखे गए पाठ के बारे में तर्क देते हैं।

तकनीकी अंतर्दृष्टि

एक विशिष्ट वीक्यूए मॉडल छवि (सीएनएन या विज़न ट्रांसफॉर्मर) और प्रश्न (ट्रांसफॉर्मर टेक्स्ट एनकोडर) को एन्कोड करता है, फिर उन्हें फ़्यूज़ करता है, अक्सर क्रॉस-अटेंशन के साथ ताकि प्रश्न शब्द छवि क्षेत्रों में शामिल हो जाएं। फ़्यूज़्ड वेक्टर सामान्य उत्तरों पर एक क्लासिफायरियर या ओपन-एंडेड उत्तरों के लिए एक भाषा डिकोडर फ़ीड करता है। एक ज्ञात ख़तरा भाषा पूर्वाग्रह है: मॉडल उत्तर आँकड़ों का फायदा उठा सकते हैं और छवि को अनदेखा कर सकते हैं, जिसका VQA v2.0 जैसे संतुलित डेटासेट विशेष रूप से मुकाबला करते हैं।

सामरिक प्रभाव

गति और पैमाना

विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।

विकल्प बनाएं

रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।

टीम और वर्कफ़्लो

संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।

दृश्य प्रश्न उत्तर का भविष्य

वीक्यूए लघु-उत्तर वर्गीकरण से स्पष्टीकरण के साथ ओपन-एंडेड, बहु-चरणीय दृश्य तर्क की ओर विकसित हो रहा है। गिनती, चार्ट, आरेख, और टेक्स्ट-इन-इमेज (दस्तावेज़ VQA), साथ ही वीडियो VQA की मजबूत हैंडलिंग की अपेक्षा करें जो समय के साथ कारण बनता है। शॉर्टकट पूर्वाग्रह और मतिभ्रम को कम करना एक प्राथमिकता बनी हुई है, जैसा कि विश्वास के लिए विशिष्ट छवि क्षेत्रों में उत्तर देना है। सक्षम मल्टीमॉडल सहायक फोन पर, रोबोटिक्स में और एक्सेसिबिलिटी टूल में दृश्य प्रश्नों का तेजी से उत्तर देंगे जो उपयोगकर्ताओं को उनके परिवेश के बारे में पूछताछ करने में मदद करते हैं।

वास्तविक विश्व कार्यान्वयन

नेत्रहीन उपयोगकर्ताओं को किसी उत्पाद की तस्वीर लेने दें और पूछें 'यह कौन सा स्वाद है?' या 'समाप्ति तिथि क्या है?'

व्यावसायिक वर्कफ़्लो में चार्ट, फ़ॉर्म और स्कैन किए गए दस्तावेज़ (दस्तावेज़ VQA) के बारे में सवालों के जवाब देना

खुदरा और ई-कॉमर्स सहायकों को सशक्त बनाना जो 'क्या इस जैकेट में हुड है?' का जवाब देते हैं। किसी उत्पाद फ़ोटो से

स्कैन या माइक्रोस्कोपी छवियों के बारे में लक्षित प्रश्नों का उत्तर देकर चिकित्सा या वैज्ञानिक छवि समीक्षा का समर्थन करना

जोखिम और रेलिंग

यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।

मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।

जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।

कार्यान्वयन रोडमैप

1

सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।

2

वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।

3

कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।

4

कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Visual Question Answering quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is Visual Question Answering?

विज़ुअल क्वेश्चन आंसरिंग (VQA) एक सिस्टम को किसी छवि के बारे में प्राकृतिक-भाषा के प्रश्नों का मुक्त रूप में उत्तर देने देता है, जैसे 'कितने लोग टोपी पहन रहे हैं?' सही उत्तर देने के लिए चित्र और प्रश्न दोनों को संयुक्त रूप से समझने की आवश्यकता है।

दृश्य प्रश्न उत्तर प्रणाली कौन से दो इनपुट लेती है?

VQA एक छवि और उसके बारे में एक प्रश्न दोनों लेता है, फिर छवि के आधार पर एक उत्तर तैयार करता है।

VQA v2.0 डेटासेट 'संतुलित' उत्तरों के साथ क्यों बनाया गया था?

VQA v2.0 प्रश्नों को उन छवियों के साथ जोड़ता है जिनके उत्तर अलग-अलग होते हैं, जिससे मॉडलों को वास्तव में पाठ आँकड़ों का फायदा उठाने के बजाय दृश्य इनपुट का उपयोग करने के लिए मजबूर होना पड़ता है।

VQA में 'भाषा पूर्वाग्रह' क्या है?

भाषा पूर्वाग्रह तब होता है जब कोई मॉडल छवि को देखने के बजाय प्रश्न वाक्यांश से जुड़े उत्तर आँकड़ों का शोषण करता है।

कई VQA मॉडल छवि और प्रश्न जानकारी को कैसे जोड़ते हैं?

वीक्यूए मॉडल प्रत्येक मोडैलिटी को एन्कोड करते हैं और उन्हें फ़्यूज़ करते हैं, अक्सर क्रॉस-अटेंशन का उपयोग करते हुए ताकि प्रश्न शब्द प्रासंगिक छवि क्षेत्रों पर ध्यान केंद्रित करें।

क्लासिक VQA सिस्टम अक्सर क्या करके उत्तर देते हैं?

कई शुरुआती वीक्यूए मॉडल ने कार्य को सबसे अधिक बार आने वाले उत्तरों पर वर्गीकरण के रूप में माना, हालांकि आधुनिक मॉडल ओपन-एंडेड टेक्स्ट उत्पन्न करते हैं।