विज़ुअल एआई गाइड

स्थानिक ट्रांसफार्मर नेटवर्क

स्थानिक ट्रांसफार्मर नेटवर्क (एसटीएन) सीखने योग्य मॉड्यूल हैं जो एक तंत्रिका नेटवर्क को सक्रिय रूप से अपने इनपुट को घुमाने, घुमाने, क्रॉप करने या फिर से स्केल करने देते हैं ताकि जो मायने रखता है उस पर ध्यान केंद्रित किया जा सके।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

They give CNNs a built-in sense of spatial attention and invariance.

गहरा गोता

मानक कनवल्शनल नेटवर्क स्थिति, पैमाने और रोटेशन में परिवर्तन के लिए केवल कमजोर रूप से अपरिवर्तनीय होते हैं, थोड़ी सहनशीलता के लिए पूलिंग पर निर्भर होते हैं। जैडरबर्ग एट अल द्वारा प्रस्तुत स्थानिक ट्रांसफार्मर नेटवर्क। 2015 में, एक अलग मॉड्यूल सम्मिलित करके इसे ठीक करें जो फीचर मानचित्रों पर एक स्पष्ट ज्यामितीय परिवर्तन करता है। मॉड्यूल में तीन भाग होते हैं: एक स्थानीयकरण नेटवर्क जो परिवर्तन मापदंडों की भविष्यवाणी करता है, एक ग्रिड जनरेटर जो उन मापदंडों से एक नमूना ग्रिड बनाता है, और एक नमूना जो ग्रिड बिंदुओं पर इनपुट को प्रक्षेपित करता है। क्योंकि हर चरण अलग-अलग होता है, पूरे ट्रांसफार्मर को बिना किसी अतिरिक्त पर्यवेक्षण के बैकप्रॉपैगेशन द्वारा शुरू से अंत तक प्रशिक्षित किया जाता है। उदाहरण के लिए, नेटवर्क झुके हुए अंकों को सीधा करना या संबंधित क्षेत्र पर ज़ूम करना सीखता है, जिससे सटीकता और मजबूती बढ़ती है।

तकनीकी अंतर्दृष्टि

स्थानीयकरण नेटवर्क अनुवाद, स्केल, रोटेशन और कतरनी के लिए पैरामीटर (अक्सर 2x3 एफ़िन मैट्रिक्स) आउटपुट करता है। ग्रिड जनरेटर प्रत्येक आउटपुट पिक्सेल को उस मैट्रिक्स के माध्यम से स्रोत समन्वय पर वापस मैप करता है। इसके बाद सैंपलर बिलिनियर इंटरपोलेशन का उपयोग करके इनपुट को पढ़ता है, जो अलग-अलग होता है इसलिए ग्रेडिएंट स्थानीयकरण नेटवर्क में प्रवाहित होते हैं। यह मॉड्यूल को कार्य हानि, प्रासंगिक क्षेत्रों में भाग लेने और कैनोनिकलाइज़ करने से पूरी तरह से परिवर्तन सीखने देता है।

सामरिक प्रभाव

गति और पैमाना

विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।

विकल्प बनाएं

रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।

टीम और वर्कफ़्लो

संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।

स्थानिक ट्रांसफार्मर नेटवर्क का भविष्य

एसटीएन ने प्रभावित किया कि नेटवर्क कैसे ज्यामिति और ध्यान को संभालते हैं, विकृत संकल्पों और सीखे गए-वारिंग मॉड्यूल में फीड करते हैं। जबकि आत्म-ध्यान ट्रांसफार्मर अब हावी हैं, एसटीएन-शैली विभेदित नमूनाकरण स्पष्ट ज्यामितीय संरेखण की आवश्यकता वाले कार्यों में जारी रहता है: पाठ पहचान, बारीक वर्गीकरण, और मुद्रा सामान्यीकरण। 3डी दृष्टि, तंत्रिका प्रतिपादन और चिकित्सा छवि पंजीकरण में अलग-अलग विकृतियों के दिखाई देने की अपेक्षा करें, जिन्हें अक्सर प्रतिस्थापित करने के बजाय ध्यान के साथ जोड़ दिया जाता है।

वास्तविक विश्व कार्यान्वयन

दृश्य-पाठ ओसीआर सिस्टम में पहचान से पहले घुमावदार या घुमाए गए पाठ को सीधा और संरेखित करना

सूक्ष्म छवि वर्गीकरण के लिए विभेदक क्षेत्रों (जैसे पक्षी की चोंच या पंख) में ज़ूम करना

चेहरा-पहचान पाइपलाइनों में प्रीप्रोसेसिंग चरण के रूप में चेहरे की मुद्रा और संरेखण को सामान्य बनाना

मेडिकल छवि पंजीकरण में विकृतियों को ठीक करना और स्कैन को संरेखित करना

जोखिम और रेलिंग

यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।

मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।

जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।

कार्यान्वयन रोडमैप

1

सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।

2

वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।

3

कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।

4

कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Spatial Transformer Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

डीईटीआर ट्रांसफार्मर का पता लगाना

अक्सर पूछे जाने वाले प्रश्नों

What is Spatial Transformer Networks?

स्थानिक ट्रांसफार्मर नेटवर्क (एसटीएन) सीखने योग्य मॉड्यूल हैं जो एक तंत्रिका नेटवर्क को सक्रिय रूप से अपने इनपुट को घुमाने, घुमाने, क्रॉप करने या फिर से स्केल करने देते हैं ताकि जो मायने रखता है उस पर ध्यान केंद्रित किया जा सके। वे सीएनएन को स्थानिक ध्यान और अपरिवर्तनशीलता की अंतर्निहित भावना देते हैं।

एक स्थानिक ट्रांसफार्मर नेटवर्क एक तंत्रिका नेटवर्क में क्या क्षमता जोड़ता है?

एसटीएन एक सीखने योग्य मॉड्यूल सम्मिलित करता है जो प्रासंगिक सामग्री पर ध्यान केंद्रित करने के लिए फीचर मानचित्रों का अनुवाद, घुमा, स्केल या ताना-बाना कर सकता है।

कौन से तीन घटक एक स्थानिक ट्रांसफार्मर मॉड्यूल बनाते हैं?

एक एसटीएन में एक स्थानीयकरण नेटवर्क (मापदंडों की भविष्यवाणी), एक ग्रिड जनरेटर (नमूना निर्देशांक बनाता है), और एक नमूना (इनपुट को प्रक्षेपित करता है) होता है।

एक स्थानिक ट्रांसफार्मर नेटवर्क को सामान्य बैकप्रॉपैगेशन के साथ क्यों प्रशिक्षित किया जा सकता है?

सैंपलर में बिलिनियर इंटरपोलेशन अलग-अलग होता है, इसलिए ग्रेडिएंट ग्रिड जनरेटर के माध्यम से स्थानीयकरण नेटवर्क में वापस प्रवाहित होते हैं, जिससे एंड-टू-एंड प्रशिक्षण सक्षम होता है।

एफ़िन ट्रांसफ़ॉर्मेशन के लिए स्थानीयकरण नेटवर्क आम तौर पर क्या आउटपुट देता है?

एफ़िन ट्रांसफ़ॉर्म के लिए, स्थानीयकरण नेटवर्क 2x3 मैट्रिक्स एन्कोडिंग अनुवाद, स्केल, रोटेशन और कतरनी के रूप में व्यवस्थित छह मानों की भविष्यवाणी करता है।

मानक सीएनएन केवल स्थानिक परिवर्तनों के लिए कमजोर रूप से अपरिवर्तनीय क्यों हैं, एसटीएन को प्रेरित करते हैं?

सीएनएन पूलिंग के माध्यम से केवल मामूली स्थानिक अपरिवर्तनीयता प्राप्त करते हैं; एसटीएन स्थिति, पैमाने और रोटेशन को संभालने के लिए एक स्पष्ट, सीखने योग्य तरीका जोड़ते हैं।