विज़ुअल एआई गाइड

क्रिया पहचान

एक्शन रिकग्निशन कंप्यूटर को यह सिखाने का काम है कि लोग या वस्तुएं वीडियो में क्या कर रहे हैं - दौड़ना, लहराना, गिरना, दरवाजा खोलना - न कि केवल एक फ्रेम में क्या दिखाई देता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It matters because understanding motion over time unlocks applications from sports analytics to elderly fall detection.

गहरा गोता

समय के साथ पिक्सेल कैसे बदलते हैं, इसके बारे में तर्क करके क्रिया पहचान स्थैतिक छवि वर्गीकरण से आगे निकल जाती है। एक एकल फ़्रेम में एक व्यक्ति को मध्य हवा में दिखाया जा सकता है; केवल क्रम से ही पता चलता है कि वे कूद रहे हैं, गिर रहे हैं या गोता लगा रहे हैं। प्रारंभिक प्रणालियों में ऑप्टिकल प्रवाह और सघन प्रक्षेपवक्र जैसी हस्तनिर्मित गति विशेषताएं होती हैं। आधुनिक दृष्टिकोण गहरे नेटवर्क का उपयोग करते हैं: दो-धारा आर्किटेक्चर प्रक्रिया उपस्थिति (आरजीबी फ्रेम) और गति (ऑप्टिकल प्रवाह) अलग-अलग; 3डी कनवल्शनल नेटवर्क (जैसे सी3डी और आई3डी) अंतरिक्ष *और* समय के माध्यम से फिल्टर को स्लाइड करते हैं; और वीडियो ट्रांसफॉर्मर (टाइमफॉर्मर, वीडियोएमएई) अनुपात-अस्थायी पैच पर ध्यान केंद्रित करते हैं। मानक बेंचमार्क में काइनेटिक्स (यूट्यूब से 700 मानव क्रिया वर्ग), यूसीएफ101, और समथिंग-समथिंग शामिल हैं, जो मॉडलों को केवल दृश्य संदर्भ के बजाय अस्थायी दिशा को समझने के लिए मजबूर करता है।

तकनीकी अंतर्दृष्टि

मुख्य चुनौती अस्थायी आयाम का मॉडलिंग करना है। एक 3डी कनवल्शन एक सामान्य 2डी फिल्टर को कई फ़्रेमों में फैली गहराई अक्ष के साथ विस्तारित करता है, इसलिए यह सीधे गति पैटर्न सीखता है। I3D ट्रिक, ImageNet पर पूर्व-प्रशिक्षित 2D इमेज नेटवर्क से वजन को समय-समय पर दोहराकर 3D में 'बढ़ाती' है, जिससे एक मजबूत शुरुआती बिंदु मिलता है। इसके बजाय दो-स्ट्रीम विधियां पूर्व-गणना किए गए ऑप्टिकल प्रवाह को एक अलग शाखा में फ़ीड करती हैं, स्पष्ट रूप से आंदोलन को एन्कोड करती हैं और फिर इसे उपस्थिति सुविधाओं के साथ जोड़ती हैं।

सामरिक प्रभाव

गति और पैमाना

विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।

विकल्प बनाएं

रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।

टीम और वर्कफ़्लो

संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।

कार्रवाई पहचान का भविष्य

क्षेत्र कुशल वीडियो ट्रांसफॉर्मर और स्व-पर्यवेक्षित प्रीट्रेनिंग (नकाबपोश वीडियो मॉडलिंग) की ओर बढ़ रहा है, जो बिना लेबल वाले फुटेज से सीखता है, जिससे महंगी एनोटेशन पर निर्भरता कम हो जाती है। मल्टीमॉडल भाषा मॉडल के साथ सख्त एकीकरण की अपेक्षा करें ताकि सिस्टम न केवल क्रियाओं को लेबल कर सकें बल्कि प्राकृतिक भाषा में उनके बारे में वर्णन और तर्क कर सकें। पहनने योग्य वस्तुओं, रोबोटिक्स और स्मार्ट कैमरों के लिए वास्तविक समय, ऑन-डिवाइस पहचान एक प्रमुख सीमा है, साथ ही बारीक पहचान जो सूक्ष्म, लगभग-समान गतियों को अलग करती है।

वास्तविक विश्व कार्यान्वयन

बुजुर्ग देखभाल घरों में गिरने का पता लगाने वाली प्रणालियाँ जो किसी निवासी के गिरने पर कर्मचारियों को सचेत करती हैं, बैठने या लेटने से गिरने में अंतर करती हैं

स्पोर्ट्स एनालिटिक्स प्लेटफ़ॉर्म जो कोचिंग और प्रसारण हाइलाइट्स के लिए मैच फ़ुटेज में सर्व, टैकल और शॉट्स को स्वचालित रूप से टैग करते हैं

निगरानी और सुरक्षा निगरानी जो असामान्य व्यवहार जैसे लड़ाई, घूमना, या किसी के बाड़ पर चढ़ने को चिह्नित करती है

जेस्चर-नियंत्रित इंटरफ़ेस और फिटनेस ऐप्स जो समय के साथ शरीर की गतिविधियों को पहचानकर दोहराव की गिनती करते हैं और व्यायाम के प्रकार की जांच करते हैं

जोखिम और रेलिंग

यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।

मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।

जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।

कार्यान्वयन रोडमैप

1

सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।

2

वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।

3

कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।

4

कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Action Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is Action Recognition?

एक्शन रिकग्निशन कंप्यूटर को यह सिखाने का काम है कि लोग या वस्तुएं वीडियो में क्या कर रहे हैं - दौड़ना, लहराना, गिरना, दरवाजा खोलना - न कि केवल एक फ्रेम में क्या दिखाई देता है। यह मायने रखता है क्योंकि समय के साथ गति को समझने से खेल विश्लेषण से लेकर बुजुर्ग गिरावट का पता लगाने तक के अनुप्रयोग खुल जाते हैं।

क्रिया पहचान को सामान्य छवि वर्गीकरण से मौलिक रूप से क्या अलग करता है?

एक्शन रिकग्निशन मॉडल फ्रेम के अनुक्रम पर गति करता है, क्योंकि एक स्थिर छवि अक्सर यह नहीं बता सकती है कि कोई कूद रहा है, गिर रहा है या गोता लगा रहा है।

क्लासिक टू-स्ट्रीम एक्शन रिकग्निशन नेटवर्क में, दूसरी स्ट्रीम आम तौर पर क्या प्रक्रिया करती है?

दो-स्ट्रीम आर्किटेक्चर उपस्थिति (आरजीबी फ्रेम) के लिए एक शाखा और ऑप्टिकल प्रवाह के लिए दूसरी शाखा का उपयोग करते हैं, जो स्पष्ट रूप से फ्रेम के बीच आंदोलन को एन्कोड करता है।

मानक 2डी कनवल्शन की तुलना में 3डी कनवल्शन क्या जोड़ता है?

एक 3डी कनवल्शन फ़िल्टर को गहराई/समय आयाम के साथ विस्तारित करता है, जिससे यह लगातार फ़्रेमों में सीधे गति पैटर्न सीख सकता है।

I3D मॉडल द्वारा उपयोग की जाने वाली 'मुद्रास्फीति' चाल क्या है?

I3D 2डी छवियों (जैसे इमेजनेट) पर पूर्व-प्रशिक्षित वजन को टेम्पोरल अक्ष के साथ कॉपी करके 3डी में 'फुलाता' है, जो एक मजबूत आरंभीकरण प्रदान करता है।

समथिंग-समथिंग डेटासेट क्रिया पहचान के लिए उल्लेखनीय क्यों है?

समथिंग-समथिंग को इस तरह डिज़ाइन किया गया है कि कार्रवाई अस्थायी क्रम और गति पर निर्भर करती है, जिससे मॉडलों को केवल पृष्ठभूमि या ऑब्जेक्ट उपस्थिति का उपयोग करके धोखा देने से रोका जा सके।