विज़ुअल एआई गाइड

योलो रीयल-टाइम डिटेक्शन

YOLO (यू ओनली लुक वन्स) ऑब्जेक्ट डिटेक्शन मॉडल का एक परिवार है जो एक एकल न्यूरल नेटवर्क पास के साथ छवि में प्रत्येक ऑब्जेक्ट को ढूंढता है और लेबल करता है, जो लाइव वीडियो के लिए पर्याप्त तेज़ है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

Its speed unlocked real-time vision on everything from drones to self-checkout kiosks.

गहरा गोता

YOLO से पहले, R-CNN जैसे डिटेक्टरों ने छवि क्षेत्रों में हजारों बार क्लासिफायर चलाया, जो धीमा था। 2015 में जोसेफ रेडमन द्वारा पेश किए गए YOLO ने एक प्रतिगमन समस्या के रूप में पहचान को फिर से तैयार किया: छवि को एक ग्रिड में विभाजित करें, और प्रत्येक सेल के लिए एक ही फॉरवर्ड पास में बाउंडिंग बॉक्स, एक ऑब्जेक्टनेस स्कोर और क्लास संभावनाओं की भविष्यवाणी करें। उस 'एक बार देखो' डिज़ाइन ने सटीक रहते हुए इसे दो-चरण डिटेक्टरों की तुलना में नाटकीय रूप से तेज़ बना दिया। परिवार कई संस्करणों (YOLOv2 से YOLOv8 और उससे आगे) के माध्यम से तेजी से विकसित हुआ है, जिसमें एंकर बॉक्स, बेहतर बैकबोन और एंकर-मुक्त हेड शामिल हैं। आधुनिक वेरिएंट एक जीपीयू पर 100 फ्रेम प्रति सेकंड से भी अधिक की गति से चलते हैं, जिससे जब विलंबता सटीकता जितनी ही मायने रखती है तो YOLO डिफ़ॉल्ट विकल्प बन जाता है।

तकनीकी अंतर्दृष्टि

YOLO एक छवि को S ग्रिड द्वारा S में विभाजित करता है। प्रत्येक कोशिका एक ही पास में (x, y, चौड़ाई, ऊंचाई), एक आत्मविश्वास स्कोर और वर्ग संभावनाओं के साथ बाउंडिंग बॉक्स के एक निश्चित सेट की भविष्यवाणी करती है। ओवरलैपिंग डुप्लिकेट बॉक्स को गैर-अधिकतम दमन द्वारा काट दिया जाता है, जो उच्चतम-विश्वास वाले बॉक्स को रखता है और IoU सीमा से ऊपर के अन्य को हटा देता है। हानि संयुक्त रूप से बॉक्स निर्देशांक, वस्तुनिष्ठता और वर्गीकरण को अनुकूलित करती है, इसलिए संपूर्ण डिटेक्टर ट्रेनें अंत से अंत तक चलती हैं।

सामरिक प्रभाव

गति और पैमाना

विज़ुअल एआई बड़े पैमाने पर निरीक्षण, पता लगाने और टैगिंग कार्यों को स्वचालित कर सकता है।

विकल्प बनाएं

रचनात्मक टीमें कम मैन्युअल संशोधनों के साथ तेजी से अवधारणाओं का प्रोटोटाइप बना सकती हैं।

टीम और वर्कफ़्लो

संचालन छवि और वीडियो संकेतों का उपयोग कर सकते हैं जिन्हें संसाधित करना पहले कठिन था।

YOLO रीयल-टाइम डिटेक्शन का भविष्य

YOLO एज परिनियोजन की ओर रुझान रखता है, जिसमें छोटे मात्रा वाले मॉडल फोन, माइक्रोकंट्रोलर और क्लाउड कनेक्शन के बिना एम्बेडेड कैमरों पर चल रहे हैं। नए रिलीज़ में गति से समझौता किए बिना सटीकता के लिए ट्रांसफार्मर घटकों और एंकर-मुक्त डिज़ाइन का मिश्रण होता है। ट्रैकिंग और विभाजन के साथ सख्त एकीकरण की अपेक्षा करें, खुली-शब्दावली का पता लगाना जो निश्चित लेबल के बजाय पाठ संकेतों से वस्तुओं को पहचानता है, और किनारे पर सस्ते, कम-शक्ति वाले हार्डवेयर पर कुशलतापूर्वक चलाने पर ध्यान जारी रखता है।

वास्तविक विश्व कार्यान्वयन

सेल्फ-चेकआउट सिस्टम और कैशियर-लेस स्टोर, खरीदार द्वारा सामान उठाते ही उसका पता लगा लेते हैं

ड्रोन और कृषि रोबोट वास्तविक समय में फसलों, खरपतवार या पशुओं का पता लगा रहे हैं

स्मार्ट-सिटी विश्लेषण के लिए यातायात और निगरानी कैमरे वाहनों की गिनती कर रहे हैं और पैदल चलने वालों का पता लगा रहे हैं

विनिर्माण लाइनें तेजी से चलने वाले कन्वेयर बेल्ट पर दोषपूर्ण भागों को चिह्नित करती हैं

जोखिम और रेलिंग

यदि उत्पत्ति अस्पष्ट है तो छवि अधिकार और सहमति कानूनी जोखिम बन सकते हैं।

मॉडल का प्रदर्शन प्रकाश व्यवस्था, जनसांख्यिकी और वातावरण के अनुसार भिन्न हो सकता है।

जब तक आत्मविश्वास की सीमा की निगरानी नहीं की जाती, तब तक झूठी सकारात्मक बातों पर ध्यान नहीं दिया जा सकता।

कार्यान्वयन रोडमैप

1

सटीकता, रिकॉल और त्रुटि लागत के लिए स्वीकृति मानदंड परिभाषित करें।

2

वास्तविक उत्पादन स्थितियों से मेल खाने वाले डेटा के साथ परीक्षण करें।

3

कम-आत्मविश्वास या उच्च-प्रभाव वाली भविष्यवाणियों के लिए मानवीय समीक्षा जोड़ें।

4

कैमरा या डेटासेट में बदलाव के बाद मॉडल बहाव को ट्रैक करें और पुनः सत्यापित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YOLO Real-Time Detection quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is YOLO Real-Time Detection?

YOLO (यू ओनली लुक वन्स) ऑब्जेक्ट डिटेक्शन मॉडल का एक परिवार है जो एक एकल न्यूरल नेटवर्क पास के साथ छवि में प्रत्येक ऑब्जेक्ट को ढूंढता है और लेबल करता है, जो लाइव वीडियो के लिए पर्याप्त तेज़ है। इसकी गति ने ड्रोन से लेकर सेल्फ-चेकआउट कियोस्क तक हर चीज पर वास्तविक समय की दृष्टि को अनलॉक कर दिया।

इस संदर्भ में संक्षिप्त नाम YOLO का क्या अर्थ है?

YOLO का अर्थ है 'आप केवल एक बार देखें', यह दर्शाता है कि यह छवि के ऊपर से गुजरने वाले एकल तंत्रिका नेटवर्क में सभी वस्तुओं का पता लगाता है।

वह प्रमुख नवाचार क्या था जिसने YOLO को R-CNN जैसे पुराने डिटेक्टरों की तुलना में तेज़ बना दिया?

YOLO ने दो-चरण डिटेक्टरों के धीमे क्षेत्र-दर-क्षेत्र वर्गीकरण की जगह, एक छवि ग्रिड पर एक प्रतिगमन समस्या के रूप में पहचान को फिर से तैयार किया।

कौन सी तकनीक YOLO के आउटपुट में डुप्लिकेट, ओवरलैपिंग बाउंडिंग बॉक्स को हटा देती है?

गैर-अधिकतम दमन उच्चतम-विश्वास बॉक्स रखता है और ओवरलैपिंग बॉक्स को चौराहे-ओवर-यूनियन सीमा से ऊपर छोड़ देता है।

मूल YOLO डिज़ाइन में, भविष्यवाणी के लिए इनपुट छवि को कैसे विभाजित किया गया है?

YOLO छवि को S ग्रिड द्वारा S में विभाजित करता है, और प्रत्येक सेल इसमें केंद्रित वस्तुओं के लिए बॉक्स और वर्ग संभावनाओं की भविष्यवाणी करने के लिए जिम्मेदार है।

प्रत्येक ग्रिड सेल बाउंडिंग बॉक्स निर्देशांक के साथ किस मात्रा की भविष्यवाणी करता है?

प्रत्येक कोशिका बॉक्स निर्देशांक, वस्तुनिष्ठता आत्मविश्वास स्कोर और वर्ग संभावनाओं की भविष्यवाणी करती है, सभी संयुक्त रूप से एक फॉरवर्ड पास में।