CNN με βάση την περιοχή
Τα CNN που βασίζονται σε περιοχή (R-CNN) είναι μια οικογένεια ανιχνευτών αντικειμένων που προτείνουν πρώτα υποψήφιες περιοχές σε μια εικόνα και στη συνέχεια χρησιμοποιούν ένα CNN για να ταξινομήσουν και να τοποθετήσουν με ακρίβεια κάθε αντικείμενο.
Επισκόπηση
They turned image classification into full object detection, locating and labeling many objects at once.
Βαθιά κατάδυση
Η ταξινόμηση εικόνας απαντά "τι είναι σε αυτή την εικόνα;" αλλά η ανίχνευση πρέπει επίσης να απαντά "πού, και πόσα;" Το αρχικό R-CNN (2014) χρησιμοποίησε έναν εξωτερικό αλγόριθμο (Επιλεκτική Αναζήτηση) για να προτείνει περίπου 2.000 περιοχές, παραμόρφωσε την καθεμία σε ένα σταθερό μέγεθος και έτρεξε ένα CNN σε καθεμία, το οποίο ήταν ακριβές αλλά οδυνηρά αργό. Το γρήγορο R-CNN το επιτάχυνε τρέχοντας το CNN μία φορά σε ολόκληρη την εικόνα και ομαδοποιώντας τα χαρακτηριστικά ανά περιοχή (ομαδοποίηση RoI). Το ταχύτερο R-CNN στη συνέχεια αντικατέστησε την Επιλεκτική Αναζήτηση με ένα μαθημένο Δίκτυο Προτάσεων Περιοχής (RPN), κάνοντας ολόκληρο τον αγωγό από άκρο σε άκρο και σχεδόν σε πραγματικό χρόνο. Το Mask R-CNN το επέκτεινε περαιτέρω ώστε να εξάγει μάσκες σε επίπεδο pixel για κάθε αντικείμενο που ανιχνεύτηκε.
Τεχνική διορατικότητα
Το βασικό άλμα απόδοσης είναι η συγκέντρωση RoI: αντί να εκτελείται ξανά ένα CNN σε κάθε προτεινόμενο πλαίσιο, το δίκτυο υπολογίζει έναν κοινόχρηστο χάρτη χαρακτηριστικών για την εικόνα, στη συνέχεια περικόπτει και αλλάζει το μέγεθος των χαρακτηριστικών εντός κάθε περιοχής ενδιαφέροντος σε ένα σταθερό πλέγμα. Το ταχύτερο RPN του R-CNN ολισθαίνει πάνω από αυτόν τον χάρτη χαρακτηριστικών προβλέποντας βαθμολογίες «αντικειμενικότητας» και προσαρμογές πλαισίου για προκαθορισμένα κουτιά αγκύρωσης διαφορετικών μεγεθών και αναλογιών, δημιουργώντας προτάσεις σχεδόν δωρεάν.
Στρατηγικός αντίκτυπος
Ταχύτητα και κλίμακα
Το Visual AI μπορεί να αυτοματοποιήσει εργασίες επιθεώρησης, ανίχνευσης και επισήμανσης σε κλίμακα.
Δημιουργήστε επιλογές
Οι δημιουργικές ομάδες μπορούν να δημιουργήσουν πρωτότυπες ιδέες γρηγορότερα με λιγότερες μη αυτόματες αναθεωρήσεις.
Ομάδα και ροή εργασίας
Οι λειτουργίες μπορούν να χρησιμοποιούν σήματα εικόνας και βίντεο που προηγουμένως ήταν δύσκολο να επεξεργαστούν.
Το μέλλον των CNN που βασίζονται στην περιοχή
Οι ανιχνευτές R-CNN δύο σταδίων παραμένουν ισχυροί εκεί όπου η ακρίβεια έχει μεγαλύτερη σημασία, αλλά οι ανιχνευτές ενός σταδίου (YOLO, SSD) και οι ανιχνευτές που βασίζονται σε μετασχηματιστές, όπως το DETR, οι οποίοι παρακάμπτουν εξ ολοκλήρου τις αγκυρώσεις και τις προτάσεις που έχουν σχεδιαστεί με το χέρι, είναι όλο και πιο δημοφιλείς για ταχύτητα και απλότητα. Η τάση είναι προς τον εντοπισμό από άκρο σε άκρο, χωρίς άγκυρα, βάσει ερωτημάτων. Ωστόσο, οι βασικές ιδέες της σειράς R-CNN, τα κοινά χαρακτηριστικά και η συλλογιστική σε επίπεδο περιοχής, συνεχίζουν να επηρεάζουν τα συστήματα τμηματοποίησης, βίντεο και 3D ανίχνευσης.
Υλοποίηση σε πραγματικό κόσμο
Ανίχνευση και καταμέτρηση προϊόντων στα ράφια λιανικής για διαχείριση αποθεμάτων
Παράδειγμα τμηματοποίησης κυττάρων ή οργάνων σε ιατρικές σαρώσεις χρησιμοποιώντας Μάσκα R-CNN
Εντοπισμός ελαττωμάτων και της θέσης τους σε μια γραμμή παραγωγής εργοστασίου
Εντοπισμός πολλαπλών οχημάτων και πεζών σε τροφοδοσίες κάμερας αυτόνομης οδήγησης
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Τα δικαιώματα εικόνας και η συναίνεση μπορεί να αποτελέσουν νομικούς κινδύνους εάν η προέλευση είναι ασαφής.
Η απόδοση του μοντέλου μπορεί να διαφέρει ανάλογα με το φωτισμό, τα δημογραφικά στοιχεία και τα περιβάλλοντα.
Τα ψευδώς θετικά μπορεί να περάσουν απαρατήρητα εκτός εάν παρακολουθούνται τα όρια εμπιστοσύνης.
Οδικός Χάρτης Εφαρμογής
Καθορίστε κριτήρια αποδοχής για το κόστος ακρίβειας, ανάκλησης και σφάλματος.
Δοκιμή με δεδομένα που ταιριάζουν με πραγματικές συνθήκες παραγωγής.
Προσθέστε ανθρώπινη κριτική για προβλέψεις χαμηλής εμπιστοσύνης ή υψηλού αντίκτυπου.
Παρακολουθήστε τη μετατόπιση του μοντέλου και επικυρώστε εκ νέου μετά από αλλαγές κάμερας ή δεδομένων.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Region-Based CNNs quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Παραγωγικά μοντέλα με βάση τη βαθμολογία
Συχνές ερωτήσεις
What is Region-Based CNNs?
Τα CNN που βασίζονται σε περιοχή (R-CNN) είναι μια οικογένεια ανιχνευτών αντικειμένων που προτείνουν πρώτα υποψήφιες περιοχές σε μια εικόνα και στη συνέχεια χρησιμοποιούν ένα CNN για να ταξινομήσουν και να τοποθετήσουν με ακρίβεια κάθε αντικείμενο. Μετέτρεψαν την ταξινόμηση εικόνων σε πλήρη ανίχνευση αντικειμένων, εντοπίζοντας και επισημαίνοντας πολλά αντικείμενα ταυτόχρονα.
Ποια είναι η βασική ιδέα ενός CNN με βάση την περιοχή;
Τα R-CNN προτείνουν περιοχές που μπορεί να περιέχουν αντικείμενα και στη συνέχεια εκτελούν ένα CNN για να ταξινομήσουν κάθε περιοχή και να βελτιώσουν το πλαίσιο οριοθέτησής της.
Γιατί το αρχικό R-CNN (2014) ήταν αργό;
Το αρχικό R-CNN έτρεχε το CNN ανεξάρτητα σε περίπου 2.000 προτάσεις περιοχής ανά εικόνα, κάτι που ήταν εξαιρετικά ακριβό υπολογιστικά.
Τι εισήγαγε το Faster R-CNN για να αντικαταστήσει την Επιλεκτική Αναζήτηση;
Το ταχύτερο R-CNN εισήγαγε ένα μαθημένο Δίκτυο Προτάσεων Περιοχής, καθιστώντας τη δημιουργία προτάσεων μέρος του εκπαιδευτικού δικτύου και πολύ πιο γρήγορα.
Τι επιτυγχάνει η συγκέντρωση RoI;
Η συγκέντρωση RoI εξάγει πλέγματα χαρακτηριστικών σταθερού μεγέθους από έναν κοινό κοινό χάρτη χαρακτηριστικών ανά περιοχή, αποφεύγοντας τον επανυπολογισμό και επιταχύνοντας την ανίχνευση.
Τι επιπλέον δυνατότητα προσθέτει το Mask R-CNN;
Το Mask R-CNN επεκτείνει το ταχύτερο R-CNN προβλέποντας μια ακριβή μάσκα σε επίπεδο pixel για κάθε αντικείμενο, επιτρέποντας την τμηματοποίηση στιγμιότυπων.