ΟΔΗΓΟΣ οπτικού AI

Ανίχνευση αντικειμένων ανοιχτού λεξιλογίου

Η ανίχνευση αντικειμένων ανοιχτού λεξιλογίου επιτρέπει σε ένα μοντέλο να βρίσκει και να τοποθετεί αντικείμενα που περιγράφονται από αυθαίρετο κείμενο, συμπεριλαμβανομένων κατηγοριών που δεν είδε ποτέ να επισημαίνονται κατά τη διάρκεια της εκπαίδευσης.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

It matters because traditional detectors are locked to a fixed list of classes, while open-vocabulary models can detect almost anything you can name.

Βαθιά κατάδυση

Οι κλασικοί ανιχνευτές εκπαιδεύονται σε ένα κλειστό σύνολο κατηγοριών, ας πούμε οι 80 τάξεις στο COCO, και δεν μπορούν να αναγνωρίσουν ένα «πράγμα» εκτός αυτής της λίστας. Η ανίχνευση ανοιχτού λεξιλογίου σπάει αυτό το όριο ευθυγραμμίζοντας τα χαρακτηριστικά της οπτικής περιοχής με έναν κοινό χώρο ενσωμάτωσης γλώσσας όρασης, που συνήθως μαθαίνεται από τεράστια ζεύγη εικόνας-κειμένου (όπως στο CLIP). Συμπερασματικά, παρέχετε ετικέτες κειμένου, το μοντέλο ενσωματώνει αυτές τις ετικέτες και αντιστοιχίζει τις ανιχνευμένες περιοχές με όποια ενσωμάτωση κειμένου είναι πιο κοντινή, επομένως οι νέες κατηγορίες λειτουργούν όσο μπορείτε να τις περιγράψετε. Συστήματα όπως το ViLD, το GLIP, το OWL-ViT, το Detic και το Grounding DINO διέδωσαν την προσέγγιση συνδυάζοντας ραχοκοκαλιά ανίχνευσης με γείωση γλώσσας και εκπαιδεύοντας σε μεγάλα σύνολα δεδομένων με ασθενή επισήμανση ή γείωση.

Τεχνική διορατικότητα

Το κόλπο είναι η αντικατάσταση ενός σταθερού στρώματος ταξινομητή με ενσωματώσεις κειμένου. Αντί να μαθαίνει ένα διάνυσμα βάρους ανά γνωστή τάξη, ο ανιχνευτής προβάλλει κάθε περιοχή στον ίδιο χώρο με έναν κωδικοποιητή γλώσσας. Η ταξινόμηση γίνεται σύγκριση ομοιότητας μεταξύ των χαρακτηριστικών περιοχής και των ενσωματώσεων ονομάτων ή φράσεων κατηγοριών που παρέχονται από τον χρήστη. Επειδή ο κωδικοποιητής κειμένου γενικεύεται σε λέξεις που δεν εμφανίζονται, η εναλλαγή σε νέες συμβολοσειρές ετικετών τη στιγμή της δοκιμής επιτρέπει τον εντοπισμό κατηγοριών που απουσιάζουν από τα δεδομένα εκπαίδευσης του πλαισίου οριοθέτησης.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Το Visual AI μπορεί να αυτοματοποιήσει εργασίες επιθεώρησης, ανίχνευσης και επισήμανσης σε κλίμακα.

Δημιουργήστε επιλογές

Οι δημιουργικές ομάδες μπορούν να δημιουργήσουν πρωτότυπες ιδέες γρηγορότερα με λιγότερες μη αυτόματες αναθεωρήσεις.

Ομάδα και ροή εργασίας

Οι λειτουργίες μπορούν να χρησιμοποιούν σήματα εικόνας και βίντεο που προηγουμένως ήταν δύσκολο να επεξεργαστούν.

Το μέλλον της ανίχνευσης αντικειμένων ανοιχτού λεξιλογίου

Η ανίχνευση ανοιχτού λεξιλογίου συγκλίνει με τη γείωση και την τμηματοποίηση, όπου φράσεις ελεύθερης μορφής (όχι μόνο μεμονωμένες λέξεις) εντοπίζουν αντικείμενα, και με συστήματα που συνδυάζονται με μοντέλα όπως το SAM για μάσκες. Περιμένετε μεγαλύτερη ακρίβεια μηδενικής λήψης, μεγαλύτερα και περισσότερα ερωτήματα κειμένου σύνθεσης («η κόκκινη κούπα πίσω από το φορητό υπολογιστή») και στενή σύζευξη με πολυτροπικούς βοηθούς που ανιχνεύουν κατά παραγγελία. Καθώς βελτιώνεται η εκπαίδευση κειμένου εικόνας σε κλίμακα ιστού, η γραμμή μεταξύ ανίχνευσης, ανάκτησης και κατανόησης της γλώσσας θα συνεχίσει να θολώνει προς τη γενική οπτική γείωση.

Υλοποίηση σε πραγματικό κόσμο

Αναζήτηση εικόνων για σπάνια ή προσαρμοσμένα αντικείμενα πληκτρολογώντας τα ονόματά τους χωρίς επανεκπαίδευση

Συστήματα ρομποτικής που εντοπίζουν ένα αντικείμενο που ονομάζει ο χρήστης σε φυσική γλώσσα πριν το καταλάβει

Αυτόματη επισήμανση συνόλων δεδομένων ανιχνεύοντας πολλές νέες κατηγορίες από μια λίστα κειμένου

Έλεγχος περιεχομένου που επισημαίνει αντικείμενα που δεν υπάρχουν στις αρχικές ετικέτες εκπαίδευσης

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα δικαιώματα εικόνας και η συναίνεση μπορεί να αποτελέσουν νομικούς κινδύνους εάν η προέλευση είναι ασαφής.

Η απόδοση του μοντέλου μπορεί να διαφέρει ανάλογα με το φωτισμό, τα δημογραφικά στοιχεία και τα περιβάλλοντα.

Τα ψευδώς θετικά μπορεί να περάσουν απαρατήρητα εκτός εάν παρακολουθούνται τα όρια εμπιστοσύνης.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε κριτήρια αποδοχής για το κόστος ακρίβειας, ανάκλησης και σφάλματος.

2

Δοκιμή με δεδομένα που ταιριάζουν με πραγματικές συνθήκες παραγωγής.

3

Προσθέστε ανθρώπινη κριτική για προβλέψεις χαμηλής εμπιστοσύνης ή υψηλού αντίκτυπου.

4

Παρακολουθήστε τη μετατόπιση του μοντέλου και επικυρώστε εκ νέου μετά από αλλαγές κάμερας ή δεδομένων.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Open-Vocabulary Object Detection quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Ανίχνευση αντικειμένων

Συχνές ερωτήσεις

What is Open-Vocabulary Object Detection?

Η ανίχνευση αντικειμένων ανοιχτού λεξιλογίου επιτρέπει σε ένα μοντέλο να βρίσκει και να τοποθετεί αντικείμενα που περιγράφονται από αυθαίρετο κείμενο, συμπεριλαμβανομένων κατηγοριών που δεν είδε ποτέ να επισημαίνονται κατά τη διάρκεια της εκπαίδευσης. Έχει σημασία γιατί οι παραδοσιακοί ανιχνευτές είναι κλειδωμένοι σε μια σταθερή λίστα κλάσεων, ενώ τα μοντέλα ανοιχτού λεξιλογίου μπορούν να ανιχνεύσουν σχεδόν οτιδήποτε μπορείτε να ονομάσετε.

Ποια είναι η καθοριστική ικανότητα της ανίχνευσης αντικειμένων ανοιχτού λεξιλογίου;

Η ανίχνευση ανοιχτού λεξιλογίου μπορεί να προσαρμόσει τοπικά τις κατηγορίες που καθορίζονται από κείμενο κατά τη στιγμή της δοκιμής, ακόμα και αυτές που δεν είδε ποτέ να φέρουν ετικέτα με οριοθετημένα πλαίσια.

Πώς ταξινομούν αυτά τα μοντέλα μια περιοχή που έχει εντοπιστεί;

Προβάλλουν περιοχές σε έναν χώρο ενσωμάτωσης γλώσσας οράματος και ταιριάζουν κάθε περιοχή με την πλησιέστερη ενσωμάτωση ετικέτας κειμένου.

Ποιος πόρος προεκπαίδευσης επιτρέπει περισσότερο την ανίχνευση ανοιχτού λεξιλογίου;

Τα τεράστια δεδομένα κειμένου εικόνας (όπως χρησιμοποιούνται από μοντέλα σε στυλ CLIP) δημιουργούν τον κοινόχρηστο χώρο ενσωμάτωσης που επιτρέπει στο κείμενο να γενικεύεται σε νέες κατηγορίες.

Ποιο εξάρτημα αντικαθίσταται σε σύγκριση με έναν ανιχνευτή κλειστού σετ;

Αντί για διανύσματα βάρους σταθερής κατηγορίας, η ταξινόμηση χρησιμοποιεί ομοιότητα με ενσωματώσεις κειμένου, επομένως μπορούν να προστεθούν νέες συμβολοσειρές ετικετών κατά τη δοκιμή.

Ποιο από αυτά είναι ένα παράδειγμα ανοιχτού λεξιλογίου ή μοντέλου ανίχνευσης γείωσης;

Το Grounding DINO, μαζί με τους GLIP, OWL-ViT, ViLD και Detic, είναι γνωστοί ανιχνευτές ανοιχτού λεξιλογίου ή γείωσης.