ΟΔΗΓΟΣ οπτικού AI

Οπτική απάντηση ερωτήσεων

Η Visual Question Answering (VQA) επιτρέπει σε ένα σύστημα να απαντά σε ερωτήσεις φυσικής γλώσσας ελεύθερης μορφής σχετικά με μια εικόνα, όπως "Πόσα άτομα φορούν καπέλα;" Απαιτείται από κοινού κατανόηση τόσο της εικόνας όσο και της ερώτησης για να δοθεί μια σωστή απάντηση.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Βαθιά κατάδυση

Το Visual Question Answering συνδυάζει την όραση υπολογιστή και την επεξεργασία φυσικής γλώσσας: δεδομένου μιας εικόνας και μιας ερώτησης, το μοντέλο επιστρέφει μια απάντηση, η οποία μπορεί να είναι μια λέξη, μια σύντομη φράση ή μια απάντηση ναι/όχι. Η εργασία έγινε δημοφιλής από το σύνολο δεδομένων VQA (Antol et al., 2015) και την εκλεπτυσμένη έκδοση VQA v2.0, η οποία εξισορροπούσε τις απαντήσεις για να αποθαρρύνει τα μοντέλα να μαντέψουν μόνο από κείμενο. Τα συστήματα κωδικοποιούν την εικόνα και την ερώτηση, συγχωνεύουν τις δύο παραστάσεις και στη συνέχεια προβλέπουν μια απάντηση, ιστορικά ταξινομώντας σε ένα λεξιλόγιο σταθερής απάντησης. Σήμερα, μεγάλα μοντέλα γλώσσας όρασης όπως τα GPT-4V, LLaVA και PaLI χειρίζονται VQA ανοιχτού τύπου, συλλογισμούς σχετικά με αντικείμενα, ιδιότητες, μετρήσεις, χωρικές σχέσεις, ακόμη και κείμενο γραμμένο μέσα σε εικόνες.

Τεχνική διορατικότητα

Ένα τυπικό μοντέλο VQA κωδικοποιεί την εικόνα (CNN ή μετασχηματιστή όρασης) και την ερώτηση (κωδικοποιητής κειμένου μετασχηματιστή) και στη συνέχεια τα συγχωνεύει, συχνά με διασταυρούμενη προσοχή, ώστε οι ερωτηματικές λέξεις να παρακολουθούν τις περιοχές της εικόνας. Το συγχωνευμένο διάνυσμα τροφοδοτεί έναν ταξινομητή πάνω από κοινές απαντήσεις ή έναν αποκωδικοποιητή γλώσσας για απαντήσεις ανοιχτού τύπου. Μια γνωστή παγίδα είναι η γλωσσική μεροληψία: τα μοντέλα μπορούν να εκμεταλλευτούν τα στατιστικά στοιχεία των απαντήσεων και να αγνοήσουν την εικόνα, η οποία εξισορροπεί σύνολα δεδομένων όπως το VQA v2.0 ειδικά αντισταθμίζει.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Το Visual AI μπορεί να αυτοματοποιήσει εργασίες επιθεώρησης, ανίχνευσης και επισήμανσης σε κλίμακα.

Δημιουργήστε επιλογές

Οι δημιουργικές ομάδες μπορούν να δημιουργήσουν πρωτότυπες ιδέες γρηγορότερα με λιγότερες μη αυτόματες αναθεωρήσεις.

Ομάδα και ροή εργασίας

Οι λειτουργίες μπορούν να χρησιμοποιούν σήματα εικόνας και βίντεο που προηγουμένως ήταν δύσκολο να επεξεργαστούν.

Το μέλλον της οπτικής απάντησης σε ερωτήσεις

Το VQA εξελίσσεται από την ταξινόμηση σύντομων απαντήσεων σε οπτικό συλλογισμό ανοιχτού τύπου, πολλαπλών βημάτων με επεξηγήσεις. Αναμένετε ισχυρότερο χειρισμό μέτρησης, γραφημάτων, διαγραμμάτων και κειμένου σε εικόνα (έγγραφο VQA), καθώς και VQA βίντεο που οφείλεται στο χρόνο. Η μείωση της προκατάληψης συντομεύσεων και των παραισθήσεων παραμένει προτεραιότητα, όπως και οι απαντήσεις γείωσης σε συγκεκριμένες περιοχές εικόνας για εμπιστοσύνη. Οι ικανοί πολυτροπικοί βοηθοί θα απαντούν όλο και περισσότερο σε οπτικές ερωτήσεις συνομιλώντας σε τηλέφωνα, στη ρομποτική και σε εργαλεία προσβασιμότητας που βοηθούν τους χρήστες να ανακρίνουν το περιβάλλον τους.

Υλοποίηση σε πραγματικό κόσμο

Αφήστε τους τυφλούς χρήστες να φωτογραφίσουν ένα προϊόν και να ρωτήσουν "Τι γεύση είναι αυτό;" ή 'Ποια είναι η ημερομηνία λήξης;'

Απάντηση σε ερωτήσεις σχετικά με γραφήματα, φόρμες και σαρωμένα έγγραφα (έγγραφο VQA) σε ροές εργασίας επιχειρήσεων

Ενίσχυση βοηθών λιανικής και ηλεκτρονικού εμπορίου που απαντούν στο "Αυτό το σακάκι έχει κουκούλα;" από φωτογραφία προϊόντος

Υποστήριξη ιατρικής ή επιστημονικής ανασκόπησης εικόνων απαντώντας σε στοχευμένες ερωτήσεις σχετικά με σαρώσεις ή εικόνες μικροσκοπίας

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα δικαιώματα εικόνας και η συναίνεση μπορεί να αποτελέσουν νομικούς κινδύνους εάν η προέλευση είναι ασαφής.

Η απόδοση του μοντέλου μπορεί να διαφέρει ανάλογα με το φωτισμό, τα δημογραφικά στοιχεία και τα περιβάλλοντα.

Τα ψευδώς θετικά μπορεί να περάσουν απαρατήρητα εκτός εάν παρακολουθούνται τα όρια εμπιστοσύνης.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε κριτήρια αποδοχής για το κόστος ακρίβειας, ανάκλησης και σφάλματος.

2

Δοκιμή με δεδομένα που ταιριάζουν με πραγματικές συνθήκες παραγωγής.

3

Προσθέστε ανθρώπινη κριτική για προβλέψεις χαμηλής εμπιστοσύνης ή υψηλού αντίκτυπου.

4

Παρακολουθήστε τη μετατόπιση του μοντέλου και επικυρώστε εκ νέου μετά από αλλαγές κάμερας ή δεδομένων.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Visual Question Answering quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Συχνές ερωτήσεις

What is Visual Question Answering?

Η Visual Question Answering (VQA) επιτρέπει σε ένα σύστημα να απαντά σε ερωτήσεις φυσικής γλώσσας ελεύθερης μορφής σχετικά με μια εικόνα, όπως "Πόσα άτομα φορούν καπέλα;" Απαιτείται από κοινού κατανόηση τόσο της εικόνας όσο και της ερώτησης για να δοθεί μια σωστή απάντηση.

Ποιες δύο εισόδους παίρνει ένα σύστημα οπτικής απάντησης ερωτήσεων;

Το VQA παίρνει τόσο μια εικόνα όσο και μια ερώτηση σχετικά με αυτό, και στη συνέχεια παράγει μια απάντηση που βασίζεται στην εικόνα.

Γιατί δημιουργήθηκε το σύνολο δεδομένων VQA v2.0 με «ισορροπημένες» απαντήσεις;

Το VQA v2.0 συνδυάζει ερωτήσεις με εικόνες που έχουν διαφορετικές απαντήσεις, αναγκάζοντας τα μοντέλα να χρησιμοποιούν πραγματικά την οπτική είσοδο αντί να εκμεταλλεύονται στατιστικά στοιχεία κειμένου.

Τι είναι η «γλωσσική μεροληψία» στο VQA;

Γλωσσική μεροληψία είναι όταν ένα μοντέλο εκμεταλλεύεται στατιστικά στοιχεία απαντήσεων που συνδέονται με τη διατύπωση ερωτήσεων αντί να κοιτάξει την εικόνα.

Πώς πολλά μοντέλα VQA συνδυάζουν πληροφορίες εικόνας και ερωτήσεων;

Τα μοντέλα VQA κωδικοποιούν κάθε τρόπο λειτουργίας και τα συγχωνεύουν, χρησιμοποιώντας συχνά διασταυρούμενη προσοχή, ώστε οι ερωτηματικές λέξεις να παρακολουθούν τις σχετικές περιοχές εικόνας.

Τα κλασικά συστήματα VQA συχνά παρήγαγαν απαντήσεις κάνοντας τι;

Πολλά πρώιμα μοντέλα VQA αντιμετώπισαν την εργασία ως ταξινόμηση σε σχέση με τις πιο συχνές απαντήσεις, αν και τα σύγχρονα μοντέλα δημιουργούν κείμενο ανοιχτού τύπου.