ΟΔΗΓΟΣ οπτικού AI

Αυτοκωδικοποιητές με μάσκα

Οι Masked Autoencoders (MAE) είναι μια αυτο-εποπτευόμενη μέθοδος που διδάσκει σε ένα μοντέλο όρασης να αναδομεί τις εικόνες αφού έχει κρυφτεί το μεγαλύτερο μέρος της εικόνας.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

By learning to fill in the blanks, the model builds rich visual understanding without any human labels.

Βαθιά κατάδυση

Οι Masked Autoencoders, που εισήχθησαν από τον Kaiming He και τους συνεργάτες του στο Meta AI το 2021, τραβούν μια εικόνα, τη χωρίζουν σε μικρές ενημερωμένες εκδόσεις και αποκρύπτουν τυχαία ένα πολύ μεγάλο μέρος τους, συχνά το 75%. Ένας κωδικοποιητής Vision Transformer επεξεργάζεται μόνο τα ορατά patches, ενώ ένας ελαφρύς αποκωδικοποιητής προσπαθεί να ανακατασκευάσει τα αρχικά pixel από αυτά που λείπουν. Επειδή πολλά είναι κρυμμένα, το μοντέλο δεν μπορεί απλώς να αντιγράψει κοντινά εικονοστοιχεία και πρέπει να μάθει ουσιαστική δομή, όπως σχήματα και μέρη αντικειμένων. Ο κωδικοποιητής που παρακάμπτει τα καλυμμένα patches κάνει την προπόνηση γρήγορη και αποδοτική στη μνήμη. Μετά την προεκπαίδευση, ο αποκωδικοποιητής απορρίπτεται και ο κωδικοποιητής μεταφέρεται έντονα σε εργασίες ταξινόμησης, ανίχνευσης και τμηματοποίησης.

Τεχνική διορατικότητα

Το βασικό κόλπο είναι η ασυμμετρία: ο βαρύς κωδικοποιητής βλέπει μόνο το ακάλυπτο 25% των patches, ενώ ένας μικρός αποκωδικοποιητής ανακατασκευάζει τα υπόλοιπα. Τα μπαλώματα είναι πεπλατυσμένα, γραμμικά ενσωματωμένα και δίνονται κωδικοποιήσεις θέσης. Η απώλεια ανακατασκευής είναι το μέσο τετραγωνικό σφάλμα που υπολογίζεται μόνο σε καλυμμένες ενημερώσεις κώδικα, συνήθως σε κανονικοποιημένες τιμές εικονοστοιχείων. Οι υψηλοί λόγοι κάλυψης αναγκάζουν τη σημασιολογική εκμάθηση και όχι την παρεμβολή χαμηλού επιπέδου και η παράκαμψη των καλυμμένων διακριτικών στις περικοπές του κωδικοποιητή υπολογίζεται δραματικά έναντι της επεξεργασίας της πλήρους εικόνας.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Το Visual AI μπορεί να αυτοματοποιήσει εργασίες επιθεώρησης, ανίχνευσης και επισήμανσης σε κλίμακα.

Δημιουργήστε επιλογές

Οι δημιουργικές ομάδες μπορούν να δημιουργήσουν πρωτότυπες ιδέες γρηγορότερα με λιγότερες μη αυτόματες αναθεωρήσεις.

Ομάδα και ροή εργασίας

Οι λειτουργίες μπορούν να χρησιμοποιούν σήματα εικόνας και βίντεο που προηγουμένως ήταν δύσκολο να επεξεργαστούν.

Το μέλλον των αυτοκωδικοποιητών με μάσκα

Η ανακατασκευή με μάσκα τύπου MAE γίνεται μια προεπιλεγμένη συνταγή προεκπαίδευσης σε όλους τους τρόπους. Οι ερευνητές το επεκτείνουν σε βίντεο (απόκρυψη κύβων χωροχρόνου), φασματογράμματα ήχου, ιατρικές σαρώσεις και δορυφορικές εικόνες, όπου οι ετικέτες είναι σπάνιες και ακριβές. Περιμένετε πιο σφιχτή σύντηξη με τη γλώσσα για πολυτροπικά μοντέλα θεμελίωσης, πιο αποτελεσματικούς αποκωδικοποιητές και προσαρμοστική κάλυψη που στοχεύει σε ενημερωτικές περιοχές. Καθώς οι υπολογιστές μεγαλώνουν, η συγκαλυμμένη προεκπαίδευση σε τεράστιες συλλογές εικόνων χωρίς ετικέτα θα πρέπει να συνεχίσει να βελτιώνει την ακρίβεια κατάντη, ενώ θα μειώνει την εξάρτηση από τον δαπανηρό ανθρώπινο σχολιασμό.

Υλοποίηση σε πραγματικό κόσμο

Προεκπαίδευση ενός Vision Transformer σε εκατομμύρια φωτογραφίες χωρίς ετικέτα και, στη συνέχεια, βελτιστοποιήστε το για ταξινόμηση ImageNet με μεγάλη ακρίβεια

Εκμάθηση χαρακτηριστικών από ιατρικές σαρώσεις χωρίς ετικέτα (ακτινογραφίες, μαγνητική τομογραφία) όπου ο σχολιασμός των ειδικών είναι ακριβός και περιορισμένος

Προσαρμογή της μεθόδου σε βίντεο με απόκρυψη επιδιορθώσεων χωροχρόνου για προεκπαίδευση μοντέλων αναγνώρισης ενεργειών (VideoMAE)

Προεκπαίδευση σε δορυφορικές και εναέριες εικόνες για υποστήριξη χαρτογράφησης χρήσης γης και ανίχνευσης αλλαγών χωρίς χειροκίνητες ετικέτες

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα δικαιώματα εικόνας και η συναίνεση μπορεί να αποτελέσουν νομικούς κινδύνους εάν η προέλευση είναι ασαφής.

Η απόδοση του μοντέλου μπορεί να διαφέρει ανάλογα με το φωτισμό, τα δημογραφικά στοιχεία και τα περιβάλλοντα.

Τα ψευδώς θετικά μπορεί να περάσουν απαρατήρητα εκτός εάν παρακολουθούνται τα όρια εμπιστοσύνης.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε κριτήρια αποδοχής για το κόστος ακρίβειας, ανάκλησης και σφάλματος.

2

Δοκιμή με δεδομένα που ταιριάζουν με πραγματικές συνθήκες παραγωγής.

3

Προσθέστε ανθρώπινη κριτική για προβλέψεις χαμηλής εμπιστοσύνης ή υψηλού αντίκτυπου.

4

Παρακολουθήστε τη μετατόπιση του μοντέλου και επικυρώστε εκ νέου μετά από αλλαγές κάμερας ή δεδομένων.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Masked Autoencoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Μούσα Μασκοφόρος Γενετική Απεικόνιση

Συχνές ερωτήσεις

What is Masked Autoencoders?

Οι Masked Autoencoders (MAE) είναι μια αυτο-εποπτευόμενη μέθοδος που διδάσκει σε ένα μοντέλο όρασης να αναδομεί τις εικόνες αφού έχει κρυφτεί το μεγαλύτερο μέρος της εικόνας. Μαθαίνοντας να συμπληρώνει τα κενά, το μοντέλο δημιουργεί πλούσια οπτική κατανόηση χωρίς ανθρώπινες ετικέτες.

Ποια είναι η βασική αυτό-εποπτευόμενη εργασία σε έναν αυτόματο κωδικοποιητή με μάσκα;

Το MAE κρύβει τα περισσότερα patches εικόνας και εκπαιδεύει το μοντέλο να ανακατασκευάζει τα pixel που λείπουν, χωρίς να απαιτούνται ανθρώπινες ετικέτες.

Χονδρικά τι κλάσμα των διορθώσεων εικόνας αποκρύπτει συνήθως το αρχικό MAE;

Το αρχικό MAE καλύπτει περίπου το 75% των ενημερώσεων κώδικα, μια υψηλή αναλογία που αναγκάζει το μοντέλο να μάθει ουσιαστική δομή αντί να αντιγράφει γείτονες.

Γιατί ο κωδικοποιητής MAE επεξεργάζεται μόνο τις ορατές (χωρίς μάσκα) ενημερώσεις κώδικα;

Η παράκαμψη των καλυμμένων διακριτικών στον κωδικοποιητή μειώνει σημαντικά τον υπολογισμό και τη μνήμη, καθώς χειρίζεται μόνο ένα μικρό κλάσμα ενημερώσεων κώδικα.

Τι συμβαίνει στον αποκωδικοποιητή μετά την ολοκλήρωση της προεκπαίδευσης MAE;

Ο ελαφρύς αποκωδικοποιητής χρειάζεται μόνο για ανακατασκευή κατά την προπόνηση. Στη συνέχεια, ο μαθημένος κωδικοποιητής μεταφέρεται σε εργασίες όπως η ανίχνευση.

Ποια συνάρτηση απώλειας χρησιμοποιεί συνήθως η MAE για ανακατασκευή;

Το MAE ελαχιστοποιεί το μέσο τετράγωνο σφάλμα μεταξύ προβλεπόμενων και πραγματικών τιμών εικονοστοιχείων, που υπολογίζεται μόνο στις καλυμμένες ενημερώσεις κώδικα.