ΟΔΗΓΟΣ οπτικού AI

MaskGIT Παράλληλη αποκωδικοποίηση διακριτικών

Το MaskGIT δημιουργεί εικόνες προβλέποντας πολλά διακριτικά ταυτόχρονα και συμπληρώνοντας πρώτα τα πιο σίγουρα, αντικαθιστώντας την αργή παραγωγή από αριστερά προς τα δεξιά με μια χούφτα γρήγορα παράλληλα βήματα.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Βαθιά κατάδυση

Το MaskGIT (Masked Generative Image Transformer), από Google το 2022, επανεξετάζει τον τρόπο αποκωδικοποίησης των μοντέλων εικόνων που βασίζονται σε διακριτικά. Παλαιότεροι μετασχηματιστές όπως το VQGAN παρήγαγαν διακριτικά αυτόματα, ένα κάθε φορά με σειρά ράστερ, κάτι που είναι αργό και αφύσικο για 2D εικόνες. Αντίθετα, το MaskGIT εκπαιδεύεται με έναν καλυμμένο στόχο μοντελοποίησης όπως το BERT: τυχαία υποσύνολα διακριτικών εικόνων είναι κρυμμένα και το μοντέλο μαθαίνει να τα προβλέπει όλα ταυτόχρονα χρησιμοποιώντας αμφίδρομη προσοχή. Κατά τη διάρκεια της παραγωγής ξεκινά από ένα πλήρως καλυμμένο πλέγμα και αποκωδικοποιείται σε σταθερό αριθμό επαναλήψεων (συχνά 8 έως 12). Κάθε βήμα προβλέπει κάθε μασκοφόρο διακριτικό, διατηρεί τις προβλέψεις με την υψηλότερη εμπιστοσύνη και καλύπτει ξανά τα υπόλοιπα για τον επόμενο γύρο. Αυτό παράγει εικόνες υψηλής ποιότητας σε περίπου μια τάξη μεγέθους λιγότερα βήματα από την αυτοπαλινδρομική αποκωδικοποίηση.

Τεχνική διορατικότητα

Το κρίσιμο στοιχείο είναι το πρόγραμμα κάλυψης που βασίζεται στην εμπιστοσύνη. Ένα πρόγραμμα συνημίτονου αποφασίζει πόσα διακριτικά θα αποκαλύψει κάθε επανάληψη, ξεκινώντας αργά και επιταχύνοντας. Επειδή η προσοχή είναι αμφίδρομη, κάθε κουπόνι βλέπει ολόκληρη τη μερική εικόνα, επομένως η πραγματοποίηση των πιο σίγουρων προβλέψεων αφήνει πρώτα τα βήματα να εξαρτηθούν από σταθερό πλαίσιο, όπως η επίλυση των απλών τμημάτων ενός παζλ πριν από τα διφορούμενα.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Το Visual AI μπορεί να αυτοματοποιήσει εργασίες επιθεώρησης, ανίχνευσης και επισήμανσης σε κλίμακα.

Δημιουργήστε επιλογές

Οι δημιουργικές ομάδες μπορούν να δημιουργήσουν πρωτότυπες ιδέες γρηγορότερα με λιγότερες μη αυτόματες αναθεωρήσεις.

Ομάδα και ροή εργασίας

Οι λειτουργίες μπορούν να χρησιμοποιούν σήματα εικόνας και βίντεο που προηγουμένως ήταν δύσκολο να επεξεργαστούν.

Το μέλλον της παράλληλης αποκωδικοποίησης διακριτικών MaskGIT

Η παράλληλη επαναληπτική αποκωδικοποίηση του MaskGIT ενέπνευσε ένα κύμα μη αυτοπαλινδρομικών γεννητριών, συμπεριλαμβανομένου του MUSE για κείμενο σε εικόνα και των προσεγγίσεων με μάσκα για βίντεο. Το μοτίβο, που προβλέπει τα διακριτικά παράλληλα και βελτιώνει σε μερικά βήματα, βρίσκεται ανάμεσα σε GAN μιας λήψης και διάχυση πολλών βημάτων, προσφέροντας μια ρυθμιζόμενη αντιστάθμιση ποιότητας-ταχύτητας. Αναμένετε ότι η αποκωδικοποίηση κρυφού διακριτικού θα συνεχίσει να εμφανίζεται σε γρήγορες πολυτροπικές γεννήτριες και συστήματα επεξεργασίας όπου η ζωγραφική και τα γεμίσματα υπό όρους είναι φυσικές ταιριάζουν.

Υλοποίηση σε πραγματικό κόσμο

Δημιουργία πλήρους εικόνας σε περίπου 8 έως 12 παράλληλα βήματα αντί για εκατοντάδες αυτοπαλινδρομικές προβλέψεις διακριτικών

Ζωγραφίζοντας μια καλυμμένη περιοχή μιας φωτογραφίας, προβλέποντας εκ νέου μόνο τα κρυφά διακριτικά με το περιβάλλον περιβάλλον

Σύνθεση εικόνας υπό όρους κατηγορίας στο ImageNet σε ποιότητα ανταγωνιστική με πολύ πιο αργά μοντέλα

Χρησιμεύει ως η ραχοκοκαλιά αποκωδικοποίησης για συστήματα κειμένου σε εικόνα όπως το MUSE του Google που χρειάζονται γρήγορη δημιουργία

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα δικαιώματα εικόνας και η συναίνεση μπορεί να αποτελέσουν νομικούς κινδύνους εάν η προέλευση είναι ασαφής.

Η απόδοση του μοντέλου μπορεί να διαφέρει ανάλογα με το φωτισμό, τα δημογραφικά στοιχεία και τα περιβάλλοντα.

Τα ψευδώς θετικά μπορεί να περάσουν απαρατήρητα εκτός εάν παρακολουθούνται τα όρια εμπιστοσύνης.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε κριτήρια αποδοχής για το κόστος ακρίβειας, ανάκλησης και σφάλματος.

2

Δοκιμή με δεδομένα που ταιριάζουν με πραγματικές συνθήκες παραγωγής.

3

Προσθέστε ανθρώπινη κριτική για προβλέψεις χαμηλής εμπιστοσύνης ή υψηλού αντίκτυπου.

4

Παρακολουθήστε τη μετατόπιση του μοντέλου και επικυρώστε εκ νέου μετά από αλλαγές κάμερας ή δεδομένων.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MaskGIT Parallel Token Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Παράλληλη αποκωδικοποίηση του σκελετού της σκέψης

Συχνές ερωτήσεις

What is MaskGIT Parallel Token Decoding?

Το MaskGIT δημιουργεί εικόνες προβλέποντας πολλά διακριτικά ταυτόχρονα και συμπληρώνοντας πρώτα τα πιο σίγουρα, αντικαθιστώντας την αργή παραγωγή από αριστερά προς τα δεξιά με μια χούφτα γρήγορα παράλληλα βήματα.

Πώς το MaskGIT αποκωδικοποιεί τα διακριτικά εικόνας διαφορετικά από τον μετασχηματιστή του VQGAN;

Το MaskGIT προβλέπει όλα τα καλυμμένα διακριτικά ταυτόχρονα με αμφίδρομη προσοχή, σε αντίθεση με την αργή αυτοπαλινδρομική αποκωδικοποίηση του VQGAN από αριστερά προς τα δεξιά.

Ποιο εκπαιδευτικό στόχο δανείζεται το MaskGIT από γλωσσικά μοντέλα;

Το MaskGIT κρύβει τυχαία υποσύνολα διακριτικών και μαθαίνει να τα προβλέπει, ένας καλυμμένος στόχος μοντελοποίησης παρόμοιος με το BERT.

Κατά τη διάρκεια της δημιουργίας, ποια διακριτικά δεσμεύει το MaskGIT σε κάθε επανάληψη;

Κάθε βήμα διατηρεί τις πιο σίγουρες προβλέψεις και αποκαλύπτει ξανά τις υπόλοιπες, επομένως τα επόμενα βήματα εξαρτώνται από αξιόπιστο πλαίσιο.

Πόσες περίπου επαναλήψεις χρειάζεται συνήθως το MaskGIT για να δημιουργήσει μια εικόνα;

Το MaskGIT αποκωδικοποιεί σε μικρό σταθερό αριθμό βημάτων, συχνά 8 έως 12, πολύ λιγότερα από τις προσεγγίσεις αυτοπαλίνδρομης ή διάχυσης.

Ποιο πρόγραμμα ελέγχει πόσα διακριτικά αποκαλύπτει το MaskGIT σε κάθε βήμα;

Ένα πρόγραμμα συνημίτονου αποκαλύπτει λίγα διακριτικά νωρίς και περισσότερα αργότερα, εξισορροπώντας την ποιότητα και την ταχύτητα σε όλες τις επαναλήψεις.