Σύνθεση εικόνας VQGAN και Codebook
Το VQGAN συμπιέζει τις εικόνες σε ένα πλέγμα διακριτών διακριτικών που προέρχονται από ένα μαθημένο βιβλίο κωδικών, αφήνοντας έναν μετασχηματιστή να παράγει εικόνες με τον ίδιο τρόπο που τα μοντέλα γλώσσας δημιουργούν κείμενο.
Βαθιά κατάδυση
Το VQGAN, που παρουσιάστηκε στο έγγραφο του 2021 «Taming Transformers for High-Resolution Image Synthesis», συνδυάζει έναν αυτοκωδικοποιητή με διανυσματικό κβαντισμό (VQVAE) με αντίθετη και αντιληπτική εκπαίδευση. Ένας κωδικοποιητής αντιστοιχίζει μια εικόνα σε ένα μικρό πλέγμα διανυσμάτων χαρακτηριστικών. Κάθε διάνυσμα αποσπάται στην πλησιέστερη καταχώρηση σε ένα βιβλίο κωδικών που έχει μάθει, ας πούμε, 1024 διακριτών κωδίκων, μετατρέποντας την εικόνα σε μια ακολουθία ακέραιων διακριτικών. Ένας αποκωδικοποιητής ανακατασκευάζει την εικόνα από αυτά τα διακριτικά, εκπαιδευμένος με διακριτικό GAN και αντιληπτική απώλεια, ώστε οι ανακατασκευές να φαίνονται ευκρινείς και όχι θολές. Επειδή οι εικόνες είναι πλέον διακριτές ακολουθίες διακριτικών, ένας αυτοπαλινδρομικός μετασχηματιστής μπορεί να τις μοντελοποιήσει σαν γλώσσα, προβλέποντας τα διακριτικά ένα προς ένα. Το VQGAN τροφοδοτούσε περίφημα πρώιμα εργαλεία τέχνης κειμένου σε εικόνα όταν συνδυάζονται με καθοδήγηση CLIP.
Τεχνική διορατικότητα
Η βασική λειτουργία είναι η κβαντοποίηση του διανύσματος: οι συνεχείς έξοδοι κωδικοποιητή αντικαθίστανται από τα πλησιέστερα διανύσματα βιβλίου κωδίκων, με έναν εκτιμητή κλίσης «ευθεία» έτσι ώστε ο κωδικοποιητής να μπορεί ακόμα να μάθει παρά τη μη διαφοροποιήσιμη αναζήτηση. Η προσθήκη ενός διαχωριστή GAN που βασίζεται σε ενημερωμένες εκδόσεις πάνω από τον αυτόματο κωδικοποιητή είναι αυτό που επιτρέπει στο VQGAN να χρησιμοποιεί ένα πολύ μικρότερο πλέγμα διακριτικών (π.χ. 16x16) από το VQVAE, διατηρώντας παράλληλα ευκρινές τις υφές, καθιστώντας τη μοντελοποίηση μετασχηματιστών εύκολη.
Στρατηγικός αντίκτυπος
Ταχύτητα και κλίμακα
Το Visual AI μπορεί να αυτοματοποιήσει εργασίες επιθεώρησης, ανίχνευσης και επισήμανσης σε κλίμακα.
Δημιουργήστε επιλογές
Οι δημιουργικές ομάδες μπορούν να δημιουργήσουν πρωτότυπες ιδέες γρηγορότερα με λιγότερες μη αυτόματες αναθεωρήσεις.
Ομάδα και ροή εργασίας
Οι λειτουργίες μπορούν να χρησιμοποιούν σήματα εικόνας και βίντεο που προηγουμένως ήταν δύσκολο να επεξεργαστούν.
The Future of VQGAN και Codebook Image Synthesis
Η συνταγή διακριτών διακριτικών του VQGAN έγινε το θεμέλιο για μοντέλα εικόνας και βίντεο που βασίζονται σε διακριτικά, από το MaskGIT έως τα πολυτροπικά συστήματα που συνδυάζουν διακριτικά εικόνας και κειμένου σε έναν μετασχηματιστή. Η έρευνα ωθεί τώρα προς μεγαλύτερα, πεπερασμένα σε κλίμακα ή χωρίς αναζήτηση βιβλία κωδίκων που αποφεύγουν την κατάρρευση του βιβλίου κωδίκων και προς ενοποιημένα μοντέλα όπου το ίδιο λεξιλόγιο καλύπτει εικόνες, ήχο και γλώσσα, επιτρέποντας οποιαδήποτε γενιά.
Υλοποίηση σε πραγματικό κόσμο
Κωδικοποίηση μιας φωτογραφίας σε ένα πλέγμα 16x16 κουπονιών βιβλίου κωδικών, ώστε ένας μετασχηματιστής να μπορεί να το μοντελοποιήσει και να το αναγεννήσει
Συνδυάζοντας το VQGAN με την καθοδήγηση CLIP για τη δημιουργία της σουρεαλιστικής τέχνης «VQGAN+CLIP» AI που έγινε viral το 2021
Συμπίεση εικόνων σε συμπαγείς διακριτούς κωδικούς για αποτελεσματική αποθήκευση ή μεταγενέστερη εκπαίδευση
Χρησιμεύει ως το tokenizer εικόνας σε μεγαλύτερες γεννήτριες που βασίζονται σε διακριτικά όπως το MaskGIT και οι πολυτροπικοί μετασχηματιστές
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Τα δικαιώματα εικόνας και η συναίνεση μπορεί να αποτελέσουν νομικούς κινδύνους εάν η προέλευση είναι ασαφής.
Η απόδοση του μοντέλου μπορεί να διαφέρει ανάλογα με το φωτισμό, τα δημογραφικά στοιχεία και τα περιβάλλοντα.
Τα ψευδώς θετικά μπορεί να περάσουν απαρατήρητα εκτός εάν παρακολουθούνται τα όρια εμπιστοσύνης.
Οδικός Χάρτης Εφαρμογής
Καθορίστε κριτήρια αποδοχής για το κόστος ακρίβειας, ανάκλησης και σφάλματος.
Δοκιμή με δεδομένα που ταιριάζουν με πραγματικές συνθήκες παραγωγής.
Προσθέστε ανθρώπινη κριτική για προβλέψεις χαμηλής εμπιστοσύνης ή υψηλού αντίκτυπου.
Παρακολουθήστε τη μετατόπιση του μοντέλου και επικυρώστε εκ νέου μετά από αλλαγές κάμερας ή δεδομένων.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VQGAN and Codebook Image Synthesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
SPADE Semantic Image Synthesis
Συχνές ερωτήσεις
What is VQGAN and Codebook Image Synthesis?
Το VQGAN συμπιέζει τις εικόνες σε ένα πλέγμα διακριτών διακριτικών που προέρχονται από ένα μαθημένο βιβλίο κωδικών, αφήνοντας έναν μετασχηματιστή να παράγει εικόνες με τον ίδιο τρόπο που τα μοντέλα γλώσσας δημιουργούν κείμενο.
Τι χρησιμοποιεί το VQGAN για να αναπαραστήσει μια εικόνα ως διακριτά διακριτικά;
Το VQGAN κβαντίζει τα χαρακτηριστικά του κωδικοποιητή με τις πλησιέστερες εγγραφές σε ένα βιβλίο κωδικών που έχει μάθει, μετατρέποντας την εικόνα σε μια ακολουθία διακριτών δεικτών κώδικα.
Γιατί το VQGAN προσθέτει έναν διαχωριστή GAN πάνω από ένα VQVAE;
Οι αντίπαλες και αντιληπτικές απώλειες επιτρέπουν στο VQGAN να ανασυνθέσει ευκρινείς εικόνες από ένα συμπαγές πλέγμα διακριτικών, το οποίο μόνο το VQVAE τείνει να θολώνει.
Από τη στιγμή που μια εικόνα είναι μια ακολουθία διακριτικών, ποιο μοντέλο δημιουργεί νέες εικόνες;
Επειδή οι εικόνες γίνονται διακριτές ακολουθίες διακριτικών, ένας μετασχηματιστής μπορεί να τις μοντελοποιήσει αυτοπαλινδρομικά, ακριβώς όπως η δημιουργία κειμένου.
Ποια τεχνική επιτρέπει στις διαβαθμίσεις να ρέουν μέσω του μη διαφοροποιήσιμου βήματος κβαντισμού;
Η κβαντοποίηση του διανύσματος είναι μη διαφοροποιήσιμη, επομένως το VQGAN χρησιμοποιεί έναν εκτιμητή κλίσης κατευθείαν διαδοχικά για να εκπαιδεύσει τον κωδικοποιητή.
Ποια διάσημη τάση τέχνης AI βοήθησε να δημιουργήσει το VQGAN το 2021;
Η σύζευξη του VQGAN με την καθοδήγηση CLIP παρήγαγε την ευρέως διαδεδομένη τέχνη «VQGAN+CLIP» που έκανε δημοφιλή τη δημιουργία εικόνων που βασίζονται σε κείμενο.