Μούσα Μασκοφόρος Γενετική Απεικόνιση
Το Muse είναι ένα μοντέλο κειμένου σε εικόνα από την Google που δημιουργεί εικόνες συμπληρώνοντας διακριτικά καλυμμένων εικόνων ταυτόχρονα, καθιστώντας το πολύ πιο γρήγορο από τη διάχυση βήμα προς βήμα.
Επισκόπηση
It matters because it showed you can get high-quality, well-aligned images without the slow iterative denoising that most generators rely on.
Βαθιά κατάδυση
Το Muse λειτουργεί στον διακριτό διακριτικό χώρο μιας εικόνας. Ένα προεκπαιδευμένο VQGAN μετατρέπει μια εικόνα σε ένα πλέγμα ακέραιων διακριτικών, σαν ένα λεξιλόγιο οπτικών δομικών στοιχείων. Κατά τη διάρκεια της προπόνησης, ένα μεγάλο μέρος αυτών των διακριτικών καλύπτεται και ένας μετασχηματιστής μαθαίνει να τα προβλέπει πίσω, με βάση τις ενσωματώσεις κειμένου από ένα παγωμένο μοντέλο μεγάλης γλώσσας (T5-XXL). Κατά τη διάρκεια της γενιάς, το Muse ξεκινά από ένα πλέγμα με πλήρη μάσκα και αποκωδικοποιεί σε παράλληλους γύρους, προβλέποντας πολλά διακριτικά ανά βήμα και καλύπτοντας εκ νέου τα λιγότερο σίγουροι. Μια σχεδίαση δύο σταδίων δημιουργεί πρώτα ένα πλέγμα διακριτικών χαμηλής ανάλυσης και, στη συνέχεια, ένα μοντέλο υπερ-ανάλυσης γεμίζει ένα πλέγμα υψηλότερης ανάλυσης. Επειδή δεκάδες διακριτικά επιλύονται ταυτόχρονα, τα μοντέλα παραμέτρων 900M και 3B παράγουν μια εικόνα 256 ή 512 εικονοστοιχείων σε λίγα μόνο περάσματα προς τα εμπρός.
Τεχνική διορατικότητα
Το βασικό κόλπο είναι η παράλληλη αποκωδικοποίηση με επαναπροσωποποίηση βασισμένη στην εμπιστοσύνη, που συχνά ονομάζεται δειγματοληψία τύπου MaskGIT. Αντί να προβλέπει ένα διακριτικό τη φορά (αυτοπαλινδρομικό) ή να αφαιρεί το θόρυβο εκατοντάδες φορές (διάχυση), το Muse προβλέπει όλα τα καλυμμένα διακριτικά, διατηρεί τα πιο σίγουρα και τα υπόλοιπα για τον επόμενο γύρο. Η χρήση ενός παγωμένου κωδικοποιητή κειμένου T5-XXL παρέχει ισχυρή κατανόηση της γλώσσας δωρεάν και η λειτουργία σε διακριτά διακριτικά επιτρέπει στο μοντέλο να συλλογίζεται τις εικόνες περισσότερο σαν λέξεις.
Στρατηγικός αντίκτυπος
Ταχύτητα και κλίμακα
Το Visual AI μπορεί να αυτοματοποιήσει εργασίες επιθεώρησης, ανίχνευσης και επισήμανσης σε κλίμακα.
Δημιουργήστε επιλογές
Οι δημιουργικές ομάδες μπορούν να δημιουργήσουν πρωτότυπες ιδέες γρηγορότερα με λιγότερες μη αυτόματες αναθεωρήσεις.
Ομάδα και ροή εργασίας
Οι λειτουργίες μπορούν να χρησιμοποιούν σήματα εικόνας και βίντεο που προηγουμένως ήταν δύσκολο να επεξεργαστούν.
The Future of Muse Masked Generative Imaging
Η συγκαλυμμένη παράλληλη αποκωδικοποίηση οδηγεί σε γεννήτριες που είναι τόσο υψηλής ποιότητας όσο και πραγματικά γρήγορες, κάτι που είναι απαραίτητο για διαδραστική επεξεργασία και χρήση στη συσκευή. Αναμένετε ότι η ιδέα της πρόβλεψης διακριτικών θα συγχωνευθεί με τις μεθόδους διάχυσης και αυτόματης παλινδρόμησης βίντεο και θα ενισχύσει τη στιγμιαία inpainting, την εξωτερική ζωγραφική και την επεξεργασία χωρίς μάσκες. Καθώς βελτιώνονται οι διακριτοί tokenizers, η καλυμμένη απεικόνιση μπορεί να επεκταθεί καθαρά σε βίντεο και 3D, όπου η παράλληλη αποκωδικοποίηση θα μπορούσε να μειώσει δραματικά το κόστος δημιουργίας πολλών καρέ ή προβολών.
Υλοποίηση σε πραγματικό κόσμο
Γρήγοροι πίνακες εννοιολογικής τέχνης και διάθεσης όπου ένας καλλιτέχνης χρειάζεται πολλές παραλλαγές εικόνας σε δευτερόλεπτα και όχι σε λεπτά.
Ζωγραφική μηδενικής λήψης, όπως η αφαίρεση ενός αντικειμένου και η πλήρωση του μοντέλου της περιοχής με κάλυψη με συνέπεια με το περιβάλλον.
Ζωγραφική για να επεκτείνετε μια φωτογραφία πέρα από τα αρχικά της σύνορα για banner ή διαφορετικούς λόγους διαστάσεων.
Επεξεργασία χωρίς μάσκα, όπως η αλλαγή του χρώματος ενός σκύλου ή ενός ουρανού σε ηλιοβασίλεμα με την επεξεργασία της προτροπής κειμένου και την εκ νέου αποκωδικοποίηση των επηρεαζόμενων διακριτικών.
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Τα δικαιώματα εικόνας και η συναίνεση μπορεί να αποτελέσουν νομικούς κινδύνους εάν η προέλευση είναι ασαφής.
Η απόδοση του μοντέλου μπορεί να διαφέρει ανάλογα με το φωτισμό, τα δημογραφικά στοιχεία και τα περιβάλλοντα.
Τα ψευδώς θετικά μπορεί να περάσουν απαρατήρητα εκτός εάν παρακολουθούνται τα όρια εμπιστοσύνης.
Οδικός Χάρτης Εφαρμογής
Καθορίστε κριτήρια αποδοχής για το κόστος ακρίβειας, ανάκλησης και σφάλματος.
Δοκιμή με δεδομένα που ταιριάζουν με πραγματικές συνθήκες παραγωγής.
Προσθέστε ανθρώπινη κριτική για προβλέψεις χαμηλής εμπιστοσύνης ή υψηλού αντίκτυπου.
Παρακολουθήστε τη μετατόπιση του μοντέλου και επικυρώστε εκ νέου μετά από αλλαγές κάμερας ή δεδομένων.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Muse Masked Generative Imaging quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Αυτοκωδικοποιητές με μάσκα
Συχνές ερωτήσεις
What is Muse Masked Generative Imaging?
Το Muse είναι ένα μοντέλο κειμένου σε εικόνα από την Google που δημιουργεί εικόνες συμπληρώνοντας διακριτικά καλυμμένων εικόνων ταυτόχρονα, καθιστώντας το πολύ πιο γρήγορο από τη διάχυση βήμα προς βήμα. Έχει σημασία γιατί έδειξε ότι μπορείτε να λαμβάνετε υψηλής ποιότητας, καλά ευθυγραμμισμένες εικόνες χωρίς την αργή επαναληπτική διακοπή θορύβου στην οποία βασίζονται οι περισσότερες γεννήτριες.
Τι προβλέπει το Muse κατά τη διάρκεια της δημιουργίας αντί να αφαιρεί τα pixel;
Το Muse λειτουργεί σε έναν διακριτό χώρο διακριτικών, προβλέποντας κουπόνια με μάσκα εικόνας που παράγονται από έναν Tokenizer VQGAN αντί να εργάζεται απευθείας σε εικονοστοιχεία.
Γιατί το Muse είναι γενικά πιο γρήγορο από τα τυπικά μοντέλα διάχυσης;
Το Muse συμπληρώνει πολλά καλυμμένα token ταυτόχρονα και χρειάζεται μόνο μια χούφτα γύρους αποκωδικοποίησης, σε αντίθεση με τα πολλά διαδοχικά βήματα αποκωδικοποίησης της διάχυσης.
Από πού αντλεί το Muse την κατανόησή του για το μήνυμα κειμένου;
Δημιουργία συνθηκών Muse σε ενσωματώσεις κειμένου από ένα παγωμένο προεκπαιδευμένο μοντέλο γλώσσας T5-XXL, δίνοντάς του ισχυρή γλωσσική κατανόηση.
Ποιος είναι ο ρόλος του remasking που βασίζεται στην εμπιστοσύνη στο Muse;
Μετά από κάθε παράλληλη πρόβλεψη, το Muse διατηρεί τα κουπόνια με τη μεγαλύτερη αυτοπεποίθηση και καλύπτει εκ νέου τα λιγότερο σίγουρα για να τα τελειοποιήσει σε διαδοχικούς γύρους.
Πώς χειρίζεται το Muse την παραγωγή εικόνων υψηλότερης ανάλυσης;
Το Muse δημιουργεί πρώτα ένα πλέγμα διακριτικών χαμηλής ανάλυσης και στη συνέχεια ένα δεύτερο μοντέλο υπερ-ανάλυσης παράγει ένα πλέγμα διακριτικών υψηλότερης ανάλυσης.