Αυτοπαλινδρομική Δημιουργία Εικόνων
Η παραγωγή εικόνων με αυτόματη παλινδρόμηση δημιουργεί εικόνες ένα κομμάτι κάθε φορά, προβλέποντας κάθε διακριτικό από οτιδήποτε δημιουργήθηκε πριν από αυτό.
Επισκόπηση
It matters because the same next-token machinery powering language models can produce coherent, controllable images.
Βαθιά κατάδυση
Η δημιουργία αυτοπαλινδρομικής εικόνας αντιμετωπίζει μια εικόνα ως ακολουθία και την προβλέπει στοιχείο προς στοιχείο, όπου κάθε νέο στοιχείο εξαρτάται από όλα τα προηγούμενα. Οι πρώτες εργασίες όπως το PixelRNN και το PixelCNN προέβλεπαν εικόνες ένα ακατέργαστο pixel τη φορά, σαρώνοντας σειρά με σειρά, η οποία ήταν αργή αλλά θεωρητικά καθαρή. Αντίθετα, τα σύγχρονα συστήματα συμπιέζουν πρώτα μια εικόνα σε ένα πλέγμα διακριτών διακριτικών χρησιμοποιώντας έναν κωδικοποιητή τύπου VQ-VAE και, στη συνέχεια, ένας μετασχηματιστής προβλέπει αυτά τα διακριτικά από αριστερά προς τα δεξιά. Το DALL-E 1 του OpenAI και το Parti του Google ακολούθησαν αυτήν τη συνταγή, δημιουργώντας διακριτικά εικόνας που εξαρτώνται από μια προτροπή κειμένου πριν τα αποκωδικοποιήσουν ξανά σε pixel. Το μεγάλο πλεονέκτημα είναι η ακριβής μοντελοποίηση πιθανοτήτων και μια ενοποιημένη αρχιτεκτονική κοινή με τη γλώσσα. Το κόστος είναι διαδοχική, αργή δειγματοληψία.
Τεχνική διορατικότητα
Το μοντέλο παραγοντοποιεί την κοινή πιθανότητα όλων των διακριτικών σε ένα γινόμενο συνθηκών: p(x) = γινόμενο του p(x_i δεδομένου x_1...x_{i-1}). Ένας μετασχηματιστής με αιτιολογική (καλυμμένη) προσοχή επιβάλλει ότι κάθε θέση βλέπει μόνο προηγούμενα διακριτικά. Κατά τη διάρκεια της εκπαίδευσης προβλέπει κάθε διακριτικό παράλληλα χρησιμοποιώντας εξαναγκασμό δασκάλου, αλλά στο συμπέρασμα πρέπει να δειγματίζει ένα διακριτικό τη φορά, τροφοδοτώντας το κάθε ένα.
Στρατηγικός αντίκτυπος
Ταχύτητα και κλίμακα
Το Visual AI μπορεί να αυτοματοποιήσει εργασίες επιθεώρησης, ανίχνευσης και επισήμανσης σε κλίμακα.
Δημιουργήστε επιλογές
Οι δημιουργικές ομάδες μπορούν να δημιουργήσουν πρωτότυπες ιδέες γρηγορότερα με λιγότερες μη αυτόματες αναθεωρήσεις.
Ομάδα και ροή εργασίας
Οι λειτουργίες μπορούν να χρησιμοποιούν σήματα εικόνας και βίντεο που προηγουμένως ήταν δύσκολο να επεξεργαστούν.
Το μέλλον της δημιουργίας αυτοπαλίνδρομων εικόνων
Η ταχύτητα είναι το κεντρικό πεδίο μάχης. Τεχνικές όπως η παράλληλη και η αποκωδικοποίηση με μάσκα (MaskGIT, Muse) δημιουργούν πολλά διακριτικά ταυτόχρονα και η κερδοσκοπική αποκωδικοποίηση δανεισμένη από μοντέλα γλώσσας προσαρμόζεται σε εικόνες. Οι ερευνητές ενοποιούν επίσης διακριτικά κειμένου και εικόνας σε μια ενιαία αυτοπαλινδρομική ραχοκοκαλιά, ώστε ένα μοντέλο να μπορεί να διαβάζει και να σχεδιάζει, όπως φαίνεται στα πολυτροπικά συστήματα. Αναμένετε αυτοπαλινδρομικές ιδέες και ιδέες διάχυσης που θα συνεχίσουν να συνδυάζονται, με τα υβριδικά μοντέλα να καταγράφουν τη δυνατότητα ελέγχου των διακριτικών και την ποιότητα της διάχυσης.
Υλοποίηση σε πραγματικό κόσμο
Το DALL-E 1 δημιούργησε εικόνες προβλέποντας αυτοπαλινδρομικά ένα πλέγμα διακριτών διακριτικών εικόνων από μια λεζάντα κειμένου.
Το Parti του Google κλιμάκωσε έναν αυτοπαλινδρομικό μετασχηματιστή κειμένου σε εικόνα σε 20 δισεκατομμύρια παραμέτρους για λεπτομερείς, άμεσες και πιστές σκηνές.
Το PixelCNN και το PixelRNN επέδειξαν ακατέργαστη δημιουργία pixel-by-pixel και εξακολουθούν να χρησιμοποιούνται ως βασικές γραμμές διδασκαλίας για μοντέλα που βασίζονται σε πιθανότητες.
Το MaskGIT και το Muse χρησιμοποιούν παράλληλη αποκωδικοποίηση με μάσκα για να επιταχύνουν τη σύνθεση εικόνων που βασίζεται σε διακριτικά, διατηρώντας παράλληλα την προπόνηση σε αυτοπαλινδρομικό στυλ.
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Τα δικαιώματα εικόνας και η συναίνεση μπορεί να αποτελέσουν νομικούς κινδύνους εάν η προέλευση είναι ασαφής.
Η απόδοση του μοντέλου μπορεί να διαφέρει ανάλογα με το φωτισμό, τα δημογραφικά στοιχεία και τα περιβάλλοντα.
Τα ψευδώς θετικά μπορεί να περάσουν απαρατήρητα εκτός εάν παρακολουθούνται τα όρια εμπιστοσύνης.
Οδικός Χάρτης Εφαρμογής
Καθορίστε κριτήρια αποδοχής για το κόστος ακρίβειας, ανάκλησης και σφάλματος.
Δοκιμή με δεδομένα που ταιριάζουν με πραγματικές συνθήκες παραγωγής.
Προσθέστε ανθρώπινη κριτική για προβλέψεις χαμηλής εμπιστοσύνης ή υψηλού αντίκτυπου.
Παρακολουθήστε τη μετατόπιση του μοντέλου και επικυρώστε εκ νέου μετά από αλλαγές κάμερας ή δεδομένων.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Autoregressive Image Generation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Δημιουργία εικόνας AI
Συχνές ερωτήσεις
What is Autoregressive Image Generation?
Η παραγωγή εικόνων με αυτόματη παλινδρόμηση δημιουργεί εικόνες ένα κομμάτι κάθε φορά, προβλέποντας κάθε διακριτικό από οτιδήποτε δημιουργήθηκε πριν από αυτό. Έχει σημασία γιατί οι ίδιοι μηχανισμοί που τροφοδοτούν τα μοντέλα γλώσσας μπορούν να παράγουν συνεκτικές, ελεγχόμενες εικόνες.
Τι σημαίνει «αυτοπαλινδρομικό» στο πλαίσιο της δημιουργίας εικόνων;
Τα αυτοπαλινδρομικά μοντέλα παραγοντοποιούν την εικόνα ως ακολουθία, προβλέποντας κάθε διακριτικό ή εικονοστοιχείο με βάση όλα τα στοιχεία που δημιουργήθηκαν πριν από αυτό.
Πώς αντιπροσωπεύουν συνήθως τα σύγχρονα μοντέλα αυτοπαλινδρομικής εικόνας όπως το DALL-E 1 μια εικόνα πριν την προβλέψουν;
Τα σύγχρονα συστήματα συμπιέζουν την εικόνα σε διακριτά διακριτικά (συχνά μέσω κωδικοποιητή τύπου VQ-VAE) και στη συνέχεια προβλέπουν αυτήν την ακολουθία διακριτικών με έναν μετασχηματιστή.
Ποια πρώιμα μοντέλα παρήγαγαν εικόνες ένα ακατέργαστο pixel τη φορά;
Το PixelRNN και το PixelCNN ήταν πρωτοποριακά αυτοπαλινδρομικά μοντέλα που σάρωναν και πρόβλεψαν εικόνες pixel προς pixel.
Ποιος μηχανισμός διασφαλίζει ότι ένας μετασχηματιστής φροντίζει μόνο τα προηγούμενα διακριτικά κατά τη διάρκεια της αυτοπαλινδρομικής παραγωγής;
Η αιτιώδης κάλυψη εμποδίζει κάθε θέση από την παρακολούθηση σε μελλοντικά διακριτικά, επιβάλλοντας την παραγοντοποίηση από αριστερά προς τα δεξιά.
Ποιο είναι το κύριο πρακτικό μειονέκτημα της αυτοπαλινδρομικής δειγματοληψίας εικόνων;
Επειδή κάθε διακριτικό εξαρτάται από τα προηγούμενα, το συμπέρασμα πρέπει να εκτελείται διακριτικό με διακριτικό, καθιστώντας την παραγωγή σχετικά αργή.