ΟΔΗΓΟΣ οπτικού AI

Μοντέλα Λανθάνουσας Διάχυσης

Τα μοντέλα λανθάνουσας διάχυσης δημιουργούν εικόνες εκτελώντας τη διαδικασία διάχυσης σε συμπιεσμένο λανθάνοντα χώρο αντί για ακατέργαστα pixel, μειώνοντας το κόστος υπολογισμού.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

They are the engine behind Stable Diffusion and most modern open-source image generators.

Βαθιά κατάδυση

Ένα τυπικό μοντέλο διάχυσης μαθαίνει να αντιστρέφει μια διαδικασία θορύβου: ξεκινά από καθαρό θόρυβο και σταδιακά αποθορβώνεται σε εικόνα. Το να το κάνετε αυτό απευθείας σε pixel είναι ακριβό επειδή μια εικόνα 512x512 έχει εκατοντάδες χιλιάδες τιμές. Η λανθάνουσα διάχυση, που εισήχθη από τον Rombach και τους συνεργάτες του το 2022, χρησιμοποιεί για πρώτη φορά έναν προεκπαιδευμένο αυτόματο κωδικοποιητή μεταβλητών (VAE) για να συμπιέσει μια εικόνα σε ένα μικρό λανθάνον πλέγμα (συχνά 64x64x4, περίπου 48x μικρότερο). Το U-Net διάχυσης στη συνέχεια μαθαίνει να αποθορβώνει μέσα σε αυτόν τον συμπαγή λανθάνοντα χώρο, καθοδηγούμενος από κείμενο μέσω διασταυρούμενης προσοχής. Τέλος, ο αποκωδικοποιητής VAE ανακατασκευάζει pixel πλήρους ανάλυσης. Αυτή η αντιληπτική συμπίεση διατηρεί τις σημασιολογικά σημαντικές πληροφορίες, ενώ απορρίπτει τις ανεπαίσθητες λεπτομέρειες, καθιστώντας εφικτή την παραγωγή υψηλής ποιότητας σε GPUs των καταναλωτών.

Τεχνική διορατικότητα

Το βασικό κόλπο είναι ο διαχωρισμός της αντιληπτικής συμπίεσης από τη γενετική μοντελοποίηση. Το VAE χειρίζεται τη λεπτομέρεια των pixel υψηλής συχνότητας μία φορά και το U-Net μοντελοποιεί μόνο τη λανθάνουσα κατανομή χαμηλότερων διαστάσεων. Η προετοιμασία κειμένου εγχέεται μέσω επιπέδων διασταυρούμενης προσοχής, όπου τα χωρικά χαρακτηριστικά του U-Net παρακολουθούν τις ενσωματώσεις διακριτικών από έναν κωδικοποιητή κειμένου όπως το CLIP. Επειδή τα λανθάνοντα είναι περίπου 48 φορές μικρότερα από τα εικονοστοιχεία, κάθε βήμα αποθορυβοποίησης είναι δραματικά φθηνότερο τόσο στη μνήμη όσο και στα FLOP.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Το Visual AI μπορεί να αυτοματοποιήσει εργασίες επιθεώρησης, ανίχνευσης και επισήμανσης σε κλίμακα.

Δημιουργήστε επιλογές

Οι δημιουργικές ομάδες μπορούν να δημιουργήσουν πρωτότυπες ιδέες γρηγορότερα με λιγότερες μη αυτόματες αναθεωρήσεις.

Ομάδα και ροή εργασίας

Οι λειτουργίες μπορούν να χρησιμοποιούν σήματα εικόνας και βίντεο που προηγουμένως ήταν δύσκολο να επεξεργαστούν.

Το μέλλον των μοντέλων λανθάνουσας διάχυσης

Η λανθάνουσα διάχυση επεκτείνεται πέρα ​​από τις εικόνες σε βίντεο (Σταθερή διάχυση βίντεο), τρισδιάστατα στοιχεία και φασματογράμματα ήχου, όλα χρησιμοποιώντας την ίδια συνταγή συμπίεσης και στη συνέχεια απονομής θόρυβος. Η έρευνα ωθεί προς λιγότερα βήματα δειγματοληψίας μέσω μοντέλων απόσταξης και συνέπειας, καλύτερων VAE που διατηρούν λεπτό κείμενο και όψεις και σκευασμάτων διορθωμένης ροής όπως αυτές στο Stable Diffusion 3 που ισιώνουν την τροχιά παραγωγής για ταχύτερα και πιο ευκρινή αποτελέσματα.

Υλοποίηση σε πραγματικό κόσμο

Η σταθερή διάχυση δημιουργεί έργα τέχνης και σχέδια ιδέας από προτροπές κειμένου σε μια μοναδική GPU καταναλωτή

Adobe και Canva που τροφοδοτούν τις λειτουργίες κειμένου σε εικόνα και γενετικής συμπλήρωσης βασισμένες σε λανθάνουσα ραχοκοκαλιά διάχυσης

Στούντιο παιχνιδιών που παράγουν χάρτες υφής, sprites και περιβαλλοντική ιδέα για την επιτάχυνση της προπαραγωγής

Ομάδες εικόνας στοκ και μάρκετινγκ που δημιουργούν μακέτες προϊόντων και διαφημιστικά γραφικά χωρίς φωτογράφιση

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα δικαιώματα εικόνας και η συναίνεση μπορεί να αποτελέσουν νομικούς κινδύνους εάν η προέλευση είναι ασαφής.

Η απόδοση του μοντέλου μπορεί να διαφέρει ανάλογα με το φωτισμό, τα δημογραφικά στοιχεία και τα περιβάλλοντα.

Τα ψευδώς θετικά μπορεί να περάσουν απαρατήρητα εκτός εάν παρακολουθούνται τα όρια εμπιστοσύνης.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε κριτήρια αποδοχής για το κόστος ακρίβειας, ανάκλησης και σφάλματος.

2

Δοκιμή με δεδομένα που ταιριάζουν με πραγματικές συνθήκες παραγωγής.

3

Προσθέστε ανθρώπινη κριτική για προβλέψεις χαμηλής εμπιστοσύνης ή υψηλού αντίκτυπου.

4

Παρακολουθήστε τη μετατόπιση του μοντέλου και επικυρώστε εκ νέου μετά από αλλαγές κάμερας ή δεδομένων.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Latent Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Μοντέλα διάχυσης βίντεο

Συχνές ερωτήσεις

What is Latent Diffusion Models?

Τα μοντέλα λανθάνουσας διάχυσης δημιουργούν εικόνες εκτελώντας τη διαδικασία διάχυσης σε συμπιεσμένο λανθάνοντα χώρο αντί για ακατέργαστα pixel, μειώνοντας το κόστος υπολογισμού. Είναι ο κινητήρας πίσω από το Stable Diffusion και οι πιο σύγχρονες γεννήτριες εικόνας ανοιχτού κώδικα.

Ποια είναι η κύρια καινοτομία των μοντέλων λανθάνουσας διάχυσης σε σύγκριση με τη διάχυση χώρου pixel;

Η λανθάνουσα διάχυση συμπιέζει τις εικόνες σε έναν μικρότερο λανθάνοντα χώρο χρησιμοποιώντας ένα VAE, έτσι η ακριβή αποθορβοποίηση γίνεται σε πολύ λιγότερες τιμές από τα πλήρη pixel.

Ποιο στοιχείο συμπιέζει μια εικόνα στον λανθάνοντα χώρο και την ανακατασκευάζει στη συνέχεια;

Ένα προεκπαιδευμένο VAE κωδικοποιεί την εικόνα σε ένα συμπαγές λανθάνον πλέγμα και ο αποκωδικοποιητής του αναδομεί pixel πλήρους ανάλυσης στο τέλος.

Πώς εγχέεται συνήθως το κείμενο στο U-Net αποθορβοποίησης σε λανθάνουσα διάχυση;

Οι ενσωματώσεις διακριτικών από έναν κωδικοποιητή κειμένου τροφοδοτούνται σε επίπεδα διασταυρούμενης προσοχής, επιτρέποντας στα χωρικά χαρακτηριστικά να παρακολουθούν την προτροπή.

Γιατί η λειτουργία σε λανθάνον χώρο μειώνει το υπολογιστικό κόστος;

Περιμένετε — ο σωστός λόγος είναι ότι το λανθάνον πλέγμα είναι πολύ μικρότερο (συχνά ~ 48x) από την εικόνα pixel, επομένως κάθε βήμα αποθορβοποίησης χρειάζεται πολύ λιγότερα FLOP και μνήμη.

Ποιο ευρέως χρησιμοποιούμενο μοντέλο ανοιχτού κώδικα έκανε δημοφιλή τη λανθάνουσα διάχυση;

Το Stable Diffusion, που κυκλοφόρησε το 2022, έφερε λανθάνουσα διάχυση στο υλικό των καταναλωτών και τη μαζική υιοθέτηση.