ΟΔΗΓΟΣ οπτικού AI

Stable Diffusion

Το Stable Diffusion είναι ένα μοντέλο ανοιχτού κώδικα κειμένου σε εικόνα, που κυκλοφόρησε από τη Stability AI το 2022, το οποίο δημιουργεί εικόνες αφαιρώντας σταδιακά το θόρυβο από ένα τυχαίο σημείο εκκίνησης.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

Being open and runnable on consumer GPUs, it sparked a massive community of tools, fine-tunes, and apps.

Βαθιά κατάδυση

Τα μοντέλα διάχυσης μαθαίνουν να αντιστρέφουν μια διαδικασία θορύβου. Κατά τη διάρκεια της προπόνησης, οι πραγματικές εικόνες έχουν τυχαίο θόρυβο που προστίθεται βήμα προς βήμα μέχρι να γίνουν στατικές. το μοντέλο μαθαίνει να προβλέπει και να αφαιρεί αυτόν τον θόρυβο. Για τη δημιουργία, ξεκινά από τον καθαρό θόρυβο και διαγράφει επανειλημμένα έως ότου εμφανιστεί μια συνεκτική εικόνα, καθοδηγούμενη από το μήνυμα κειμένου σας. Το βασικό τέχνασμα απόδοσης του Stable Diffusion είναι το «λανθάνον» μέρος: αντί να εργάζεται σε εικονοστοιχεία πλήρους ανάλυσης, συμπιέζει τις εικόνες σε ένα μικρότερο λανθάνον χώρο χρησιμοποιώντας έναν αυτόματο κωδικοποιητή παραλλαγών, εκτελεί εκεί την αργή αποθορυβοποίηση και μετά αποκωδικοποιεί πίσω σε pixel. Αυτός είναι ο λόγος που μπορεί να τρέξει σε μια τυπική GPU παιχνιδιών και όχι σε κέντρο δεδομένων. Ένας κωδικοποιητής κειμένου (CLIP στις πρώιμες εκδόσεις) μετατρέπει την προτροπή σας σε καθοδήγηση και ένα U-Net κάνει την αποθορυβοποίηση. Τα ανοιχτά βάρη του επέτρεψαν το ControlNet, τις τελειοποιήσεις LoRA και αμέτρητα δημιουργικά εργαλεία.

Τεχνική διορατικότητα

Το Stable Diffusion είναι ένα μοντέλο λανθάνουσας διάχυσης. Ένας αυτόματος κωδικοποιητής συρρικνώνει μια εικόνα 512x512 σε ένα συμπαγές λανθάνον πλέγμα, μειώνοντας δραματικά τον υπολογισμό. Ένα U-Net εκπαιδεύεται να προβλέπει τον θόρυβο που προστίθεται σε κάθε χρονικό βήμα, υπό τον όρο της ενσωμάτωσης κειμένου μέσω διασταυρούμενης προσοχής. Η καθοδήγηση χωρίς ταξινομητή σάς επιτρέπει να πληκτρολογείτε πόσο έντονα ακολουθεί η εικόνα την προτροπή, συνδυάζοντας προβλέψεις υπό όρους και χωρίς όρους. Συμπερασματικά, ένας δειγματολήπτης (όπως DDIM ή Euler) λαμβάνει έναν επιλεγμένο αριθμό βημάτων αφαίρεσης θορύβων. περισσότερα βήματα σημαίνουν γενικά καθαρότερα αποτελέσματα σε βάρος της ταχύτητας.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Το Visual AI μπορεί να αυτοματοποιήσει εργασίες επιθεώρησης, ανίχνευσης και επισήμανσης σε κλίμακα.

Δημιουργήστε επιλογές

Οι δημιουργικές ομάδες μπορούν να δημιουργήσουν πρωτότυπες ιδέες γρηγορότερα με λιγότερες μη αυτόματες αναθεωρήσεις.

Ομάδα και ροή εργασίας

Οι λειτουργίες μπορούν να χρησιμοποιούν σήματα εικόνας και βίντεο που προηγουμένως ήταν δύσκολο να επεξεργαστούν.

The Future of Stable Diffusion

Το ανοιχτό οικοσύστημα συνεχίζει να επιταχύνεται: νεότερες αρχιτεκτονικές (συμπεριλαμβανομένης της διάχυσης που βασίζεται σε μετασχηματιστή και των ταχύτερων δειγματοληπτών λίγων ή αποσταγμένων) μειώνουν την παραγωγή από δεκάδες βήματα σε ένα ή δύο, επιτρέποντας τη δημιουργία σχεδόν σε πραγματικό χρόνο. Περιμένετε ισχυρότερη απόδοση κειμένου, καλύτερη άμεση τήρηση και απρόσκοπτη επεξεργασία εικόνας, καθώς και επεκτάσεις βίντεο και 3D. Τα ανοιχτά βάρη θα συνεχίσουν να τροφοδοτούν εξειδικευμένες λεπτομέρειες, αλλά εντείνουν επίσης τις συζητήσεις σχετικά με τη συναίνεση δεδομένων εκπαίδευσης, τα βαθιά ψεύτικα και τα υδατογραφήματα, επομένως τα εργαλεία εντοπισμού και προέλευσης θα αυξηθούν παράλληλα με τα μοντέλα.

Υλοποίηση σε πραγματικό κόσμο

Καλλιτέχνες και χομπίστες που δημιουργούν concept art και εικονογραφήσεις τοπικά στη δική τους GPU με προσαρμοσμένες λεπτομέριες LoRA

Χρήση ControlNet για περιορισμό μιας γενιάς με σκελετό πόζας, χάρτη βάθους ή σκίτσο άκρων για ακριβή σύνθεση

Εισαγωγή και ζωγραφική για επεξεργασία φωτογραφιών, αφαίρεση αντικειμένων ή επέκταση μιας σκηνής πέρα από τα αρχικά της όρια

Indie στούντιο παιχνιδιών και σχεδιαστές που παράγουν textures, πίνακες διάθεσης και παραλλαγές στοιχείων γρήγορα και φθηνά

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα δικαιώματα εικόνας και η συναίνεση μπορεί να αποτελέσουν νομικούς κινδύνους εάν η προέλευση είναι ασαφής.

Η απόδοση του μοντέλου μπορεί να διαφέρει ανάλογα με το φωτισμό, τα δημογραφικά στοιχεία και τα περιβάλλοντα.

Τα ψευδώς θετικά μπορεί να περάσουν απαρατήρητα εκτός εάν παρακολουθούνται τα όρια εμπιστοσύνης.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε κριτήρια αποδοχής για το κόστος ακρίβειας, ανάκλησης και σφάλματος.

2

Δοκιμή με δεδομένα που ταιριάζουν με πραγματικές συνθήκες παραγωγής.

3

Προσθέστε ανθρώπινη κριτική για προβλέψεις χαμηλής εμπιστοσύνης ή υψηλού αντίκτυπου.

4

Παρακολουθήστε τη μετατόπιση του μοντέλου και επικυρώστε εκ νέου μετά από αλλαγές κάμερας ή δεδομένων.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stable Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Σταθερή διάχυση βίντεο

Συχνές ερωτήσεις

What is Stable Diffusion?

Το Stable Diffusion είναι ένα μοντέλο ανοιχτού κώδικα κειμένου σε εικόνα, που κυκλοφόρησε από τη Stability AI το 2022, το οποίο δημιουργεί εικόνες αφαιρώντας σταδιακά το θόρυβο από ένα τυχαίο σημείο εκκίνησης. Όντας ανοιχτό και με δυνατότητα εκτέλεσης σε GPU καταναλωτών, πυροδότησε μια τεράστια κοινότητα εργαλείων, βελτιστοποιήσεων και εφαρμογών.

Σε υψηλό επίπεδο, πώς ένα μοντέλο διάχυσης δημιουργεί μια εικόνα;

Τα μοντέλα διάχυσης μαθαίνουν να αντιστρέφουν μια διαδικασία θορύβου: ξεκινώντας από το θόρυβο, επαναλαμβάνουν επαναληπτικό θόρυβο μέχρι να εμφανιστεί μια συνεκτική εικόνα.

Τι κάνει το Stable Diffusion αρκετά αποδοτικό ώστε να λειτουργεί σε GPU καταναλωτή;

Το Stable Diffusion είναι ένα μοντέλο λανθάνουσας διάχυσης: ένας αυτόματος κωδικοποιητής συμπιέζει τις εικόνες έτσι ώστε η βαριά αποθορυβοποίηση να εκτελείται σε μικρότερο λανθάνοντα χώρο.

Πώς επηρεάζει το μήνυμα κειμένου σας την εικόνα που δημιουργείται;

Ένας κωδικοποιητής κειμένου μετατρέπει την προτροπή σε ενσωματώσεις που ρυθμίζουν το U-Net μέσω διασταυρούμενης προσοχής, κατευθύνοντας το αποτέλεσμα.

Τι σας επιτρέπει να ελέγχετε η καθοδήγηση χωρίς ταξινομητή;

Η καθοδήγηση χωρίς ταξινομητή συνδυάζει προβλέψεις υπό όρους και χωρίς όρους, επιτρέποντάς σας να ενεργοποιήσετε την άμεση συμμόρφωση προς τα πάνω ή προς τα κάτω.

Γιατί το Stable Diffusion πυροδότησε ένα τόσο μεγάλο οικοσύστημα εργαλείων όπως το ControlNet και το LoRA;

Τα ανοιχτά βάρη επιτρέπουν στην κοινότητα να τελειοποιήσει και να επεκτείνει το μοντέλο, δημιουργώντας πρόσθετα όπως το ControlNet και ελαφρούς προσαρμογείς LoRA.