Δείγματα DDPM και DDIM
Το DDPM και το DDIM είναι δύο τρόποι εκτέλεσης της αντίστροφης διαδικασίας ενός μοντέλου διάχυσης, μετατρέποντας τον τυχαίο θόρυβο σε εικόνα βήμα προς βήμα.
Επισκόπηση
DDPM is the original stochastic recipe; DDIM is a faster, deterministic shortcut that produces comparable images in far fewer steps.
Βαθιά κατάδυση
Ένα μοντέλο διάχυσης εκπαιδεύεται προσθέτοντας σταδιακά Gaussian θόρυβο στις εικόνες και στη συνέχεια μαθαίνοντας να προβλέπει αυτόν τον θόρυβο. Η δειγματοληψία αντιστρέφει αυτό. Το DDPM (Denoise Diffusion Probabilistic Models, Ho et al. 2020) ανατρέχει σε κάθε επίπεδο θορύβου, προσθέτοντας ένα νέο τυχαίο θόρυβο σε κάθε βήμα, επομένως χρειάζεται συνήθως εκατοντάδες έως χίλια βήματα. Το DDIM (Denoising Diffusion Implicit Models, Song et al. 2021) επαναχρησιμοποιεί το ίδιο ακριβώς εκπαιδευμένο δίκτυο, αλλά ακολουθεί μια μη Μαρκοβιανή, ντετερμινιστική τροχιά. Με την πτώση της εγχυόμενης τυχαιότητας, το DDIM μπορεί να παρακάμψει πολλά χρονικά βήματα και να προσγειωθεί σε μια εικόνα υψηλής ποιότητας σε 10-50 βήματα. Επειδή το DDIM είναι ντετερμινιστικό, ο ίδιος θόρυβος εκκίνησης δίνει πάντα την ίδια εικόνα, επιτρέποντας την ομαλή παρεμβολή και αναπαραγωγιμότητα.
Τεχνική διορατικότητα
Και οι δύο δειγματολήπτες χρησιμοποιούν ένα δίκτυο που προβλέπει το έψιλον θορύβου που προστίθεται σε μια εικόνα στο χρονικό βήμα t. Η ενημέρωση του DDPM αφαιρεί μια κλιμακούμενη έκδοση αυτής της πρόβλεψης και στη συνέχεια προσθέτει θόρυβο διακύμανσης που προέρχεται από το οπίσθιο. Το DDIM ξαναγράφει την ενημέρωση για να εκτιμήσει πρώτα την καθαρή εικόνα x0 και, στη συνέχεια, να την προβάλει εκ νέου στο επόμενο (μικρότερο) χρονικό βήμα χωρίς στοχαστικό όρο. Μια παράμετρος eta συνδυάζει τα δύο: eta=1 ανακτά DDPM, eta=0 δίνει πλήρως ντετερμινιστικό DDIM.
Στρατηγικός αντίκτυπος
Ταχύτητα και κλίμακα
Το Visual AI μπορεί να αυτοματοποιήσει εργασίες επιθεώρησης, ανίχνευσης και επισήμανσης σε κλίμακα.
Δημιουργήστε επιλογές
Οι δημιουργικές ομάδες μπορούν να δημιουργήσουν πρωτότυπες ιδέες γρηγορότερα με λιγότερες μη αυτόματες αναθεωρήσεις.
Ομάδα και ροή εργασίας
Οι λειτουργίες μπορούν να χρησιμοποιούν σήματα εικόνας και βίντεο που προηγουμένως ήταν δύσκολο να επεξεργαστούν.
Το μέλλον των δειγματοληπτών DDPM και DDIM
Η έρευνα δειγματοληψίας κινείται προς τη γενιά ενός ή λίγων βημάτων. Οι επιλύτες ODE υψηλότερης τάξης όπως το DPM-Solver και το DPM-Solver++ έχουν ήδη περιορίσει τη δειγματοληψία ποιότητας σε λιγότερο από 20 βήματα, ενώ οι μέθοδοι απόσταξης (προοδευτική απόσταξη, μοντέλα συνέπειας, λανθάνουσα συνέπεια) συμπιέζουν τα μοντέλα σε γεννήτριες 1-4 βημάτων. Αναμένετε ότι το DDPM/DDIM θα παραμείνει εννοιολογικές βασικές γραμμές, ενώ τα συστήματα παραγωγής βασίζονται σε αποσταγμένους και προσαρμοστικούς επιλύτες για σύνθεση εικόνας και βίντεο σε πραγματικό χρόνο σε καταναλωτικό υλικό.
Υλοποίηση σε πραγματικό κόσμο
Δημιουργία εικόνων Stable Diffusion, όπου το DDIM προσφέρεται ως γρήγορος προεπιλεγμένος δειγματολήπτης για μηνύματα κειμένου σε εικόνα σε εργαλεία όπως το Automatic1111 και το ComfyUI.
Αναπαραγώγιμες αγωγές τέχνης που διορθώνουν τον τυχαίο σπόρο με ντετερμινιστικό DDIM, έτσι ώστε η ίδια προτροπή και η ίδια προτροπή να αναγεννούν πάντα την ίδια εικόνα.
Ομαλή παρεμβολή λανθάνοντος χώρου μεταξύ δύο εικόνων για μορφοποίηση κινούμενων εικόνων, που έγινε δυνατή από την ντετερμινιστική χαρτογράφηση του DDIM από το θόρυβο στην έξοδο.
Γρήγορη επανάληψη δημιουργικού όπου οι σχεδιαστές χρησιμοποιούν προεπισκοπήσεις DDIM 20 βημάτων για να εξερευνήσουν έννοιες προτού δεσμευτούν σε μια πιο αργή, υψηλότερης πιστότητας πλήρη απόδοση.
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Τα δικαιώματα εικόνας και η συναίνεση μπορεί να αποτελέσουν νομικούς κινδύνους εάν η προέλευση είναι ασαφής.
Η απόδοση του μοντέλου μπορεί να διαφέρει ανάλογα με το φωτισμό, τα δημογραφικά στοιχεία και τα περιβάλλοντα.
Τα ψευδώς θετικά μπορεί να περάσουν απαρατήρητα εκτός εάν παρακολουθούνται τα όρια εμπιστοσύνης.
Οδικός Χάρτης Εφαρμογής
Καθορίστε κριτήρια αποδοχής για το κόστος ακρίβειας, ανάκλησης και σφάλματος.
Δοκιμή με δεδομένα που ταιριάζουν με πραγματικές συνθήκες παραγωγής.
Προσθέστε ανθρώπινη κριτική για προβλέψεις χαμηλής εμπιστοσύνης ή υψηλού αντίκτυπου.
Παρακολουθήστε τη μετατόπιση του μοντέλου και επικυρώστε εκ νέου μετά από αλλαγές κάμερας ή δεδομένων.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DDPM and DDIM Samplers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Fréchet Inception Distance
Συχνές ερωτήσεις
What is DDPM and DDIM Samplers?
Το DDPM και το DDIM είναι δύο τρόποι εκτέλεσης της αντίστροφης διαδικασίας ενός μοντέλου διάχυσης, μετατρέποντας τον τυχαίο θόρυβο σε εικόνα βήμα προς βήμα. Το DDPM είναι η αρχική στοχαστική συνταγή. Το DDIM είναι μια ταχύτερη, ντετερμινιστική συντόμευση που παράγει συγκρίσιμες εικόνες σε πολύ λιγότερα βήματα.
Ποιο είναι το κύριο πρακτικό πλεονέκτημα του DDIM έναντι του DDPM;
Το DDIM ακολουθεί μια ντετερμινιστική, μη-μαρκοβιανή τροχιά που του επιτρέπει να παρακάμπτει πολλά χρονικά βήματα, δημιουργώντας εικόνες ποιότητας σε περίπου 10-50 βήματα αντί για εκατοντάδες.
Τι μαθαίνει πραγματικά να προβλέπει το νευρωνικό δίκτυο ενός μοντέλου διάχυσης κατά τη διάρκεια της εκπαίδευσης;
Το δίκτυο εκπαιδεύεται να προβλέπει τον Gaussian θόρυβο (έψιλον) που προστίθεται σε κάθε χρονικό βήμα, τον οποίο τόσο το DDPM όσο και το DDIM χρησιμοποιούν στη συνέχεια για να αντιστρέψουν τη διαδικασία.
Γιατί μπορεί το DDIM να παράγει την ίδια ακριβώς εικόνα από τον ίδιο θόρυβο εκκίνησης κάθε φορά;
Το DDIM απορρίπτει τον όρο στοχαστικού θορύβου στην ενημέρωσή του, καθιστώντας τη διαδρομή από το θόρυβο στην εικόνα πλήρως ντετερμινιστική και επομένως αναπαραγώγιμη.
Στο DDIM, ποια τιμή της παραμέτρου eta ανακτά την αρχική στοχαστική συμπεριφορά DDPM;
Η παράμετρος eta παρεμβάλλεται μεταξύ των δύο δειγματοληπτών: η eta=1 δίνει πλήρη στοχαστικότητα DDPM, ενώ η eta=0 δίνει πλήρως ντετερμινιστική DDIM.
Πόσα περίπου βήματα χρειαζόταν συνήθως το αρχικό DDPM για δείγματα υψηλής ποιότητας;
Το DDPM ανατρέχει σε κάθε επίπεδο θορύβου προσθέτοντας τυχαιότητα, επομένως απαιτείται συνήθως από εκατοντάδες έως χίλια αντίστροφα βήματα.