Μετασχηματιστές Διάχυσης
Οι μετασχηματιστές διάχυσης (DiTs) ανταλλάσσουν το συνελικτικό U-Net στην καρδιά των γεννητριών εικόνας και βίντεο με μια ραχοκοκαλιά Transformer.
Επισκόπηση
This architecture powers leading systems like Stable Diffusion 3 and OpenAI's Sora, and it scales remarkably well as you add compute.
Βαθιά κατάδυση
Τα μοντέλα διάχυσης παράγουν εικόνες ξεκινώντας από τον καθαρό θόρυβο και επαναλαμβανόμενους από το θόρυβο σε μια συνεκτική εικόνα. Για χρόνια το δίκτυο που έκανε αυτόν τον καθαρισμό θορύβου ήταν ένα U-Net, μια συνελικτική αρχιτεκτονική. Το Diffusion Transformer, που εισήχθη από τους Peebles και Xie το 2022, αντικαθιστά το U-Net με ένα Transformer. Η εικόνα αρχικά συμπιέζεται σε έναν λανθάνοντα χώρο, χωρίζεται σε μικρά μπαλώματα και κάθε έμπλαστρο γίνεται ένα διακριτικό, σαν λέξεις σε ένα γλωσσικό μοντέλο. Στη συνέχεια, ο μετασχηματιστής επεξεργάζεται αυτά τα διακριτικά με αυτοσυγκέντρωση σε κάθε βήμα απενεργοποίησης θορύβων. Ένα βασικό εύρημα ήταν ότι η απόδοση του DiT βελτιώνεται προβλέψιμα καθώς αυξάνετε το μέγεθος του μοντέλου και μειώνετε το μέγεθος της ενημέρωσης κώδικα, ακολουθώντας τους νόμους καθαρής κλίμακας. Αυτή η επεκτασιμότητα είναι ο λόγος για τον οποίο τα συστήματα κειμένου σε βίντεο και προηγμένων συστημάτων κειμένου σε εικόνα έχουν μετεγκατασταθεί σε μεγάλο βαθμό στους βασικούς άξονες του Transformer.
Τεχνική διορατικότητα
Μια βασική καινοτομία είναι ο τρόπος με τον οποίο τα DiTs εισάγουν ρυθμίσεις όπως το χρονικό βήμα και το μήνυμα κειμένου. Αντί για απλή συνένωση, χρησιμοποιούν προσαρμοστική κανονικοποίηση επιπέδου (adaLN), όπου το δίκτυο προβλέπει παραμέτρους κλίμακας και μετατόπισης για τα επίπεδα κανονικοποίησης από το σήμα κλιματισμού. Η παραλλαγή adaLN-zero τα αρχικοποιεί, ώστε κάθε μπλοκ να ξεκινά ως συνάρτηση ταυτότητας, σταθεροποιώντας την εκπαίδευση. Τα patches ισοπεδώνονται σε μάρκες, επεξεργάζονται με τυπικά μπλοκ Transformer με αυτοσυγκέντρωση, στη συνέχεια επανασυναρμολογούνται και αποκωδικοποιούνται ξανά σε pixel.
Στρατηγικός αντίκτυπος
Ταχύτητα και κλίμακα
Το Visual AI μπορεί να αυτοματοποιήσει εργασίες επιθεώρησης, ανίχνευσης και επισήμανσης σε κλίμακα.
Δημιουργήστε επιλογές
Οι δημιουργικές ομάδες μπορούν να δημιουργήσουν πρωτότυπες ιδέες γρηγορότερα με λιγότερες μη αυτόματες αναθεωρήσεις.
Ομάδα και ροή εργασίας
Οι λειτουργίες μπορούν να χρησιμοποιούν σήματα εικόνας και βίντεο που προηγουμένως ήταν δύσκολο να επεξεργαστούν.
The Future of Diffusion Transformers
Οι μετασχηματιστές διάχυσης γίνονται η προεπιλεγμένη ραχοκοκαλιά για τα μέσα παραγωγής. Ο σχεδιασμός τους που βασίζεται σε διακριτικά τα καθιστά φυσικά για την ενοποίηση εικόνων, βίντεο, ακόμη και πολλαπλών τρόπων παραγωγής κάτω από μια κλιμακούμενη αρχιτεκτονική. Η έρευνα ωθεί προς το μεγαλύτερο βίντεο, την υψηλότερη ανάλυση και την αποτελεσματικότερη προσοχή για να μετριαστεί το τετραγωνικό κόστος πολλών κουπονιών. Αναμένετε σύγκλιση μεταξύ μοντέλων γλώσσας και όρασης, όπου παρόμοιες συνταγές και υποδομή κλιμάκωσης Transformer εξυπηρετούν και τα δύο, επιταχύνοντας την πρόοδο στα παγκόσμια μοντέλα και το διαδραστικό βίντεο.
Υλοποίηση σε πραγματικό κόσμο
Το OpenAI του Sora χρησιμοποιεί μια ραχοκοκαλιά Transformer σε ενημερωμένες εκδόσεις χωροχρόνου για τη δημιουργία βίντεο διάρκειας λεπτών, υψηλής πιστότητας από μηνύματα προτροπής κειμένου.
Το Stable Diffusion 3 υιοθετεί έναν πολυτροπικό μετασχηματιστή διάχυσης (MMDiT) για την καλύτερη ευθυγράμμιση των παραγόμενων εικόνων με λεπτομερείς περιγραφές κειμένου.
Οι ερευνητές κλιμακώνουν ένα DiT σε δισεκατομμύρια παραμέτρους και παρατηρούν την ποιότητα της εικόνας να βελτιώνεται προβλέψιμα, καθοδηγώντας τις αποφάσεις υπολογισμού-προϋπολογισμού.
Ένα στούντιο χρησιμοποιεί ένα μοντέλο που βασίζεται σε DiT για να επεκτείνει σύντομα κλιπ, αντιμετωπίζοντας τα πρόσθετα καρέ βίντεο ως πρόσθετα κουπόνια ενημέρωσης κώδικα για αποθόρυβο.
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Τα δικαιώματα εικόνας και η συναίνεση μπορεί να αποτελέσουν νομικούς κινδύνους εάν η προέλευση είναι ασαφής.
Η απόδοση του μοντέλου μπορεί να διαφέρει ανάλογα με το φωτισμό, τα δημογραφικά στοιχεία και τα περιβάλλοντα.
Τα ψευδώς θετικά μπορεί να περάσουν απαρατήρητα εκτός εάν παρακολουθούνται τα όρια εμπιστοσύνης.
Οδικός Χάρτης Εφαρμογής
Καθορίστε κριτήρια αποδοχής για το κόστος ακρίβειας, ανάκλησης και σφάλματος.
Δοκιμή με δεδομένα που ταιριάζουν με πραγματικές συνθήκες παραγωγής.
Προσθέστε ανθρώπινη κριτική για προβλέψεις χαμηλής εμπιστοσύνης ή υψηλού αντίκτυπου.
Παρακολουθήστε τη μετατόπιση του μοντέλου και επικυρώστε εκ νέου μετά από αλλαγές κάμερας ή δεδομένων.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Δίκτυα Χωρικών Μετασχηματιστών
Συχνές ερωτήσεις
What is Diffusion Transformers?
Οι μετασχηματιστές διάχυσης (DiTs) ανταλλάσσουν το συνελικτικό U-Net στην καρδιά των γεννητριών εικόνας και βίντεο με μια ραχοκοκαλιά Transformer. Αυτή η αρχιτεκτονική τροφοδοτεί κορυφαία συστήματα όπως το Stable Diffusion 3 και το Sora του OpenAI, και κλιμακώνεται εξαιρετικά καλά καθώς προσθέτετε υπολογιστές.
Ποιο εξάρτημα αντικαθιστά ένας μετασχηματιστής διάχυσης σε σύγκριση με τα παραδοσιακά μοντέλα διάχυσης;
Τα DiTs αντικαθιστούν το U-Net, το συνελικτικό δίκτυο που εκτελούσε αποθορυβοποίηση, με μια ραχοκοκαλιά Transformer.
Πώς ένα DiT μετατρέπει μια εικόνα σε κάτι που μπορεί να επεξεργαστεί ένας Transformer;
Η λανθάνουσα εικόνα χωρίζεται σε μικρά μπαλώματα και κάθε έμπλαστρο γίνεται ένα σύμβολο, ανάλογο με τις λέξεις σε ένα γλωσσικό μοντέλο.
Τι βρήκε το αρχικό χαρτί DiT σχετικά με την κλιμάκωση;
Η ποιότητα του DiT βελτιώνεται με καθαρό, προβλέψιμο τρόπο καθώς αυξάνετε τον υπολογισμό του μοντέλου και χρησιμοποιείτε μικρότερες ενημερώσεις κώδικα, ακολουθώντας τους νόμους κλιμάκωσης.
Πώς συνήθως τα DiT εισάγουν ρυθμίσεις όπως το χρονικό βήμα και η προτροπή κειμένου;
Τα DiT χρησιμοποιούν προσαρμοστική κανονικοποίηση στρώματος για να προβλέψουν τις παραμέτρους κλίμακας και μετατόπισης για τα επίπεδα κανονικοποίησης από το σήμα κλιματισμού.
Τι επιτυγχάνει η προετοιμασία «adaLN-zero»;
Το adaLN-zero αρχικοποιεί τη διαμόρφωση, έτσι κάθε μπλοκ αρχικά λειτουργεί ως ταυτότητα, η οποία σταθεροποιεί και βελτιώνει την προπόνηση.