Δειγματοληψία απόσταξης DreamFusion και Score
Το DreamFusion δημιουργεί τρισδιάστατα αντικείμενα από κείμενο χρησιμοποιώντας ένα μοντέλο διάχυσης εικόνας 2D ως κριτικό, χωρίς ποτέ να εκπαιδεύεται σε τρισδιάστατα δεδομένα.
Επισκόπηση
Its core invention, Score Distillation Sampling, became the foundational recipe for the entire text-to-3D field.
Βαθιά κατάδυση
Το DreamFusion, από Google το 2022, ρώτησε: μπορεί ένα δισδιάστατο μοντέλο κειμένου σε εικόνα να διδάξει σε μια τρισδιάστατη σκηνή να φαίνεται σωστά από κάθε γωνία; Βελτιστοποιεί ένα NeRF (Neural Radiance Field) έτσι ώστε οι αποδόσεις από τυχαίες οπτικές γωνίες της κάμερας, όταν παρουσιάζονται θόρυβος και εμφανίζονται σε ένα μοντέλο παγωμένης διάχυσης (Imagen), να βαθμολογούνται ως εύλογες εικόνες για το μήνυμα κειμένου. Κυρίως δεν χρησιμοποιεί τρισδιάστατα δεδομένα εκπαίδευσης. Η σημαντική ανακάλυψη είναι η δειγματοληψία απόσταξης βαθμολογίας (SDS): αντί να διαδίδεται πίσω μέσω του ακριβού U-Net του μοντέλου διάχυσης, το SDS χρησιμοποιεί τον προβλεπόμενο θόρυβο του μοντέλου ως σήμα βαθμίδας απευθείας στα εικονοστοιχεία που έχουν αποδοθεί. Η επανάληψη αυτού σε χιλιάδες οπτικές γωνίες σμιλεύει ένα συνεκτικό τρισδιάστατο στοιχείο, πλήρες με γεωμετρία και εμφάνιση που εξαρτάται από την προβολή, από μία μόνο πρόταση.
Τεχνική διορατικότητα
Το SDS αντιμετωπίζει το μοντέλο διάχυσης ως συνάρτηση παγωμένης βαθμολόγησης. Αποδίδει το NeRF, προσθέτει θόρυβο, ζητά από το U-Net διάχυσης να προβλέψει αυτόν τον θόρυβο και υπολογίζει τη διαβάθμιση όπως (προβλεπόμενος θόρυβος μείον τον προστιθέμενο θόρυβο) ωθηθεί πίσω στην εικόνα που αποδίδεται και επομένως τα βάρη NeRF. Η παράλειψη του U-Net Jacobian το καθιστά εφικτό. Απαιτείται υψηλή καθοδήγηση χωρίς ταξινομητή (περίπου 100) για ευκρινή αποτελέσματα, γεγονός που προκαλεί τη χαρακτηριστική υπερκορεσμένη, μερικές φορές θολή εμφάνιση «DreamFusion».
Στρατηγικός αντίκτυπος
Ταχύτητα και κλίμακα
Το Visual AI μπορεί να αυτοματοποιήσει εργασίες επιθεώρησης, ανίχνευσης και επισήμανσης σε κλίμακα.
Δημιουργήστε επιλογές
Οι δημιουργικές ομάδες μπορούν να δημιουργήσουν πρωτότυπες ιδέες γρηγορότερα με λιγότερες μη αυτόματες αναθεωρήσεις.
Ομάδα και ροή εργασίας
Οι λειτουργίες μπορούν να χρησιμοποιούν σήματα εικόνας και βίντεο που προηγουμένως ήταν δύσκολο να επεξεργαστούν.
The Future of DreamFusion και Score Distillation Sampling
Το SDS δημιούργησε μια πλούσια σειρά εργασιών για να διορθώσει τις αδυναμίες του: Magic3D για ανάλυση και ταχύτητα, Απόσταξη μεταβλητής βαθμολογίας του ProlificDreamer για πιο ευκρινείς, πιο ποικίλες εκροές και μεθόδους που επιτίθενται στο τεχνούργημα πολλαπλών προσώπων «Janus». Το πεδίο συνδυάζει όλο και περισσότερο το SDS με προτεραιότητες διάχυσης πολλαπλών προβολών και γρήγορες τρισδιάστατες αναπαραστάσεις όπως το Gaussian Splatting. Αναμένετε ότι η μετατροπή κειμένου σε 3D θα γίνει πιο γρήγορα και πιο πιστή γεωμετρικά, μειώνοντας το χάσμα με στοιχεία που έχουν σχεδιαστεί με το χέρι.
Υλοποίηση σε πραγματικό κόσμο
Δημιουργία ενός τρισδιάστατου μοντέλου «μιας φωτογραφίας DSLR ενός σκίουρου που φοράει ένα μικροσκοπικό καπέλο» μόνο από κείμενο
Δημιουργία πρόχειρων στοιχείων παιχνιδιού και AR χωρίς χειροκίνητη τρισδιάστατη γλυπτική
Παραγωγή εξαγώγιμων ματιών που οι καλλιτέχνες τελειοποιούν αντί να χτίζουν από την αρχή
Ερευνητικές γραμμές βάσης για την αξιολόγηση νεότερων μεθόδων μετατροπής κειμένου σε 3D έναντι του SDS
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Τα δικαιώματα εικόνας και η συναίνεση μπορεί να αποτελέσουν νομικούς κινδύνους εάν η προέλευση είναι ασαφής.
Η απόδοση του μοντέλου μπορεί να διαφέρει ανάλογα με το φωτισμό, τα δημογραφικά στοιχεία και τα περιβάλλοντα.
Τα ψευδώς θετικά μπορεί να περάσουν απαρατήρητα εκτός εάν παρακολουθούνται τα όρια εμπιστοσύνης.
Οδικός Χάρτης Εφαρμογής
Καθορίστε κριτήρια αποδοχής για το κόστος ακρίβειας, ανάκλησης και σφάλματος.
Δοκιμή με δεδομένα που ταιριάζουν με πραγματικές συνθήκες παραγωγής.
Προσθέστε ανθρώπινη κριτική για προβλέψεις χαμηλής εμπιστοσύνης ή υψηλού αντίκτυπου.
Παρακολουθήστε τη μετατόπιση του μοντέλου και επικυρώστε εκ νέου μετά από αλλαγές κάμερας ή δεδομένων.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DreamFusion and Score Distillation Sampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Παραγωγικά μοντέλα με βάση τη βαθμολογία
Συχνές ερωτήσεις
What is DreamFusion and Score Distillation Sampling?
Το DreamFusion δημιουργεί τρισδιάστατα αντικείμενα από κείμενο χρησιμοποιώντας ένα μοντέλο διάχυσης εικόνας 2D ως κριτικό, χωρίς ποτέ να εκπαιδεύεται σε τρισδιάστατα δεδομένα. Η βασική του εφεύρεση, Score Distillation Sampling, έγινε η θεμελιώδης συνταγή για ολόκληρο το πεδίο text-to-3D.
Ποια τρισδιάστατη αναπαράσταση βελτιστοποιεί το DreamFusion;
Το DreamFusion βελτιστοποιεί ένα NeRF, έτσι ώστε οι αποδιδόμενες προβολές του να ικανοποιούν την κρίση ενός μοντέλου διάχυσης 2D για το μήνυμα κειμένου.
Πόσα δεδομένα εκπαίδευσης 3D απαιτεί το DreamFusion;
Το DreamFusion χρησιμοποιεί ένα παγωμένο δισδιάστατο μοντέλο διάχυσης κειμένου σε εικόνα ως μοναδική επίβλεψή του, που δεν απαιτεί δεδομένα εκπαίδευσης 3D.
Ποια είναι η βασική υπολογιστική συντόμευση στο Score Distillation Sampling;
Το SDS χρησιμοποιεί τον προβλεπόμενο μείον προστιθέμενο θόρυβο ως άμεση κλίση στα εικονοστοιχεία που έχουν αποδοθεί, αποφεύγοντας το δαπανηρό U-Net Jacobian.
Γιατί το DreamFusion χρησιμοποιεί πολύ υψηλή καθοδήγηση χωρίς ταξινομητή (~100);
Η κλίση του SDS είναι θορυβώδης και αδύναμη, επομένως απαιτείται ασυνήθιστα υψηλή καθοδήγηση για ευκρινή γεωμετρία, αν και προκαλεί υπερβολικό κορεσμό.
Ποιο μοντέλο 2D χρησιμοποιούσε το αρχικό DreamFusion ως παγωμένο παλιό του;
Το DreamFusion χτίστηκε στο μοντέλο διάχυσης κειμένου σε εικόνα του Google ως η συνάρτηση παγωμένης βαθμολόγησης.