ΟΔΗΓΟΣ οπτικού AI

Zero-1-to-3 Novel View Diffusion

Το Zero-1-to-3 μετατρέπει μια φωτογραφία ενός αντικειμένου σε εικόνες του ίδιου αντικειμένου που φαίνονται από οποιαδήποτε νέα γωνία, χρησιμοποιώντας ένα μοντέλο διάχυσης που εξαρτάται από την περιστροφή της κάμερας που ζητάτε.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

It matters because it lets you reconstruct 3D-consistent views without ever scanning the object from multiple sides.

Βαθιά κατάδυση

Το Zero-1-to-3 (από την Columbia, 2023) ρυθμίζει με ακρίβεια το Stable Diffusion, ώστε να μπορεί να εκτελέσει σύνθεση πρωτότυπης προβολής μηδενικής λήψης από μία εικόνα εισόδου. Το τροφοδοτείτε με μια μεμονωμένη εικόνα συν έναν σχετικό μετασχηματισμό κάμερας (μια περιστροφή και μια μικρή μετάφραση) και το μοντέλο δημιουργεί πώς θα έμοιαζε το αντικείμενο από αυτή τη νέα οπτική γωνία. Η βασική ιδέα είναι ότι τα μεγάλα μοντέλα 2D διάχυσης, εκπαιδευμένα σε τεράστιες συλλογές εικόνων ιστού, έχουν απορροφήσει έμμεσα γεωμετρικές και φυσικές προτεραιότητες σχετικά με το πώς φαίνονται τα αντικείμενα σε 3D. Με τη λεπτομέρεια σε ένα συνθετικό σύνολο δεδομένων αντικειμένων που αποδίδονται από πολλές ελεγχόμενες γωνίες κάμερας (χρησιμοποιώντας το Objaverse), το μοντέλο μαθαίνει να χαρτογραφεί αυτές τις προτεραιότητες σε ρητό έλεγχο κάμερας. Οι προβολές που δημιουργούνται μπορούν στη συνέχεια να τροφοδοτήσουν την ανακατασκευή 3D.

Τεχνική διορατικότητα

Το μοντέλο προϋποθέτει την εικόνα προέλευσης με δύο τρόπους: μια ενσωμάτωση CLIP συνδέεται με τη σχετική στάση της κάμερας (αζιμούθιο, υψόμετρο, ακτίνα) για να κατευθύνει τη διασταυρούμενη προσοχή, ενώ η ακατέργαστη εικόνα συνδέεται με κανάλια με το θορυβώδες λανθάνον, ώστε να διατηρούνται οι λεπτές λεπτομέρειες και η ταυτότητα. Η εκπαίδευση χρησιμοποιεί τρίδυμα εικόνας-πόσης-εικόνας που αποδίδονται από αντικείμενα CAD, έτσι το δίκτυο μαθαίνει την ελεγχόμενη αντιστοίχιση μεταξύ μιας αλλαγής οπτικής γωνίας και της προκύπτουσας αλλαγής pixel.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Το Visual AI μπορεί να αυτοματοποιήσει εργασίες επιθεώρησης, ανίχνευσης και επισήμανσης σε κλίμακα.

Δημιουργήστε επιλογές

Οι δημιουργικές ομάδες μπορούν να δημιουργήσουν πρωτότυπες ιδέες γρηγορότερα με λιγότερες μη αυτόματες αναθεωρήσεις.

Ομάδα και ροή εργασίας

Οι λειτουργίες μπορούν να χρησιμοποιούν σήματα εικόνας και βίντεο που προηγουμένως ήταν δύσκολο να επεξεργαστούν.

The Future of Zero-1-to-3 Novel View Diffusion

Το Zero-1-to-3 δημιούργησε ένα κύμα αγωγών από εικόνα σε 3D. Διάδοχοι όπως το Zero123-XL, το SyncDreamer και το One-2-3-45 ωθούν προς τη συνέπεια πολλαπλών προβολών και την ταχύτερη, πιο αξιόπιστη έξοδο 3D mesh, ενώ η ενσωμάτωση με τα μοντέλα Gaussian Splatting και μεγάλης ανακατασκευής συρρικνώνει τον χρόνο παραγωγής από λεπτά σε δευτερόλεπτα. Αναμένετε αυστηρότερη συνέπεια προβολής, υψηλότερη ανάλυση και γενίκευση του πραγματικού κόσμου (όχι μόνο συνθετικού αντικειμένου), καθώς αυτά τα ελεγχόμενα από άποψη μοντέλα διάχυσης ωριμάζουν σε τυπικά εργαλεία για τη δημιουργία περιεχομένου.

Υλοποίηση σε πραγματικό κόσμο

Δημιουργία προβολών πικάπ μιας μεμονωμένης φωτογραφίας προϊόντος, ώστε μια λίστα ηλεκτρονικού εμπορίου να μπορεί να εμφανίζει το αντικείμενο από όλες τις πλευρές

Εκκίνηση ενός τρισδιάστατου πλέγματος με υφή ενός αντικειμένου από ένα απλό στιγμιότυπο τηλεφώνου για προεπισκοπήσεις AR

Δημιουργία συνεπούς τέχνης αναφοράς πολλαπλών γωνιών ενός χαρακτήρα ή στηρίγματος για καλλιτέχνες παιχνιδιών και φιλμ

Τροφοδοσία συνθετικών καινοτόμων προβολών σε ανακατασκευή NeRF ή Gaussian Splatting για συμπλήρωση αόρατης γεωμετρίας

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα δικαιώματα εικόνας και η συναίνεση μπορεί να αποτελέσουν νομικούς κινδύνους εάν η προέλευση είναι ασαφής.

Η απόδοση του μοντέλου μπορεί να διαφέρει ανάλογα με το φωτισμό, τα δημογραφικά στοιχεία και τα περιβάλλοντα.

Τα ψευδώς θετικά μπορεί να περάσουν απαρατήρητα εκτός εάν παρακολουθούνται τα όρια εμπιστοσύνης.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε κριτήρια αποδοχής για το κόστος ακρίβειας, ανάκλησης και σφάλματος.

2

Δοκιμή με δεδομένα που ταιριάζουν με πραγματικές συνθήκες παραγωγής.

3

Προσθέστε ανθρώπινη κριτική για προβλέψεις χαμηλής εμπιστοσύνης ή υψηλού αντίκτυπου.

4

Παρακολουθήστε τη μετατόπιση του μοντέλου και επικυρώστε εκ νέου μετά από αλλαγές κάμερας ή δεδομένων.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Zero-1-to-3 Novel View Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Σύνθεση όψης μυθιστορήματος

Συχνές ερωτήσεις

What is Zero-1-to-3 Novel View Diffusion?

Το Zero-1-to-3 μετατρέπει μια φωτογραφία ενός αντικειμένου σε εικόνες του ίδιου αντικειμένου που φαίνονται από οποιαδήποτε νέα γωνία, χρησιμοποιώντας ένα μοντέλο διάχυσης που εξαρτάται από την περιστροφή της κάμερας που ζητάτε. Έχει σημασία γιατί σας επιτρέπει να ανακατασκευάσετε τρισδιάστατες συνεπείς προβολές χωρίς ποτέ να σαρώσετε το αντικείμενο από πολλές πλευρές.

Τι χρειάζεται η βασική είσοδος Zero-1-to-3 εκτός από μια μεμονωμένη εικόνα για τη δημιουργία μιας νέας προβολής;

Το Zero-1-to-3 εξαρτάται από μια μεμονωμένη εικόνα συν μια σχετική στάση κάμερας, επομένως καθορίζετε την περιστροφή και τη μετάφραση στην επιθυμητή οπτική γωνία.

Το Zero-1-to-3 κατασκευάζεται με τη λεπτομέρεια ποιου είδους μοντέλου;

Ρυθμίζει με ακρίβεια ένα μεγάλο προεκπαιδευμένο μοντέλο 2D διάχυσης, ώστε να μπορεί να εκμεταλλευτεί τις γεωμετρικές προτεραιότητες που έμαθαν σιωπηρά αυτά τα μοντέλα από εικόνες Ιστού.

Γιατί μπορεί ένα μοντέλο δισδιάστατης διάχυσης να εκτελέσει καθόλου σύνθεση μηδενικής όψης;

Η μεγάλης κλίμακας 2D εκπαίδευση μεταδίδει έμμεση γνώση του τρόπου εμφάνισης των αντικειμένων σε 3D, την οποία η τελειοποίηση καθιστά ελεγχόμενη μέσω της στάσης της κάμερας.

Ποιο σύνολο δεδομένων τρισδιάστατων αντικειμένων ήταν κεντρικό στην εκπαίδευση Zero-1-to-3;

Εκπαιδεύτηκε σε τρίδυμα εικόνας-πόζας-εικόνας που αποδόθηκε από μεγάλες συλλογές συνθετικών τρισδιάστατων αντικειμένων όπως το Objaverse.

Πώς διατηρείται η λεπτομέρεια της εικόνας πηγής στη γενιά;

Η ακατέργαστη εικόνα συνδέεται με κανάλια με το θορυβώδες λανθάνον (μαζί με μια ενσωμάτωση CLIP για τη σημασιολογία), έτσι ώστε η ταυτότητα και η λεπτομέρεια να διατηρούνται.