CogVideo και CogVideoX
Το CogVideo (2022) ήταν το πρώτο ανοιχτό μοντέλο ανοιχτού κειμένου σε βίντεο μεγάλης κλίμακας και το CogVideoX (2024) είναι ο πολύ πιο ικανός διάδοχός του ανοιχτού κώδικα από το Tsinghua/Zhipu AI.
Επισκόπηση
They matter because they put high-quality video generation into the hands of the open community, not just big corporate labs.
Βαθιά κατάδυση
Το CogVideo, που κυκλοφόρησε το 2022, βασίστηκε στον μετασχηματιστή κειμένου σε εικόνα CogView2 και χρησιμοποίησε μια προσέγγιση πολλαπλών καρέ, αυτόματη παλινδρόμηση για τη δημιουργία σύντομων κλιπ, αποτελώντας το πρώτο ανοιχτά μεγάλο μοντέλο κειμένου σε βίντεο που κυκλοφόρησε και υποστηρίζει κινέζικα και αγγλικά μηνύματα. Ο διάδοχός του για το 2024, το CogVideoX, είναι ένας πλήρης επανασχεδιασμός: χρησιμοποιεί έναν τρισδιάστατο αυτόματο κωδικοποιητή αιτιώδους παραλλαγής για τη συμπίεση βίντεο τόσο στον χώρο όσο και στον χρόνο, και στη συνέχεια έναν Expert Transformer με στόχο διάχυσης που παρακολουθεί από κοινού τα διακριτικά κειμένου και βίντεο που συγχωνεύονται. Τα μοντέλα CogVideoX (σε μεγέθη όπως παραμέτρους 2B και 5B) δημιουργούν αρκετά δευτερόλεπτα συνεκτικού βίντεο υψηλής κίνησης σε αναλύσεις όπως 720x480 και υποστηρίζουν τη συνέχιση εικόνας σε βίντεο και βίντεο. Το σημαντικότερο είναι ότι τα βάρη και ο κώδικας είναι δημόσιοι, τροφοδοτώντας ένα κύμα βελτιστοποιήσεων, εργαλείων και έρευνας της κοινότητας.
Τεχνική διορατικότητα
Το 3D αιτιώδες VAE του CogVideoX συρρικνώνει το ακατέργαστο βίντεο σε έναν συμπαγή λανθάνοντα όγκο, μειώνοντας τον αριθμό των διακριτικών, ώστε ένας μετασχηματιστής να μπορεί να μοντελοποιήσει μεγάλες ακολουθίες οικονομικά. Ένας ειδικός μετασχηματιστής εφαρμόζει κανόνα προσαρμοστικού επιπέδου και συνενώνει κείμενο και οπτικά διακριτικά, έτσι ώστε οι δύο τρόποι να αλληλοεπιδρούν άμεσα, βελτιώνοντας την ευθυγράμμιση κειμένου-βίντεο. Η προοδευτική εκπαίδευση σε αυξανόμενες αναλύσεις και διάρκειες, καθώς και προσεκτική υποτίτλων δεδομένων, αποδίδει πιο ομαλή, πιο σημασιολογικά πιστή κίνηση.
Στρατηγικός αντίκτυπος
Ταχύτητα και κλίμακα
Το Visual AI μπορεί να αυτοματοποιήσει εργασίες επιθεώρησης, ανίχνευσης και επισήμανσης σε κλίμακα.
Δημιουργήστε επιλογές
Οι δημιουργικές ομάδες μπορούν να δημιουργήσουν πρωτότυπες ιδέες γρηγορότερα με λιγότερες μη αυτόματες αναθεωρήσεις.
Ομάδα και ροή εργασίας
Οι λειτουργίες μπορούν να χρησιμοποιούν σήματα εικόνας και βίντεο που προηγουμένως ήταν δύσκολο να επεξεργαστούν.
Το μέλλον των CogVideo και CogVideoX
Ως ένα από τα ισχυρότερα μοντέλα ανοιχτού βίντεο, το CogVideoX αγκυροβολεί ένα ταχέως αναπτυσσόμενο οικοσύστημα λεπτομέρειας, προσαρμογέων ελέγχου και επεκτάσεων μεγαλύτερης διάρκειας. Αναμένετε συνεχή κέρδη σε μήκος κλιπ, ανάλυση, ρεαλισμό κίνησης και δυνατότητα ελέγχου, καθώς και στενότερη ενσωμάτωση με ροές εργασίας εικόνας σε βίντεο και επεξεργασίας. Τα ανοιχτά του βάρη σημαίνουν ότι οι μη κερδοσκοπικοί οργανισμοί, οι ερευνητές και τα μικρά στούντιο μπορούν να αξιοποιήσουν τη δημιουργία βίντεο αιχμής χωρίς αποκλειστική φύλαξη, επιταχύνοντας τόσο δημιουργικό όσο και εστιασμένο στην ασφάλεια πειραματισμό.
Υλοποίηση σε πραγματικό κόσμο
Δημιουργία σύντομου κλιπ αφήγησης από κινεζική ή αγγλική προτροπή χρησιμοποιώντας πλήρως ανοιχτά βάρη
Μετατροπή μιας μόνο μεταφορτωμένης ακίνητης εικόνας σε κινούμενο βίντεο μέσω εικόνας σε βίντεο CogVideoX
Βελτιώστε το ανοιχτό μοντέλο σε προσαρμοσμένο στυλ ή χαρακτήρα για indie animation
Ερευνητές συγκρίνουν νέες μεθόδους παραγωγής βίντεο σε σχέση με μια αναπαραγώγιμη ανοιχτή γραμμή βάσης
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Τα δικαιώματα εικόνας και η συναίνεση μπορεί να αποτελέσουν νομικούς κινδύνους εάν η προέλευση είναι ασαφής.
Η απόδοση του μοντέλου μπορεί να διαφέρει ανάλογα με το φωτισμό, τα δημογραφικά στοιχεία και τα περιβάλλοντα.
Τα ψευδώς θετικά μπορεί να περάσουν απαρατήρητα εκτός εάν παρακολουθούνται τα όρια εμπιστοσύνης.
Οδικός Χάρτης Εφαρμογής
Καθορίστε κριτήρια αποδοχής για το κόστος ακρίβειας, ανάκλησης και σφάλματος.
Δοκιμή με δεδομένα που ταιριάζουν με πραγματικές συνθήκες παραγωγής.
Προσθέστε ανθρώπινη κριτική για προβλέψεις χαμηλής εμπιστοσύνης ή υψηλού αντίκτυπου.
Παρακολουθήστε τη μετατόπιση του μοντέλου και επικυρώστε εκ νέου μετά από αλλαγές κάμερας ή δεδομένων.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the CogVideo and CogVideoX quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
InstructPix2Pix Επεξεργασία Οδηγιών
Συχνές ερωτήσεις
What is CogVideo and CogVideoX?
Το CogVideo (2022) ήταν το πρώτο ανοιχτό μοντέλο ανοιχτού κειμένου σε βίντεο μεγάλης κλίμακας και το CogVideoX (2024) είναι ο πολύ πιο ικανός διάδοχός του ανοιχτού κώδικα από το Tsinghua/Zhipu AI. Έχουν σημασία γιατί δίνουν τη δημιουργία βίντεο υψηλής ποιότητας στα χέρια της ανοιχτής κοινότητας, όχι μόνο των μεγάλων εταιρικών εργαστηρίων.
Τι είναι αξιοσημείωτο για την κυκλοφορία του CogVideo το 2022;
Το CogVideo ήταν το πρώτο μεγάλης κλίμακας μοντέλο κειμένου σε βίντεο που κυκλοφόρησε ανοιχτά, υποστηρίζοντας τόσο κινέζικα όσο και αγγλικά μηνύματα.
Τι επιτυγχάνει το 3D αιτιώδες VAE του CogVideoX;
Το 3D causal VAE συμπιέζει το βίντεο τόσο σε χωρικές όσο και σε χρονικές διαστάσεις, μειώνοντας τον αριθμό των διακριτικών, ώστε ένας μετασχηματιστής να μπορεί να το μοντελοποιήσει αποτελεσματικά.
Πώς χειρίζεται το κείμενο και το βίντεο το Expert Transformer στο CogVideoX;
Το Expert Transformer συνδυάζει κείμενο και οπτικά διακριτικά μαζί με προσαρμοστική κανονικοποίηση, βελτιώνοντας την ευθυγράμμιση μεταξύ του βίντεο προτροπής και του παραγόμενου βίντεο.
Ποια ομάδα ανέπτυξε τα CogVideo και CogVideoX;
Η οικογένεια CogVideo προέρχεται από ερευνητές που σχετίζονται με το Πανεπιστήμιο Tsinghua και το Zhipu AI.
Εκτός από το κείμενο σε βίντεο, ποια πρόσθετη δυνατότητα υποστηρίζει το CogVideoX;
Το CogVideoX μπορεί να κινήσει μια ακίνητη εικόνα (από εικόνα σε βίντεο) και να επεκτείνει τα υπάρχοντα κλιπ (συνέχεια), πέρα από τις προτροπές απλού κειμένου.