CogVidéo et CogVidéoX
CogVideo (2022) a été le premier modèle texte-vidéo ouvert à grande échelle, et CogVideoX (2024) est son successeur open source bien plus performant de Tsinghua/Zhipu AI.
Aperçu
They matter because they put high-quality video generation into the hands of the open community, not just big corporate labs.
Plongée profonde
CogVideo, sorti en 2022, s'est appuyé sur le transformateur texte-image CogView2 et a utilisé une approche autorégressive à fréquence d'images multiples pour générer de courts clips, devenant ainsi le premier grand modèle texte-vidéo publié ouvertement et prenant en charge les invites en chinois et en anglais. Son successeur de 2024, CogVideoX, est une refonte complète : il utilise un auto-encodeur causal variationnel 3D pour compresser la vidéo à la fois dans l'espace et dans le temps, puis un Expert Transformer avec un objectif de diffusion qui s'occupe conjointement des jetons texte et vidéo fusionnés. Les modèles CogVideoX (dans des tailles telles que les paramètres 2B et 5B) génèrent plusieurs secondes de vidéo cohérente et animée à des résolutions telles que 720 x 480 et prennent en charge la conversion image-vidéo et la continuation vidéo. Fondamentalement, les poids et le code sont publics, alimentant une vague de réglages, d’outils et de recherches communautaires.
Aperçu technique
Le VAE causal 3D de CogVideoX réduit la vidéo brute en un volume latent compact, réduisant ainsi le nombre de jetons afin qu'un transformateur puisse modéliser de longues séquences à un prix abordable. Un transformateur expert applique la norme de couche adaptative et concatène le texte et les jetons visuels afin que les deux modalités s'occupent directement l'une de l'autre, améliorant ainsi l'alignement texte-vidéo. Un entraînement progressif sur des résolutions et des durées croissantes, ainsi qu'un sous-titrage minutieux des données, permettent d'obtenir des mouvements plus fluides et plus fidèles sémantiquement.
Impact stratégique
Vitesse et échelle
L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.
Choix de construction
Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.
Équipe et flux de travail
Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.
L'avenir de CogVideo et CogVideoX
En tant que l'un des modèles vidéo ouverts les plus puissants, CogVideoX ancre un écosystème à croissance rapide de réglages fins, d'adaptateurs de contrôle et d'extensions de plus longue durée. Attendez-vous à des gains continus en termes de longueur de clip, de résolution, de réalisme de mouvement et de contrôlabilité, ainsi qu'à une intégration plus étroite avec les flux de travail de conversion d'image en vidéo et d'édition. Sa pondération ouverte signifie que les organisations à but non lucratif, les chercheurs et les petits studios peuvent s'appuyer sur une génération vidéo de classe frontière sans contrôle propriétaire, accélérant ainsi les expérimentations créatives et axées sur la sécurité.
Mise en œuvre dans le monde réel
Générer un court clip narratif à partir d'une invite en chinois ou en anglais en utilisant des pondérations entièrement ouvertes
Transformer une seule image fixe téléchargée en une vidéo animée via l'image en vidéo CogVideoX
Affiner le modèle ouvert sur un style ou un personnage personnalisé pour l'animation indépendante
Des chercheurs comparent de nouvelles méthodes de génération vidéo à une base de référence ouverte et reproductible
Risques et garde-fous
Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.
Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.
Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.
Feuille de route de mise en œuvre
Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.
Testez avec des données qui correspondent aux conditions de production réelles.
Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.
Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the CogVideo and CogVideoX quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Édition des instructions InstructPix2Pix
Questions fréquemment posées
What is CogVideo and CogVideoX?
CogVideo (2022) a été le premier modèle texte-vidéo ouvert à grande échelle, et CogVideoX (2024) est son successeur open source bien plus performant de Tsinghua/Zhipu AI. Ils sont importants car ils mettent la génération vidéo de haute qualité entre les mains de la communauté ouverte, et pas seulement des grands laboratoires d'entreprise.
Qu'est-ce qui est remarquable dans la version 2022 de CogVideo ?
CogVideo a été le premier modèle texte-vidéo à grande échelle publié ouvertement, prenant en charge les invites en chinois et en anglais.
Qu'accomplit la VAE causale 3D de CogVideoX ?
Le VAE causal 3D compresse la vidéo dans les dimensions spatiales et temporelles, réduisant ainsi le nombre de jetons afin qu'un transformateur puisse la modéliser efficacement.
Comment l'Expert Transformer dans CogVideoX gère-t-il le texte et la vidéo ?
L'Expert Transformer fusionne les jetons textuels et visuels avec une normalisation adaptative, améliorant ainsi l'alignement entre l'invite et la vidéo générée.
Quel groupe a développé CogVideo et CogVideoX ?
La famille CogVideo est issue de chercheurs associés à l'Université Tsinghua et à Zhipu AI.
Outre la conversion texte-vidéo, quelle fonctionnalité supplémentaire CogVideoX prend-il en charge ?
CogVideoX peut animer une image fixe (image vers vidéo) et étendre les clips existants (suite), au-delà des invites en texte brut.