GUIDE DE L'IA Visuelle

CogVidéo et CogVidéoX

CogVideo (2022) a été le premier modèle texte-vidéo ouvert à grande échelle, et CogVideoX (2024) est son successeur open source bien plus performant de Tsinghua/Zhipu AI.

2 minutes de lectureDernière mise à jour

Aperçu

They matter because they put high-quality video generation into the hands of the open community, not just big corporate labs.

Plongée profonde

CogVideo, sorti en 2022, s'est appuyé sur le transformateur texte-image CogView2 et a utilisé une approche autorégressive à fréquence d'images multiples pour générer de courts clips, devenant ainsi le premier grand modèle texte-vidéo publié ouvertement et prenant en charge les invites en chinois et en anglais. Son successeur de 2024, CogVideoX, est une refonte complète : il utilise un auto-encodeur causal variationnel 3D pour compresser la vidéo à la fois dans l'espace et dans le temps, puis un Expert Transformer avec un objectif de diffusion qui s'occupe conjointement des jetons texte et vidéo fusionnés. Les modèles CogVideoX (dans des tailles telles que les paramètres 2B et 5B) génèrent plusieurs secondes de vidéo cohérente et animée à des résolutions telles que 720 x 480 et prennent en charge la conversion image-vidéo et la continuation vidéo. Fondamentalement, les poids et le code sont publics, alimentant une vague de réglages, d’outils et de recherches communautaires.

Aperçu technique

Le VAE causal 3D de CogVideoX réduit la vidéo brute en un volume latent compact, réduisant ainsi le nombre de jetons afin qu'un transformateur puisse modéliser de longues séquences à un prix abordable. Un transformateur expert applique la norme de couche adaptative et concatène le texte et les jetons visuels afin que les deux modalités s'occupent directement l'une de l'autre, améliorant ainsi l'alignement texte-vidéo. Un entraînement progressif sur des résolutions et des durées croissantes, ainsi qu'un sous-titrage minutieux des données, permettent d'obtenir des mouvements plus fluides et plus fidèles sémantiquement.

Impact stratégique

Vitesse et échelle

L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.

Choix de construction

Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.

Équipe et flux de travail

Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.

L'avenir de CogVideo et CogVideoX

En tant que l'un des modèles vidéo ouverts les plus puissants, CogVideoX ancre un écosystème à croissance rapide de réglages fins, d'adaptateurs de contrôle et d'extensions de plus longue durée. Attendez-vous à des gains continus en termes de longueur de clip, de résolution, de réalisme de mouvement et de contrôlabilité, ainsi qu'à une intégration plus étroite avec les flux de travail de conversion d'image en vidéo et d'édition. Sa pondération ouverte signifie que les organisations à but non lucratif, les chercheurs et les petits studios peuvent s'appuyer sur une génération vidéo de classe frontière sans contrôle propriétaire, accélérant ainsi les expérimentations créatives et axées sur la sécurité.

Mise en œuvre dans le monde réel

Générer un court clip narratif à partir d'une invite en chinois ou en anglais en utilisant des pondérations entièrement ouvertes

Transformer une seule image fixe téléchargée en une vidéo animée via l'image en vidéo CogVideoX

Affiner le modèle ouvert sur un style ou un personnage personnalisé pour l'animation indépendante

Des chercheurs comparent de nouvelles méthodes de génération vidéo à une base de référence ouverte et reproductible

Risques et garde-fous

Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.

Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.

Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.

Feuille de route de mise en œuvre

1

Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.

2

Testez avec des données qui correspondent aux conditions de production réelles.

3

Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.

4

Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CogVideo and CogVideoX quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Édition des instructions InstructPix2Pix

Questions fréquemment posées

What is CogVideo and CogVideoX?

CogVideo (2022) a été le premier modèle texte-vidéo ouvert à grande échelle, et CogVideoX (2024) est son successeur open source bien plus performant de Tsinghua/Zhipu AI. Ils sont importants car ils mettent la génération vidéo de haute qualité entre les mains de la communauté ouverte, et pas seulement des grands laboratoires d'entreprise.

Qu'est-ce qui est remarquable dans la version 2022 de CogVideo ?

CogVideo a été le premier modèle texte-vidéo à grande échelle publié ouvertement, prenant en charge les invites en chinois et en anglais.

Qu'accomplit la VAE causale 3D de CogVideoX ?

Le VAE causal 3D compresse la vidéo dans les dimensions spatiales et temporelles, réduisant ainsi le nombre de jetons afin qu'un transformateur puisse la modéliser efficacement.

Comment l'Expert Transformer dans CogVideoX gère-t-il le texte et la vidéo ?

L'Expert Transformer fusionne les jetons textuels et visuels avec une normalisation adaptative, améliorant ainsi l'alignement entre l'invite et la vidéo générée.

Quel groupe a développé CogVideo et CogVideoX ?

La famille CogVideo est issue de chercheurs associés à l'Université Tsinghua et à Zhipu AI.

Outre la conversion texte-vidéo, quelle fonctionnalité supplémentaire CogVideoX prend-il en charge ?

CogVideoX peut animer une image fixe (image vers vidéo) et étendre les clips existants (suite), au-delà des invites en texte brut.