Vizuális MI ÚTMUTATÓ

CogVideo és CogVideoX

A CogVideo (2022) volt az első nagyszabású nyílt szöveg-videó modell, a CogVideoX (2024) pedig a Tsinghua/Zhipu AI jóval nagyobb képességű nyílt forráskódú utódja.

2 perc olvasásUtoljára frissítve

Áttekintés

They matter because they put high-quality video generation into the hands of the open community, not just big corporate labs.

Mély merülés

A 2022-ben kiadott CogVideo a CogView2 szöveg-kép transzformátorra épült, és több képkocka-sebességű, autoregresszív megközelítést alkalmazott rövid klipek előállításához, így lett az első nyíltan kiadott nagy szöveg-videó modell, és támogatja a kínai és angol felszólításokat. 2024-es utódja, a CogVideoX egy teljes újratervezés: egy 3D kauzális variációs autoencoder segítségével tömöríti a videót térben és időben egyaránt, majd egy Expert Transformert használ diffúziós objektívvel, amely közösen kezeli a szöveget és a videó tokeneket. A CogVideoX modellek (például 2B és 5B paraméterekkel) több másodperces koherens, nagy mozgású videót készítenek 720x480-as felbontásban, és támogatják a képről videóra és videó folytatást. Lényeges, hogy a súlyok és a kód nyilvánosak, ami a közösségi finomhangolások, eszközök és kutatások hullámát táplálja.

Technikai betekintés

A CogVideoX 3D kauzális VAE-je a nyers videót kompakt látens kötetté zsugorítja, lecsökkenti a tokenszámot, így a transzformátor megfizethető módon képes hosszú sorozatokat modellezni. Az Expert Transformer alkalmazza az adaptív rétegnormát, és összefűzi a szöveget és a vizuális tokeneket, így a két modalitás közvetlenül foglalkozik egymással, javítva a szöveg-videó igazítást. A növekvő felbontásra és időtartamra vonatkozó progresszív képzés, valamint az adatok gondos feliratozása simább, szemantikailag hűbb mozgást eredményez.

Stratégiai hatás

Sebesség és méretarány

A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.

Építési lehetőségek

A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.

Csapat és munkafolyamat

A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.

A CogVideo és a CogVideoX jövője

Az egyik legerősebb nyílt videómodellként a CogVideoX a finomhangolások, vezérlőadapterek és hosszabb időtartamú bővítmények gyorsan növekvő ökoszisztémáját rögzíti. Folyamatos növekedésre számíthat a klip hosszában, felbontásában, mozgásrealizmusában és irányíthatóságában, valamint szorosabb integrációban a kép-videó és a szerkesztési munkafolyamatokkal. Nyitott súlyozása azt jelenti, hogy a nonprofit szervezetek, a kutatók és a kis stúdiók a legmodernebb videógenerálásra építhetnek saját tulajdonú kapuőrzés nélkül, felgyorsítva a kreatív és a biztonságra összpontosító kísérletezést.

Valós megvalósítás

Rövid narratív klip generálása kínai vagy angol felszólításból teljesen nyitott súlyzókkal

Egyetlen feltöltött állókép átalakítása mozgó videóvá a CogVideoX kép-videó segítségével

A nyílt modell finomhangolása egyéni stílusra vagy karakterre indie animációhoz

A kutatók az új videógenerálási módszereket összehasonlítják a reprodukálható nyílt alapvonallal

Kockázatok és védőkorlátok

A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.

A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.

A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.

Végrehajtási ütemterv

1

Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.

2

Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.

3

Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.

4

A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CogVideo and CogVideoX quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

InstructPix2Pix utasításszerkesztés

Gyakran ismételt kérdések

What is CogVideo and CogVideoX?

A CogVideo (2022) volt az első nagyszabású nyílt szöveg-videó modell, a CogVideoX (2024) pedig a Tsinghua/Zhipu AI jóval nagyobb képességű nyílt forráskódú utódja. Fontosak, mert a kiváló minőségű videókészítést a nyílt közösség kezébe adják, nem csak a nagyvállalati laboratóriumokba.

Mi a figyelemre méltó a CogVideo 2022-es kiadásában?

A CogVideo volt az első nagyszabású, nyíltan kiadott szöveg-videó modell, amely mind a kínai, mind az angol nyelvű felszólításokat támogatta.

Mit ér el a CogVideoX 3D kauzális VAE-je?

A 3D kauzális VAE térbeli és időbeli dimenziókban is tömöríti a videót, csökkentve a tokenszámot, így a transzformátor hatékonyan tudja modellezni.

Hogyan kezeli a CogVideoX Expert Transformer a szöveget és a videót?

Az Expert Transformer egyesíti a szöveget és a vizuális tokeneket az adaptív normalizálással, javítva az összehangolást a prompt és a generált videó között.

Melyik csoport fejlesztette ki a CogVideo-t és a CogVideoX-et?

A CogVideo család a Tsinghua Egyetemmel és a Zhipu AI-val kapcsolatban álló kutatóktól származik.

A szöveg-videó átalakításon kívül milyen további képességeket támogat a CogVideoX?

A CogVideoX képes animálni egy állóképet (képből videóvá), és kiterjeszti a meglévő klipeket (folytatás), az egyszerű szöveges felszólításokon túl.