Készítsen videót szövegből videóvá
A Make-A-Video a Meta 2022-es rendszere, amely a szöveges felszólítást rövid videoklippé alakítja anélkül, hogy a címkézett szöveg-videó párokat gyakorolná.
Áttekintés
It matters because it showed that the visual knowledge inside text-to-image models could be 'taught' to move using only unlabeled video.
Mély merülés
A Meta AI által 2022 szeptemberében bejelentett Make-A-Video néhány másodperces videót generál egy olyan mondatból, mint „egy kutya, aki szuperhősköpenyt visel, repül az égen”. Legfontosabb trükkje a megjelenés és a mozgás szétválasztása: a szöveg-kép modell (amely CLIP-stílusú közös szöveg-képtérre és diffúzióra épül) több milliárd feliratos képből tanulja meg, hogyan néznek ki a dolgok, míg a különálló térbeli és időbeli rétegek csak a címkézetlen videóból tanulják meg a dolgok mozgását. Ez elkerüli a jó minőségű szöveg-videó párok szűkösségét. Az alapmodell alacsony felbontású, alacsony képkockasebességű klipeket készít, majd a dedikált hálózatok extra képkockákat és feljavított térbeli felbontást interpolálnak. Az eredmény feltűnően koherens volt a korszakához képest, bár a klipek rövidek, elmosódottak voltak, és hajlamosak voltak villogásra és vetemedésre.
Technikai betekintés
A Make-A-Video pszeudoidőbeli rétegek hozzáadásával kiterjeszti a 2D képgenerálási folyamatokat és a figyelmet 3D-vé. Az előre betanított térbeli súlyokat rögzítik vagy finomhangolják, míg az új időbeli rétegek mozgást tanulnak a nyers videóból, így nincs szükség szöveges-videó címkékre. A képkocka-interpolációs hálózat ezután sűrűsíti az idővonalat, és a szuperfelbontású diffúziós modulok növelik a térbeli részleteket, és a durva, 16 képkockás, alacsony felbontású huzatot simább, élesebb klippé alakítják a lépcsőzetes csővezetékben.
Stratégiai hatás
Sebesség és méretarány
A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.
Építési lehetőségek
A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.
Csapat és munkafolyamat
A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.
A videó készítés jövője szövegből videóvá
A Make-A-Video image-prior-plus-unlabeled-motion receptje beindította a teljes szöveg-videó hullámot. Leszármazottai a hosszabb, nagyobb felbontású, átmenetileg stabil klipeket hangsúlyozzák, szabályozható kameramozgással és hanggal. Várhatóan az alapötlet, a hatalmas képi tudás újrafelhasználása és a mozgástanulás olcsón megmarad, még akkor is, amikor az architektúrák a transzformátor alapú látens diffúzió és az egyesített modellek felé tolódnak el, amelyek a kép- vagy videókondicionálást is elfogadják szerkesztésre és folytatásra.
Valós megvalósítás
Egyetlen leíró mondat animálása egy rövid hurkolt klipbe egy közösségi média bejegyzéshez
Mozgó illusztrációként életre kelt egy statikus koncepciót, mint például a „portrét festő mackó”
Interpoláció két felhasználó által biztosított állókép között, hogy egyenletes átmenetet hozzon létre
Gyors mozgású piszkozatok generálása elképzelt jelenetekből a storyboard-hoz minden forgatás előtt
Kockázatok és védőkorlátok
A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.
A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.
A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.
Végrehajtási ütemterv
Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.
Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.
Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.
A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Make-A-Video Text-to-Video quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Sora és Text-to-Video
Gyakran ismételt kérdések
What is Make-A-Video Text-to-Video?
A Make-A-Video a Meta 2022-es rendszere, amely a szöveges felszólítást rövid videoklippé alakítja anélkül, hogy a címkézett szöveg-videó párokat gyakorolná. Ez azért fontos, mert megmutatta, hogy a szöveg-kép modelleken belüli vizuális tudást csak címkézetlen videó segítségével meg lehet tanítani mozgatni.
Mi volt az a központi újítás, amely lehetővé tette a Make-A-Video számára, hogy elkerülje a feliratozott szöveg-videó párokat?
A Make-A-Video szétválasztja a problémát: a szöveg-kép modell a feliratos képekből tanulja meg, hogyan néznek ki a dolgok, míg a különálló időbeli rétegek mozgást tanulnak meg nyers, címkézetlen videóból.
Hogyan ad a Make-A-Video mozgásképességet egy képmodellhez?
Kibővíti a 2D-s térbeli konvolúciót és a figyelmet új időbeli rétegekkel, amelyek megtanulják, hogyan változik a tartalom az idő múlásával.
Mit csinál a keretinterpoláció és a szuperfelbontás szakasz?
A durva, alacsony felbontású, alacsony képkockasebességű piszkozat után az interpoláció képkockákat ad hozzá, a szuperfelbontású modulok pedig növelik a felbontást.
Mi volt a Make-A-Video kimenetének tipikus korlátozása?
A klipek csak néhány másodpercesek voltak, viszonylag alacsony felbontásúak, és hajlamosak az időbeli villogásra és torzításra.