Tengeneza-A-Video Nakala-kwa-Video
Make-A-Video ni mfumo wa Meta wa 2022 ambao hubadilisha kidokezo cha maandishi kuwa klipu fupi ya video bila kupata mafunzo kuhusu jozi za maandishi-video zenye lebo.
Muhtasari
It matters because it showed that the visual knowledge inside text-to-image models could be 'taught' to move using only unlabeled video.
Dive ya kina
Make-A-Video, iliyotangazwa na Meta AI mnamo Septemba 2022, hutoa sekunde chache za video kutoka kwa sentensi kama 'mbwa aliyevaa kofia ya shujaa anayeruka angani.' Mbinu yake kuu ni kutenganisha mwonekano kutoka kwa mwendo: muundo wa maandishi hadi picha (uliojengwa juu ya nafasi ya pamoja ya picha ya maandishi ya mtindo wa CLIP) hujifunza jinsi mambo yanavyoonekana kutoka kwa mabilioni ya picha zilizo na maelezo mafupi, huku tabaka tofauti za anga hujifunza jinsi mambo yanavyosonga kutoka kwa video isiyo na lebo pekee. Hii inazuia uhaba wa jozi za video za maandishi ya ubora wa juu. Muundo msingi hutoa klipu za ubora wa chini, za kiwango cha chini, kisha mitandao maalum hutafsiri fremu za ziada na mwonekano wa hali ya juu wa anga. Matokeo yalikuwa yanafanana kwa enzi yake, ingawa klipu zilikuwa fupi, zisizo na ukungu, na zenye kuelemewa na kubadilika-badilika.
Ufahamu wa Kiufundi
Make-A-Video hupanua mienendo ya utengenezaji wa picha za P2 na umakini katika 3D kwa kuongeza tabaka bandia za muda. Vipimo vya anga vilivyozoezwa awali hugandishwa au kusagwa vyema huku tabaka mpya za muda hujifunza mwendo kutoka kwa video mbichi, kwa hivyo hakuna lebo za maandishi-video zinazohitajika. Mtandao wa ukalimani wa fremu kisha huweka msongamano wa kalenda ya matukio na moduli za uenezaji wa azimio kuu zaidi huongeza maelezo ya anga, na kugeuza rasimu mbovu ya fremu 16, yenye ubora wa chini kuwa klipu laini na kali zaidi katika bomba lililoporomoka.
Athari za kimkakati
Kasi na kiwango
Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.
Tengeneza chaguzi
Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.
Timu na mtiririko wa kazi
Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.
Mustakabali wa Maandishi ya Tengeneza-Video-hadi-Video
Mapishi ya mwendo wa picha-kabla-plus-isiyo na lebo ya Make-A-Video yalipanda wimbi zima la maandishi-hadi-video. Vizazi vyake vinasisitiza klipu ndefu zaidi, zenye ubora wa juu, thabiti kwa muda zenye mwendo na sauti zinazoweza kudhibitiwa. Tarajia wazo la msingi, ukitumia tena maarifa makubwa ya picha na mwendo wa kujifunza kwa bei nafuu, ili kuendelea hata kama usanifu unapobadilika kuelekea usambaaji fiche wa kibadilishaji na miundo iliyounganishwa ambayo pia inakubali hali ya picha au video ili kuhaririwa na kuendelea.
Utekelezaji wa Ulimwengu Halisi
Kuhuisha sentensi moja ya maelezo kuwa klipu fupi ya kitanzi kwa chapisho la media ya kijamii
Kuleta dhana tuli kama 'teddy dubu anayechora picha' kama kielelezo cha kusisimua.
Kutafsiri kati ya picha mbili tulivu zinazotolewa na mtumiaji ili kuunda video laini ya mpito
Inazalisha rasimu za mwendo wa haraka za matukio yanayowaziwa kwa ajili ya ubao wa hadithi kabla ya kurekodi filamu yoyote
Hatari & Walinzi
Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.
Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.
Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.
Ramani ya Utekelezaji
Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.
Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.
Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.
Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Make-A-Video Text-to-Video quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Sora na Maandishi hadi Video
Maswali yanayoulizwa mara kwa mara
What is Make-A-Video Text-to-Video?
Make-A-Video ni mfumo wa Meta wa 2022 ambao hubadilisha kidokezo cha maandishi kuwa klipu fupi ya video bila kupata mafunzo kuhusu jozi za maandishi-video zenye lebo. Ni muhimu kwa sababu ilionyesha kuwa maarifa yanayoonekana ndani ya miundo ya maandishi-hadi-picha yanaweza 'kufundishwa' kusonga kwa kutumia video isiyo na lebo pekee.
Je, ni uvumbuzi gani mkuu ambao uliruhusu Make-A-Video kuepuka kuhitaji jozi za video-maandishi?
Make-A-Video hutatua tatizo: muundo wa maandishi-hadi-picha hujifunza jinsi mambo yanavyofanana kutoka kwa picha zilizo na maelezo mafupi, huku tabaka tofauti za muda hujifunza mwendo kutoka kwa video mbichi, isiyo na lebo.
Je, Make-A-Video huongeza vipi uwezo wa kusonga kwa modeli ya picha?
Hupanua mabadiliko ya anga ya 2D na umakini kwa tabaka mpya za muda ambazo hujifunza jinsi maudhui hubadilika kadri muda unavyopita.
Je, hatua za kufasiri sura na azimio kuu hufanya nini?
Baada ya rasimu mbaya ya chini, kiwango cha chini, tafsiri huongeza fremu na moduli za azimio bora huongeza azimio.
Ni kizuizi gani cha kawaida cha matokeo ya Make-A-Video?
Klipu zilikuwa sekunde chache tu, zenye mwonekano wa chini kiasi, na kukabiliwa na kumeta na kuvuruga kwa muda.