Picha za Misururu ya Video
Video ya Imagen ni mfumo wa Google wa 2022 wa maandishi-kwa-video ambao huunda klipu kupitia mfululizo wa miundo saba ya usambaaji, kila moja ikiongeza fremu zaidi au mwonekano zaidi.
Muhtasari
It matters because it showed how stacking specialized stages can produce high-definition, temporally smooth video from a single prompt.
Dive ya kina
Imagen Video, iliyoletwa na Google Utafiti mnamo Oktoba 2022, inapanua mbinu ya picha ya Imagen kwa mwendo. Kisimbaji cha maandishi cha T5 kilichogandishwa hugeuza kidokezo kuwa upachikaji wa lugha wasilianifu ambao huweka kila hatua. Muundo wa uenezi wa msingi kwanza huzalisha video ndogo, ya kiwango cha chini, kisha msururu wa miundo sita zaidi ya usambaaji kwa tafauti hufanya azimio kuu la muda (kuongeza fremu kati ya zilizopo) na azimio kuu la anga (kuongezeka kwa azimio la pikseli). Toleo kamili la bomba la video 1280x768 kwa fremu 24 kwa sekunde, sekunde kadhaa kwa muda mrefu. Kwa sababu uelewaji wa kina wa lugha huishi katika kisimbaji cha maandishi, Imagen Video inaweza kutoa maandishi yenye mtindo unaosomeka, umaridadi wa kisanii mbalimbali, na mwendo wa kitu kinachofahamu 3D, kuonyesha kwamba mipigo makini inayojaribu kufanya kila kitu katika muundo mmoja mkubwa.
Ufahamu wa Kiufundi
Mteremko unagawanya kizazi kigumu kisichowezekana cha risasi moja katika matatizo madogo yanayoweza kudhibitiwa. Miundo saba ya uenezaji huendeshwa kwa mfuatano: jenereta moja ya msingi pamoja na miundo mitatu ya anga na tatu ya msongo wa juu wa muda. Kila moja imewekwa kwenye upachikaji wa papo hapo na matokeo ya hatua ya awali. Mbinu kama vile kuweka vigezo vya utabiri wa v na kunereka kwa kasi huharakisha uchukuaji sampuli, huku mwongozo usio na kiainishaji huimarisha ufuasi wa haraka katika kila hatua ya mnyororo.
Athari za kimkakati
Kasi na kiwango
Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.
Tengeneza chaguzi
Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.
Timu na mtiririko wa kazi
Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.
Mustakabali wa Misururu ya Video ya Imagen
Mabomba ya nafasi ya pikseli yaliyoporomoka yalithibitisha dhana hii lakini ni nzito na ya kukokotoa. Uga umehamia kwa kiasi kikubwa kuelekea utengamano uliofichika na uti wa mgongo wa transfoma ambao huzalisha katika nafasi iliyobanwa, kupunguza gharama huku kutunza ubora. Bado, somo la Imagen Video, hutenganisha kazi za 'nini,' 'jinsi inavyosonga,' na 'jinsi kali,' linaendelea kufahamisha miundo ya hatua nyingi na uboreshaji, na mtindo wake wa kuweka T5 uliathiriwa baadaye uaminifu wa hali ya juu, jenereta za uaminifu wa maandishi.
Utekelezaji wa Ulimwengu Halisi
Inatengeneza klipu ya ubora wa juu yenye maandishi ya skrini yenye maandishi yanayoweza kusomeka kutoka kwa kidokezo
Inatoa onyesho lile lile lililofafanuliwa katika mitindo mingi ya sanaa, kutoka rangi ya maji hadi uundaji wa udongo
Inazalisha uhuishaji wa vitu vifupi vya 3D kama vile sanamu inayozunguka, inayosonga
Kuunda uuzaji laini wa 24fps au klipu za dhana moja kwa moja kutoka kwa maelezo yaliyoandikwa
Hatari & Walinzi
Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.
Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.
Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.
Ramani ya Utekelezaji
Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.
Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.
Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.
Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Imagen Video Cascades quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Sora na Maandishi hadi Video
Maswali yanayoulizwa mara kwa mara
What is Imagen Video Cascades?
Video ya Imagen ni mfumo wa Google wa 2022 wa maandishi-kwa-video ambao huunda klipu kupitia mfululizo wa miundo saba ya usambaaji, kila moja ikiongeza fremu zaidi au mwonekano zaidi. Ni muhimu kwa sababu ilionyesha jinsi hatua maalum za kuweka mrundikano zinaweza kutoa ubora wa juu, video laini kwa muda kutoka kwa dodoso moja.
Je, ni aina ngapi za uenezi zinazounda mteremko wa Video ya Imagen?
Video ya Imagen hutumia miundo saba ya usambaaji: jenereta moja ya msingi pamoja na miundo mitatu ya angavu na tatu ya muda mfupi ya msongo wa juu.
Je, hatua ya muda ya azimio kuu hufanya nini katika mteremko?
Azimio kuu la muda hutafsiri fremu za ziada ili kuinua kasi ya fremu, huku azimio bora la anga huongeza ubora wa pikseli.
Ni kipengee gani kinachosimba maandishi kwenye Video ya Imagen?
Imagen Video, kama Imagen, hutumia kisimbaji kikubwa cha maandishi cha T5 kilichogandishwa ili kutoa upachikaji wa hali hiyo kila hatua ya usambaaji.
Kwa nini ugawanye kizazi katika mteremko badala ya mfano mmoja mkubwa?
Kila hatua hutatua kazi nyembamba zaidi, kutengeneza rasimu chafu, kuongeza fremu, au kuongeza azimio, ambalo ni rahisi zaidi kuliko kufanya kila kitu mara moja.
Video ya Imagen ilionyesha uwezo gani haswa?
Shukrani kwa uelewa wake mkubwa wa maandishi wa T5, Video ya Imagen inaweza kutoa maandishi yenye mtindo unaosomeka na anuwai ya umaridadi wa kisanii.