Mwongozo wa AI unaoonekana

Picha za Misururu ya Video

Video ya Imagen ni mfumo wa Google wa 2022 wa maandishi-kwa-video ambao huunda klipu kupitia mfululizo wa miundo saba ya usambaaji, kila moja ikiongeza fremu zaidi au mwonekano zaidi.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It matters because it showed how stacking specialized stages can produce high-definition, temporally smooth video from a single prompt.

Dive ya kina

Imagen Video, iliyoletwa na Google Utafiti mnamo Oktoba 2022, inapanua mbinu ya picha ya Imagen kwa mwendo. Kisimbaji cha maandishi cha T5 kilichogandishwa hugeuza kidokezo kuwa upachikaji wa lugha wasilianifu ambao huweka kila hatua. Muundo wa uenezi wa msingi kwanza huzalisha video ndogo, ya kiwango cha chini, kisha msururu wa miundo sita zaidi ya usambaaji kwa tafauti hufanya azimio kuu la muda (kuongeza fremu kati ya zilizopo) na azimio kuu la anga (kuongezeka kwa azimio la pikseli). Toleo kamili la bomba la video 1280x768 kwa fremu 24 kwa sekunde, sekunde kadhaa kwa muda mrefu. Kwa sababu uelewaji wa kina wa lugha huishi katika kisimbaji cha maandishi, Imagen Video inaweza kutoa maandishi yenye mtindo unaosomeka, umaridadi wa kisanii mbalimbali, na mwendo wa kitu kinachofahamu 3D, kuonyesha kwamba mipigo makini inayojaribu kufanya kila kitu katika muundo mmoja mkubwa.

Ufahamu wa Kiufundi

Mteremko unagawanya kizazi kigumu kisichowezekana cha risasi moja katika matatizo madogo yanayoweza kudhibitiwa. Miundo saba ya uenezaji huendeshwa kwa mfuatano: jenereta moja ya msingi pamoja na miundo mitatu ya anga na tatu ya msongo wa juu wa muda. Kila moja imewekwa kwenye upachikaji wa papo hapo na matokeo ya hatua ya awali. Mbinu kama vile kuweka vigezo vya utabiri wa v na kunereka kwa kasi huharakisha uchukuaji sampuli, huku mwongozo usio na kiainishaji huimarisha ufuasi wa haraka katika kila hatua ya mnyororo.

Athari za kimkakati

Kasi na kiwango

Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.

Tengeneza chaguzi

Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.

Timu na mtiririko wa kazi

Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.

Mustakabali wa Misururu ya Video ya Imagen

Mabomba ya nafasi ya pikseli yaliyoporomoka yalithibitisha dhana hii lakini ni nzito na ya kukokotoa. Uga umehamia kwa kiasi kikubwa kuelekea utengamano uliofichika na uti wa mgongo wa transfoma ambao huzalisha katika nafasi iliyobanwa, kupunguza gharama huku kutunza ubora. Bado, somo la Imagen Video, hutenganisha kazi za 'nini,' 'jinsi inavyosonga,' na 'jinsi kali,' linaendelea kufahamisha miundo ya hatua nyingi na uboreshaji, na mtindo wake wa kuweka T5 uliathiriwa baadaye uaminifu wa hali ya juu, jenereta za uaminifu wa maandishi.

Utekelezaji wa Ulimwengu Halisi

Inatengeneza klipu ya ubora wa juu yenye maandishi ya skrini yenye maandishi yanayoweza kusomeka kutoka kwa kidokezo

Inatoa onyesho lile lile lililofafanuliwa katika mitindo mingi ya sanaa, kutoka rangi ya maji hadi uundaji wa udongo

Inazalisha uhuishaji wa vitu vifupi vya 3D kama vile sanamu inayozunguka, inayosonga

Kuunda uuzaji laini wa 24fps au klipu za dhana moja kwa moja kutoka kwa maelezo yaliyoandikwa

Hatari & Walinzi

Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.

Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.

Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.

Ramani ya Utekelezaji

1

Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.

2

Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.

3

Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.

4

Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Imagen Video Cascades quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Sora na Maandishi hadi Video

Maswali yanayoulizwa mara kwa mara

What is Imagen Video Cascades?

Video ya Imagen ni mfumo wa Google wa 2022 wa maandishi-kwa-video ambao huunda klipu kupitia mfululizo wa miundo saba ya usambaaji, kila moja ikiongeza fremu zaidi au mwonekano zaidi. Ni muhimu kwa sababu ilionyesha jinsi hatua maalum za kuweka mrundikano zinaweza kutoa ubora wa juu, video laini kwa muda kutoka kwa dodoso moja.

Je, ni aina ngapi za uenezi zinazounda mteremko wa Video ya Imagen?

Video ya Imagen hutumia miundo saba ya usambaaji: jenereta moja ya msingi pamoja na miundo mitatu ya angavu na tatu ya muda mfupi ya msongo wa juu.

Je, hatua ya muda ya azimio kuu hufanya nini katika mteremko?

Azimio kuu la muda hutafsiri fremu za ziada ili kuinua kasi ya fremu, huku azimio bora la anga huongeza ubora wa pikseli.

Ni kipengee gani kinachosimba maandishi kwenye Video ya Imagen?

Imagen Video, kama Imagen, hutumia kisimbaji kikubwa cha maandishi cha T5 kilichogandishwa ili kutoa upachikaji wa hali hiyo kila hatua ya usambaaji.

Kwa nini ugawanye kizazi katika mteremko badala ya mfano mmoja mkubwa?

Kila hatua hutatua kazi nyembamba zaidi, kutengeneza rasimu chafu, kuongeza fremu, au kuongeza azimio, ambalo ni rahisi zaidi kuliko kufanya kila kitu mara moja.

Video ya Imagen ilionyesha uwezo gani haswa?

Shukrani kwa uelewa wake mkubwa wa maandishi wa T5, Video ya Imagen inaweza kutoa maandishi yenye mtindo unaosomeka na anuwai ya umaridadi wa kisanii.