ቪዥዋል AI መመሪያ

CogVideo እና CogVideoX

CogVideo (2022) የመጀመሪያው መጠነ ሰፊ የጽሑፍ-ወደ-ቪዲዮ ሞዴል ነበር፣ እና CogVideoX (2024) ከTsinghua/Zhipu AI እጅግ የላቀ ችሎታ ያለው ክፍት ምንጭ ተተኪ ነው።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

ትልቅ ጥራት ያለው የቪዲዮ ማመንጨት ትልቅ የኮርፖሬት ቤተ-ሙከራዎችን ብቻ ሳይሆን በክፍት ማህበረሰቡ እጅ ስለሚያስገቡ አስፈላጊ ናቸው።

ጥልቅ ዳይቭ

እ.ኤ.አ. በ2022 የተለቀቀው CogVideo በCogView2 የጽሑፍ-ወደ-ምስል ትራንስፎርመር ላይ የተገነባ እና ባለብዙ-ፍሬም-ተመን ፣ አጫጭር ክሊፖችን ለማፍለቅ ፣የመጀመሪያው በይፋ የተለቀቀ ትልቅ የፅሁፍ-ወደ-ቪዲዮ ሞዴል እና የቻይንኛ እና የእንግሊዝኛ ጥያቄዎችን የሚደግፍ ዘዴን ተጠቅሟል። የ 2024 ተተኪው ፣ CogVideoX ፣ ሙሉ በሙሉ እንደገና ዲዛይን የተደረገ ነው፡ ቪዲዮን በቦታ እና በጊዜ ለመጭመቅ 3D የምክንያት ልዩነት አውቶኢንኮደር ይጠቀማል፣ ከዚያም በፅሁፍ እና በቪዲዮ ቶከኖች ላይ በተጣመሩ የፅሁፍ እና የቪዲዮ ቶከኖች ላይ በጋራ የሚከታተል የባለሙያ ትራንስፎርመር። CogVideoX ሞዴሎች (እንደ 2B እና 5B መመዘኛዎች ባሉ መጠኖች) እንደ 720x480 ባሉ ጥራቶች የበርካታ ሴኮንዶች ወጥነት ያለው ከፍተኛ እንቅስቃሴ ቪዲዮ ያመነጫሉ እና የምስል-ወደ-ቪዲዮ እና ቪዲዮ ቀጣይነት ይደግፋሉ። በወሳኝ መልኩ፣ ክብደቶች እና ኮድ ህዝባዊ ናቸው፣ ይህም የማህበረሰቡን ጥሩ ዜማዎች፣ መሳሪያዎች እና የምርምር ማዕበል ያቀጣጥላሉ።

ቴክኒካዊ ግንዛቤ

CogVideoX's 3D causal VAE ጥሬውን ቪዲዮ ወደ ውሱን ድብቅ ድምጽ ያሳጥባል፣ ይህም የማስመሰያ ቁጥሩን በመቀነስ ትራንስፎርመር ረጃጅም ቅደም ተከተሎችን በተመጣጣኝ ዋጋ መቅረጽ ይችላል። ኤክስፐርት ትራንስፎርመር የሚለምደዉ የንብርብሮች ደንብን ይተገብራል እና ጽሁፍ እና ምስላዊ ቶከኖችን ያገናኛል ስለዚህም ሁለቱ ሞዳሎች በቀጥታ እርስ በርስ ይገናኛሉ፣ የፅሁፍ-ቪዲዮ አሰላለፍን ያሻሽላል። የውሳኔ ሃሳቦችን እና የቆይታ ጊዜዎችን በማሳደግ ላይ ያለ ተራማጅ ስልጠና እና ጥንቃቄ የተሞላበት የውሂብ መግለጫ ጽሑፍ ለስላሳ እና በትርጉም ታማኝ እንቅስቃሴ ይሰጣል።

ስልታዊ ተጽእኖ

ፍጥነት እና ልኬት

ቪዥዋል AI የመመርመሪያ፣ የማወቅ እና የመለያ ስራዎችን በሚዛን መጠን በራስ ሰር ሊያደርግ ይችላል።

ምርጫዎችን ይገንቡ

የፈጠራ ቡድኖች በጥቂት የእጅ ክለሳዎች ጽንሰ-ሀሳቦችን በፍጥነት መተየብ ይችላሉ።

ቡድን እና የስራ ፍሰት

ክዋኔዎች ከዚህ ቀደም ለማስኬድ አስቸጋሪ የነበሩትን የምስል እና የቪዲዮ ምልክቶችን መጠቀም ይችላሉ።

የCogVideo እና CogVideoX የወደፊት ዕጣ

በጣም ጠንካራ ከሆኑ ክፍት የቪዲዮ ሞዴሎች አንዱ እንደመሆኑ ፣ CogVideoX ፈጣን-የሚያድግ ጥሩ-ዜማዎች ፣ የቁጥጥር አስማሚዎች እና የረጅም ጊዜ ማራዘሚያዎች ስርዓተ-ምህዳር መልህቅ ነው። በቅንጥብ ርዝመት፣ በመፍታት፣ በእንቅስቃሴ ተጨባጭነት እና በቁጥጥርነት፣ እንዲሁም ከምስል-ወደ-ቪዲዮ እና ከአርትዖት የስራ ፍሰቶች ጋር ቀጣይነት ያለው ግኝቶችን ይጠብቁ። የእሱ ክፍት ክብደቶች ለትርፍ ያልተቋቋሙ ፣ ተመራማሪዎች እና ትናንሽ ስቱዲዮዎች ያለ የባለቤትነት በር ጥበቃ በድንበር-ደረጃ ቪዲዮ ትውልድ ላይ መገንባት ይችላሉ ፣ ይህም ሁለቱንም ፈጠራ እና ደህንነት ላይ ያተኮረ ሙከራን ያፋጥናል።

የእውነተኛ-ዓለም አተገባበር

ሙሉ በሙሉ ክፍት የሆኑ ክብደቶችን በመጠቀም ከቻይንኛ ወይም ከእንግሊዝኛ መጠየቂያ አጭር የትረካ ቅንጥብ መፍጠር

በCogVideoX ምስል-ወደ-ቪዲዮ በኩል ነጠላ የተሰቀለውን ምስል ወደ ተንቀሳቃሽ ቪዲዮ በመቀየር ላይ

ለኢንዲ አኒሜሽን በብጁ ዘይቤ ወይም ባህሪ ላይ ያለውን ክፍት ሞዴል በጥሩ ሁኔታ ማስተካከል

ተመራማሪዎች አዲስ የቪዲዮ-ማመንጨት ዘዴዎችን ሊባዛ በሚችል ክፍት መነሻ ላይ በማመሳከር ላይ ናቸው።

አደጋዎች እና የጥበቃ መንገዶች

የምስል መብቶች እና ፈቃድ ግልጽ ካልሆነ ህጋዊ አደጋዎች ሊሆኑ ይችላሉ።

የሞዴል አፈጻጸም በብርሃን፣ በስነ-ሕዝብ እና በአካባቢው ሊለያይ ይችላል።

የመተማመን ገደቦች ካልተቆጣጠሩ የውሸት አወንታዊ ነገሮች ላይታዩ ይችላሉ።

የትግበራ ፍኖተ ካርታ

1

ለትክክለኛነት፣ ለማስታወስ እና ለስህተት ወጪዎች የመቀበያ መስፈርቶችን ይግለጹ።

2

ከእውነተኛ የምርት ሁኔታዎች ጋር በሚዛመድ ውሂብ ይሞክሩ።

3

ለዝቅተኛ እምነት ወይም ከፍተኛ ተጽዕኖ ትንበያ የሰው ግምገማን ያክሉ።

4

ከካሜራ ወይም የውሂብ ስብስብ ለውጦች በኋላ የሞዴሉን ተንሸራታች ይከታተሉ እና እንደገና ያረጋግጡ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CogVideo and CogVideoX quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

ቀጣይ መመሪያ

InstructPix2Pix መመሪያ አርትዖት

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

CogVideo እና CogVideoX ምንድን ናቸው?

CogVideo (2022) የመጀመሪያው መጠነ ሰፊ የጽሑፍ-ወደ-ቪዲዮ ሞዴል ነበር፣ እና CogVideoX (2024) ከTsinghua/Zhipu AI እጅግ የላቀ ችሎታ ያለው ክፍት ምንጭ ተተኪ ነው። ትልቅ ጥራት ያለው የቪዲዮ ማመንጨት ትልቅ የኮርፖሬት ቤተ-ሙከራዎችን ብቻ ሳይሆን በክፍት ማህበረሰቡ እጅ ስለሚያስገቡ አስፈላጊ ናቸው።

በCogVideo 2022 መለቀቅ ላይ የሚታወቀው ምንድን ነው?

CogVideo የቻይንኛ እና የእንግሊዘኛ ጥያቄዎችን የሚደግፍ በግልፅ የተለቀቀ የመጀመሪያው ትልቅ የጽሑፍ-ወደ-ቪዲዮ ሞዴል ነበር።

CogVideoX's 3D causal VAE ምን አከናውኗል?

የ3-ል ምክንያት VAE ቪዲዮን በቦታ እና በጊዜያዊ ልኬቶች ያጨቅቃል፣የቶከን ብዛትን በመቀነስ ትራንስፎርመር በብቃት እንዲቀርጸው ያደርጋል።

በ CogVideoX ውስጥ ያለው ኤክስፐርት ትራንስፎርመር ጽሑፍ እና ቪዲዮን እንዴት ይቆጣጠራል?

ኤክስፐርት ትራንስፎርመር ጽሑፍን እና ምስላዊ ቶከኖችን ከአስማሚ መደበኛነት ጋር በማዋሃድ በፈጣን እና በተፈጠረው ቪዲዮ መካከል ያለውን አሰላለፍ ያሻሽላል።

CogVideo እና CogVideoXን የፈጠረው የትኛው ቡድን ነው?

የCogVideo ቤተሰብ የመጣው ከTsinghua University እና Zhipu AI ጋር ከተገናኙ ተመራማሪዎች ነው።

ከጽሑፍ-ወደ-ቪዲዮ በተጨማሪ ምን ተጨማሪ ችሎታ CogVideoX ይደግፋል?

CogVideoX ጸጥ ያለ ምስል (ምስል-ወደ-ቪዲዮ) እና ነባር ቅንጥቦችን (ቀጣይነት) ማራዘም ይችላል።