بصری AI گائیڈ

CogVideo اور CogVideoX

CogVideo (2022) پہلا بڑے پیمانے پر اوپن ٹیکسٹ ٹو ویڈیو ماڈل تھا، اور CogVideoX (2024) Tsinghua/Zhipu AI سے اس کا کہیں زیادہ قابل اوپن سورس جانشین ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

They matter because they put high-quality video generation into the hands of the open community, not just big corporate labs.

گہرا غوطہ

CogVideo، جو 2022 میں ریلیز ہوا، CogView2 ٹیکسٹ ٹو امیج ٹرانسفارمر پر بنایا گیا اور مختصر کلپس بنانے کے لیے ایک ملٹی فریم ریٹ، خود کار طریقے سے اپروچ کا استعمال کیا، یہ پہلا کھلے عام جاری ہونے والا بڑا ٹیکسٹ ٹو ویڈیو ماڈل بن گیا اور چینی اور انگریزی اشارے کی حمایت کرتا ہے۔ اس کا 2024 جانشین، CogVideoX، ایک مکمل دوبارہ ڈیزائن ہے: یہ جگہ اور وقت دونوں میں ویڈیو کو کمپریس کرنے کے لیے ایک 3D causal variational autoencoder کا استعمال کرتا ہے، پھر ایک ماہر ٹرانسفارمر جس میں پھیلاؤ کے مقصد کے ساتھ مشترکہ طور پر ٹیکسٹ اور ویڈیو ٹوکنز کو ایک ساتھ ملایا جاتا ہے۔ CogVideoX ماڈلز (2B اور 5B پیرامیٹرز جیسے سائز میں) 720x480 جیسی ریزولوشنز پر کئی سیکنڈ کی مربوط، ہائی موشن ویڈیو تیار کرتے ہیں اور تصویر سے ویڈیو اور ویڈیو کے تسلسل کو سپورٹ کرتے ہیں۔ اہم طور پر، وزن اور کوڈ عوامی ہیں، جو کمیونٹی فائن ٹونز، ٹولز اور تحقیق کی ایک لہر کو ہوا دیتے ہیں۔

تکنیکی بصیرت

CogVideoX کا 3D causal VAE خام ویڈیو کو ایک کمپیکٹ لیٹنٹ والیوم میں سکڑتا ہے، ٹوکن کی گنتی کو کم کرتا ہے تاکہ ایک ٹرانسفارمر سستی طور پر طویل ترتیب کو ماڈل کر سکے۔ ایک ماہر ٹرانسفارمر انکولی پرت کے اصول کو لاگو کرتا ہے اور متن اور بصری ٹوکن کو جوڑتا ہے تاکہ دونوں طریقہ کار ایک دوسرے کے ساتھ براہ راست شرکت کریں، ٹیکسٹ-ویڈیو الائنمنٹ کو بہتر بناتے ہوئے۔ ریزولوشنز اور دورانیے کو بڑھانے کے بارے میں ترقی پسند تربیت، نیز محتاط ڈیٹا کیپشننگ، ہموار، زیادہ معنوی اعتبار سے وفادار تحریک پیدا کرتی ہے۔

اسٹریٹجک اثر

رفتار اور پیمانہ

بصری AI پیمانے پر معائنہ، پتہ لگانے، اور ٹیگنگ کے کاموں کو خودکار کر سکتا ہے۔

Build choices

تخلیقی ٹیمیں کم دستی ترمیم کے ساتھ تصورات کو تیزی سے پروٹو ٹائپ کر سکتی ہیں۔

Team and workflow

آپریشنز امیج اور ویڈیو سگنلز کا استعمال کر سکتے ہیں جن پر کارروائی کرنا پہلے مشکل تھا۔

CogVideo اور CogVideoX کا مستقبل

سب سے مضبوط اوپن ویڈیو ماڈلز میں سے ایک کے طور پر، CogVideoX فائن ٹیونز، کنٹرول اڈاپٹرز، اور طویل مدتی توسیعات کے تیزی سے بڑھتے ہوئے ماحولیاتی نظام کو اینکر کرتا ہے۔ کلپ کی لمبائی، ریزولیوشن، موشن ریئلزم، اور کنٹرول ایبلٹی، نیز امیج ٹو ویڈیو اور ایڈیٹنگ ورک فلوز کے ساتھ سخت انضمام میں مسلسل فوائد کی توقع کریں۔ اس کے کھلے وزن کا مطلب ہے کہ غیر منفعتی، محققین، اور چھوٹے اسٹوڈیوز ملکیتی گیٹ کیپنگ کے بغیر فرنٹیئر کلاس ویڈیو جنریشن پر تعمیر کر سکتے ہیں، تخلیقی اور حفاظت پر مرکوز دونوں تجربات کو تیز کر سکتے ہیں۔

حقیقی دنیا کا نفاذ

مکمل طور پر کھلے وزن کا استعمال کرتے ہوئے چینی یا انگریزی پرامپٹ سے مختصر بیانیہ کلپ تیار کرنا

CogVideoX امیج ٹو ویڈیو کے ذریعے ایک ہی اپ لوڈ شدہ اسٹیل امیج کو حرکت پذیر ویڈیو میں تبدیل کرنا

انڈی اینیمیشن کے لیے اپنی مرضی کے انداز یا کردار پر کھلے ماڈل کو ٹھیک کرنا

ری پروڈیکیبل اوپن بیس لائن کے خلاف ویڈیو جنریشن کے نئے طریقوں کو بینچ مارک کرنے والے محققین

خطرات اور گارڈریلز

تصویر کے حقوق اور رضامندی قانونی خطرات بن سکتے ہیں اگر ثبوت واضح نہ ہو۔

ماڈل کی کارکردگی روشنی، ڈیموگرافکس اور ماحول میں مختلف ہو سکتی ہے۔

جب تک اعتماد کی حدوں کی نگرانی نہ کی جائے غلط مثبتات پر کسی کا دھیان نہیں جا سکتا۔

نفاذ کا روڈ میپ

1

درستگی، یاد کرنے، اور غلطی کے اخراجات کے لیے قبولیت کے معیار کی وضاحت کریں۔

2

اعداد و شمار کے ساتھ ٹیسٹ کریں جو حقیقی پیداوار کے حالات سے میل کھاتا ہے۔

3

کم اعتماد یا زیادہ اثر والی پیشین گوئیوں کے لیے انسانی جائزہ شامل کریں۔

4

کیمرہ یا ڈیٹاسیٹ کی تبدیلیوں کے بعد ماڈل ڈرفٹ کو ٹریک کریں اور دوبارہ تصدیق کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CogVideo and CogVideoX quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

InstructPix2Pix انسٹرکشن ایڈیٹنگ

اکثر پوچھے گئے سوالات

What is CogVideo and CogVideoX?

CogVideo (2022) پہلا بڑے پیمانے پر اوپن ٹیکسٹ ٹو ویڈیو ماڈل تھا، اور CogVideoX (2024) Tsinghua/Zhipu AI سے اس کا کہیں زیادہ قابل اوپن سورس جانشین ہے۔ ان کی اہمیت ہے کیونکہ وہ اعلیٰ معیار کی ویڈیو جنریشن کو کھلی برادری کے ہاتھ میں دیتے ہیں، نہ صرف بڑی کارپوریٹ لیبز۔

CogVideo کی 2022 ریلیز کے بارے میں کیا قابل ذکر ہے؟

CogVideo پہلا بڑے پیمانے پر ٹیکسٹ ٹو ویڈیو ماڈل تھا جو کھلے عام جاری کیا گیا، جس میں چینی اور انگریزی دونوں اشارے کی حمایت کی گئی۔

CogVideoX کا 3D causal VAE کیا حاصل کرتا ہے؟

3D causal VAE مقامی اور وقتی دونوں جہتوں میں ویڈیو کو کمپریس کرتا ہے، جس سے ٹوکن کی تعداد کم ہوتی ہے تاکہ ایک ٹرانسفارمر اسے موثر انداز میں ماڈل بنا سکے۔

CogVideoX میں ایکسپرٹ ٹرانسفارمر ٹیکسٹ اور ویڈیو کو کیسے ہینڈل کرتا ہے؟

ایکسپرٹ ٹرانسفارمر متن اور بصری ٹوکنز کو ایک ساتھ اڈاپٹیو نارملائزیشن کے ساتھ فیوز کرتا ہے، فوری اور جنریٹڈ ویڈیو کے درمیان صف بندی کو بہتر بناتا ہے۔

کس گروپ نے CogVideo اور CogVideoX تیار کیا؟

CogVideo خاندان سنگھوا یونیورسٹی اور Zhipu AI سے وابستہ محققین سے آتا ہے۔

ٹیکسٹ ٹو ویڈیو کے علاوہ، CogVideoX کس اضافی صلاحیت کو سپورٹ کرتا ہے؟

CogVideoX ایک اسٹیل امیج (تصویر سے ویڈیو) کو متحرک کرسکتا ہے اور موجودہ کلپس (تسلسل) کو سادہ متن کے اشارے سے آگے بڑھا سکتا ہے۔