بصری AI گائیڈ

میک-اے-ویڈیو ٹیکسٹ ٹو ویڈیو

میک-اے-ویڈیو Meta کا 2022 کا سسٹم ہے جو ٹیکسٹ پرامپٹ کو ایک مختصر ویڈیو کلپ میں بدل دیتا ہے بغیر لیبل والے ٹیکسٹ-ویڈیو جوڑوں کی تربیت کے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It matters because it showed that the visual knowledge inside text-to-image models could be 'taught' to move using only unlabeled video.

گہرا غوطہ

میک-اے-ویڈیو، جس کا اعلان Meta AI نے ستمبر 2022 میں کیا تھا، اس جملے سے چند سیکنڈ کی ویڈیو تیار کرتا ہے جیسے 'ایک کتا سپر ہیرو کیپ پہنے آسمان میں اڑ رہا ہے۔' اس کی کلیدی چال حرکت سے ظاہری شکل کو الگ کرنا ہے: ایک ٹیکسٹ ٹو امیج ماڈل (ایک CLIP طرز کی مشترکہ ٹیکسٹ امیج اسپیس اور ڈفیوژن پر بنایا گیا ہے) یہ سیکھتا ہے کہ اربوں کیپشن والی تصاویر سے چیزیں کیسی نظر آتی ہیں، جبکہ الگ الگ spatiotemporal تہیں یہ سیکھتی ہیں کہ چیزیں صرف بغیر لیبل والی ویڈیو سے کیسے حرکت کرتی ہیں۔ یہ اعلی معیار کے ٹیکسٹ ویڈیو جوڑوں کی کمی کو دور کرتا ہے۔ بیس ماڈل کم ریزولوشن، کم فریم ریٹ کلپس تیار کرتا ہے، پھر وقف شدہ نیٹ ورک اضافی فریموں اور اعلی درجے کی مقامی ریزولوشن کو انٹرپولیٹ کرتا ہے۔ نتیجہ اس کے دور کے لئے حیرت انگیز طور پر ہم آہنگ تھا، حالانکہ کلپس مختصر، دھندلے، اور ٹمٹماہٹ اور وارپنگ کا شکار تھے۔

تکنیکی بصیرت

میک-اے-ویڈیو 2D امیج جنریشن کی تبدیلیوں اور توجہ کو 3D میں چھدم عارضی تہوں کو شامل کرکے بڑھاتا ہے۔ پہلے سے تربیت یافتہ مقامی وزن کو منجمد یا ٹھیک بنایا جاتا ہے جب کہ نئی دنیاوی پرتیں خام ویڈیو سے حرکت سیکھتی ہیں، اس لیے ٹیکسٹ ویڈیو لیبل کی ضرورت نہیں ہے۔ ایک فریم انٹرپولیشن نیٹ ورک پھر ٹائم لائن کو کثافت کرتا ہے اور سپر ریزولوشن ڈفیوژن ماڈیولز مقامی تفصیل کو بڑھاتے ہیں، ایک موٹے 16 فریم، کم ریزولوشن ڈرافٹ کو ایک جھرنے والی پائپ لائن میں ایک ہموار، تیز کلپ میں تبدیل کرتے ہیں۔

اسٹریٹجک اثر

رفتار اور پیمانہ

بصری AI پیمانے پر معائنہ، پتہ لگانے، اور ٹیگنگ کے کاموں کو خودکار کر سکتا ہے۔

Build choices

تخلیقی ٹیمیں کم دستی ترمیم کے ساتھ تصورات کو تیزی سے پروٹو ٹائپ کر سکتی ہیں۔

Team and workflow

آپریشنز امیج اور ویڈیو سگنلز کا استعمال کر سکتے ہیں جن پر کارروائی کرنا پہلے مشکل تھا۔

میک-اے-ویڈیو ٹیکسٹ ٹو ویڈیو کا مستقبل

میک-اے-ویڈیو کی تصویر-پہلے-پلس-غیر لیبل-موشن ترکیب نے پورے متن سے ویڈیو لہر کو سیڈ کیا۔ اس کی اولادیں لمبے، اعلیٰ ریزولوشن، عارضی طور پر مستحکم کلپس پر زور دیتے ہیں جن میں قابل کنٹرول کیمرہ موشن اور آڈیو ہے۔ بنیادی خیال کی توقع کریں، بڑے پیمانے پر امیج کے علم اور سیکھنے کی حرکت کو سستے طریقے سے دوبارہ استعمال کرتے ہوئے، اس وقت بھی برقرار رہے گا جب فن تعمیرات ٹرانسفارمر پر مبنی لیٹنٹ ڈفیوژن اور متحد ماڈلز کی طرف منتقل ہوتے ہیں جو ترمیم اور تسلسل کے لیے تصویر یا ویڈیو کنڈیشنگ کو بھی قبول کرتے ہیں۔

حقیقی دنیا کا نفاذ

کسی ایک وضاحتی جملے کو سوشل میڈیا پوسٹ کے لیے ایک مختصر لوپنگ کلپ میں متحرک کرنا

ایک متحرک مثال کے طور پر 'ایک ٹیڈی بیئر پینٹنگ ایک پورٹریٹ' جیسے جامد تصور کو زندہ کرنا

ایک ہموار منتقلی ویڈیو بنانے کے لیے دو صارف کی طرف سے فراہم کردہ اسٹیل امیجز کے درمیان انٹرپولٹنگ

کسی بھی فلم بندی سے پہلے اسٹوری بورڈنگ کے لیے تصوراتی مناظر کے فوری موشن ڈرافٹ تیار کرنا

خطرات اور گارڈریلز

تصویر کے حقوق اور رضامندی قانونی خطرات بن سکتے ہیں اگر ثبوت واضح نہ ہو۔

ماڈل کی کارکردگی روشنی، ڈیموگرافکس اور ماحول میں مختلف ہو سکتی ہے۔

جب تک اعتماد کی حدوں کی نگرانی نہ کی جائے غلط مثبتات پر کسی کا دھیان نہیں جا سکتا۔

نفاذ کا روڈ میپ

1

درستگی، یاد کرنے، اور غلطی کے اخراجات کے لیے قبولیت کے معیار کی وضاحت کریں۔

2

اعداد و شمار کے ساتھ ٹیسٹ کریں جو حقیقی پیداوار کے حالات سے میل کھاتا ہے۔

3

کم اعتماد یا زیادہ اثر والی پیشین گوئیوں کے لیے انسانی جائزہ شامل کریں۔

4

کیمرہ یا ڈیٹاسیٹ کی تبدیلیوں کے بعد ماڈل ڈرفٹ کو ٹریک کریں اور دوبارہ تصدیق کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Make-A-Video Text-to-Video quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

Sora اور ٹیکسٹ ٹو ویڈیو

اکثر پوچھے گئے سوالات

What is Make-A-Video Text-to-Video?

میک-اے-ویڈیو Meta کا 2022 کا سسٹم ہے جو ٹیکسٹ پرامپٹ کو ایک مختصر ویڈیو کلپ میں بدل دیتا ہے بغیر لیبل والے ٹیکسٹ-ویڈیو جوڑوں کی تربیت کے۔ یہ اہمیت رکھتا ہے کیونکہ اس نے ظاہر کیا کہ ٹیکسٹ ٹو امیج ماڈلز کے اندر موجود بصری علم کو صرف بغیر لیبل والی ویڈیو کا استعمال کرتے ہوئے حرکت کرنا 'سکھایا' جا سکتا ہے۔

مرکزی اختراع کیا تھی جس نے میک-اے-ویڈیو کو لیبل والے ٹیکسٹ-ویڈیو جوڑوں کی ضرورت سے گریز کیا؟

میک-اے-ویڈیو مسئلہ کو دوگنا کرتا ہے: ایک ٹیکسٹ ٹو امیج ماڈل یہ سیکھتا ہے کہ کیپشن والی تصاویر سے چیزیں کیسی نظر آتی ہیں، جب کہ الگ الگ عارضی پرتیں خام، بغیر لیبل والی ویڈیو سے حرکت سیکھتی ہیں۔

میک-اے-ویڈیو تصویری ماڈل میں حرکت کی صلاحیت کیسے شامل کرتا ہے؟

یہ 2D مقامی تبدیلیوں اور توجہ کو نئی عارضی تہوں کے ساتھ بڑھاتا ہے جو یہ سیکھتے ہیں کہ وقت کے ساتھ مواد کیسے بدلتا ہے۔

فریم انٹرپولیشن اور سپر ریزولوشن کے مراحل کیا کرتے ہیں؟

موٹے کم ریزولوشن، کم فریم ریٹ ڈرافٹ کے بعد، انٹرپولیشن فریموں کو جوڑتا ہے اور سپر ریزولوشن ماڈیولز ریزولوشن کو بڑھاتے ہیں۔

میک-اے-ویڈیو کے آؤٹ پٹ کی ایک عام حد کیا تھی؟

کلپس صرف چند سیکنڈ کے تھے، نسبتاً کم ریزولیوشن، اور وقتی ٹمٹماہٹ اور تحریف کا شکار تھے۔