تحويل النص إلى فيديو من فيديو
Make-A-Video هو نظام Meta لعام 2022 الذي يحول المطالبة النصية إلى مقطع فيديو قصير دون التدريب على أزواج نصية وفيديو مصنفة.
نظرة عامة
It matters because it showed that the visual knowledge inside text-to-image models could be 'taught' to move using only unlabeled video.
الغوص العميق
يُنشئ تطبيق Make-A-Video، الذي أعلنت عنه Meta AI في سبتمبر 2022، بضع ثوانٍ من الفيديو من جملة مثل "كلب يرتدي عباءة بطل خارق يطير في السماء". وتتمثل حيلتها الرئيسية في فصل المظهر عن الحركة: يتعلم نموذج تحويل النص إلى صورة (المبني على مساحة وانتشار النص والصورة المشتركة على نمط CLIP) كيف تبدو الأشياء من مليارات الصور الموضحة، بينما تتعلم الطبقات الزمانية المكانية المنفصلة كيف تتحرك الأشياء من الفيديو غير المسمى وحده. وهذا يتجنب ندرة أزواج الفيديو النصية عالية الجودة. ينتج النموذج الأساسي مقاطع ذات دقة منخفضة ومعدل إطارات منخفض، ثم تقوم الشبكات المخصصة باستيفاء الإطارات الإضافية والدقة المكانية العالية. وكانت النتيجة متماسكة بشكل لافت للنظر بالنسبة لعصرها، على الرغم من أن المقاطع كانت قصيرة، وضبابية، وعرضة للوميض والتشويه.
البصيرة الفنية
يقوم Make-A-Video بتوسيع تلافيف توليد الصور ثنائية الأبعاد والاهتمام إلى الأبعاد الثلاثية عن طريق إضافة طبقات مؤقتة زائفة. يتم تجميد الأوزان المكانية المدربة مسبقًا أو ضبطها بدقة بينما تتعلم الطبقات الزمنية الجديدة الحركة من الفيديو الخام، لذلك ليست هناك حاجة إلى تسميات نصية للفيديو. تقوم شبكة استيفاء الإطار بعد ذلك بتكثيف الخط الزمني ووحدات الانتشار فائقة الدقة لرفع التفاصيل المكانية، وتحول مسودة خشنة منخفضة الدقة مكونة من 16 إطارًا إلى مقطع أكثر سلاسة ووضوحًا في خط أنابيب متتالي.
التأثير الاستراتيجي
السرعة والحجم
يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.
خيارات البناء
يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.
الفريق وسير العمل
يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.
مستقبل تحويل النص إلى فيديو من خلال برنامج Make-A-Video
لقد نجحت وصفة Make-A-Video للصورة السابقة بالإضافة إلى الحركة غير المسماة في زرع موجة تحويل النص إلى فيديو بأكملها. يؤكد أحفادها على مقاطع أطول وأكثر دقة ومستقرة مؤقتًا مع حركة الكاميرا والصوت التي يمكن التحكم فيها. نتوقع أن تستمر الفكرة الأساسية، المتمثلة في إعادة استخدام المعرفة الهائلة بالصور وتعلم الحركة بتكلفة زهيدة، حتى مع تحول البنيات نحو الانتشار الكامن القائم على المحولات والنماذج الموحدة التي تقبل أيضًا تكييف الصورة أو الفيديو للتحرير والاستمرار.
التنفيذ في العالم الحقيقي
تحريك جملة وصفية واحدة في مقطع متكرر قصير لمنشور على وسائل التواصل الاجتماعي
إضفاء الحيوية على مفهوم ثابت مثل "دبدوب يرسم صورة شخصية" كرسم توضيحي متحرك
الاستيفاء بين صورتين ثابتتين يقدمهما المستخدم لإنشاء فيديو انتقالي سلس
إنشاء مسودات سريعة الحركة لمشاهد متخيلة للقصص المصورة قبل أي تصوير
المخاطر والدرابزين
يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.
يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.
قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.
خارطة طريق التنفيذ
تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.
اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.
أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.
تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Make-A-Video Text-to-Video quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
Sora وتحويل النص إلى فيديو
الأسئلة المتداولة
What is Make-A-Video Text-to-Video?
Make-A-Video هو نظام Meta لعام 2022 الذي يحول المطالبة النصية إلى مقطع فيديو قصير دون التدريب على أزواج نصية وفيديو مصنفة. إنه مهم لأنه أظهر أن المعرفة المرئية داخل نماذج تحويل النص إلى صورة يمكن "تعليمها" للتحرك باستخدام الفيديو غير المسمى فقط.
ما هو الابتكار المركزي الذي سمح لـ Make-A-Video بتجنب الحاجة إلى أزواج نصية وفيديو مصنفة؟
يقوم برنامج Make-A-Video بفصل المشكلة: يتعلم نموذج تحويل النص إلى صورة كيف تبدو الأشياء من الصور الموضحة، بينما تتعلم الطبقات الزمنية المنفصلة الحركة من الفيديو الخام غير المسمى.
كيف يضيف Make-A-Video إمكانية الحركة إلى نموذج الصورة؟
إنه يوسع التلافيف المكانية ثنائية الأبعاد والاهتمام بطبقات زمنية جديدة تتعلم كيف يتغير المحتوى بمرور الوقت.
ماذا تفعل مراحل استيفاء الإطار والدقة الفائقة؟
بعد مسودة خشنة منخفضة الدقة ومعدل إطارات منخفض، يضيف الاستيفاء إطارات ووحدات فائقة الدقة ترفع الدقة.
ما هو القيد النموذجي لمخرجات Make-A-Video؟
كانت مدة المقاطع بضع ثوانٍ فقط، ودقة منخفضة نسبيًا، وعرضة للوميض الزمني والتشويه.