دليل الذكاء الاصطناعي المرئي

Imagen Video Cascades

Imagen Video هو نظام تحويل النص إلى فيديو لعام 2022 من Google والذي يقوم بإنشاء مقطع من خلال سلسلة من سبعة نماذج نشر، يضيف كل منها المزيد من الإطارات أو المزيد من الدقة.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters because it showed how stacking specialized stages can produce high-definition, temporally smooth video from a single prompt.

الغوص العميق

يعمل Imagen Video، الذي قدمته Google بحثًا في أكتوبر 2022، على توسيع نهج Imagen لتحويل النص إلى صورة في الحركة. يقوم برنامج تشفير النص T5 المجمد بتحويل المطالبة إلى تضمينات لغة غنية تحدد كل مرحلة. يقوم نموذج الانتشار الأساسي أولاً بإنشاء فيديو صغير منخفض معدل الإطارات، ثم سلسلة من ستة نماذج نشر أخرى تؤدي بالتناوب دقة فائقة زمنية (إضافة إطارات بين الإطارات الموجودة) ودقة مكانية فائقة (زيادة دقة البكسل). يُخرج المسار الكامل فيديو بدقة 1280 × 768 تقريبًا بمعدل 24 إطارًا في الثانية، وطوله عدة ثوانٍ. نظرًا لأن الفهم العميق للغة موجود في برنامج تشفير النص، يمكن لـ Imagen Video تقديم نص منسق بشكل واضح وجماليات فنية متنوعة وحركة كائن ثلاثية الأبعاد، مما يوضح أن التدريج الدقيق يدق محاولة القيام بكل شيء في نموذج واحد عملاق.

البصيرة الفنية

يقسم التتالي جيلًا صعبًا للغاية من طلقة واحدة إلى مشكلات فرعية يمكن التحكم فيها. سبعة نماذج انتشار تعمل بالتسلسل: مولد أساسي واحد بالإضافة إلى ثلاثة نماذج مكانية وثلاثة نماذج زمنية فائقة الدقة. كل منها مشروط بالتضمين الفوري ومخرجات المرحلة السابقة. تعمل تقنيات مثل تحديد معلمات التنبؤ v والتقطير التدريجي على تسريع عملية أخذ العينات، بينما يعمل التوجيه الخالي من المصنف على تعزيز الالتزام الفوري عبر كل مرحلة من مراحل السلسلة.

التأثير الاستراتيجي

السرعة والحجم

يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.

خيارات البناء

يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.

الفريق وسير العمل

يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.

مستقبل Imagen Video Cascades

أثبتت خطوط أنابيب مساحة البكسل المتتالية هذا المفهوم ولكنها ثقيلة الحوسبة وبطيئة. لقد تحول هذا المجال إلى حد كبير نحو الانتشار الكامن والأعمدة الأساسية للمحولات التي تولد في مساحة مضغوطة، مما يقلل التكلفة مع الحفاظ على الجودة. ومع ذلك، فإن درس Imagen Video، الذي يفصل بين وظائف "ماذا" و"كيف يتحرك" و"مدى حدة"، يستمر في إعلام التصميمات متعددة المراحل والتحسينات، كما أثر أسلوب تكييف T5 الخاص به على المولدات عالية الدقة اللاحقة والمخلصة للنص.

التنفيذ في العالم الحقيقي

إنتاج مقطع عالي الوضوح مع نص منمق ومقروء على الشاشة من خلال المطالبة

عرض نفس المشهد الموصوف في أنماط فنية متعددة، من الألوان المائية إلى الطين

إنشاء رسوم متحركة قصيرة للكائنات ثلاثية الأبعاد مثل المنحوتات الدوارة والمتحركة

إنشاء مقاطع تسويقية أو مقاطع مفاهيمية سلسة بمعدل 24 إطارًا في الثانية مباشرةً من وصف مكتوب

المخاطر والدرابزين

يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.

يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.

قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.

خارطة طريق التنفيذ

1

تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.

2

اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.

3

أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.

4

تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Imagen Video Cascades quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

Sora وتحويل النص إلى فيديو

الأسئلة المتداولة

What is Imagen Video Cascades?

Imagen Video هو نظام تحويل النص إلى فيديو لعام 2022 من Google والذي يقوم بإنشاء مقطع من خلال سلسلة من سبعة نماذج نشر، يضيف كل منها المزيد من الإطارات أو المزيد من الدقة. إنه أمر مهم لأنه أظهر كيف يمكن لتكديس المراحل المتخصصة إنتاج فيديو عالي الدقة وسلس مؤقتًا من موجه واحد.

كم عدد نماذج الانتشار التي تشكل سلسلة Imagen Video؟

يستخدم Imagen Video سبعة نماذج انتشار: مولد أساسي واحد بالإضافة إلى ثلاثة نماذج مكانية وثلاثة نماذج زمنية فائقة الدقة.

ماذا تفعل مرحلة الدقة الفائقة الزمنية في السلسلة؟

تعمل الدقة الفائقة الزمنية على استيفاء إطارات إضافية لرفع معدل الإطارات، بينما تعمل الدقة الفائقة المكانية على رفع دقة البكسل.

ما هو المكون الذي يقوم بتشفير المطالبة النصية في Imagen Video؟

يستخدم Imagen Video، مثل Imagen، برنامج تشفير نص T5 كبير الحجم لإنتاج التضمينات التي تحدد كل مرحلة نشر.

لماذا تقسيم الجيل إلى سلسلة متتالية بدلاً من نموذج واحد كبير؟

تقوم كل مرحلة بحل مهمة أضيق، أو إنشاء مسودة خشنة، أو إضافة إطارات، أو إضافة دقة وضوح، وهو أمر أكثر سهولة من القيام بكل شيء مرة واحدة.

ما هي القدرة التي أظهرها Imagen Video بشكل خاص؟

بفضل فهمه القوي للنص T5، يمكن لـ Imagen Video تقديم نص منسق قابل للقراءة ومجموعة واسعة من الجماليات الفنية.