CogVideo وCogVideoX
كان CogVideo (2022) أول نموذج مفتوح واسع النطاق لتحويل النص إلى فيديو، وCogVideoX (2024) هو خليفته مفتوح المصدر الأكثر قدرة بكثير من Tsinghua/Zhipu AI.
نظرة عامة
They matter because they put high-quality video generation into the hands of the open community, not just big corporate labs.
الغوص العميق
CogVideo، الذي تم إصداره في عام 2022، مبني على محول النص إلى صورة CogView2 واستخدم نهج الانحدار التلقائي بمعدل إطارات متعدد لإنشاء مقاطع قصيرة، ليصبح أول نموذج كبير لتحويل النص إلى فيديو تم إصداره بشكل مفتوح ويدعم المطالبات الصينية والإنجليزية. إن خليفته لعام 2024، CogVideoX، عبارة عن إعادة تصميم كاملة: فهو يستخدم أداة تشفير تلقائية تباينية سببية ثلاثية الأبعاد لضغط الفيديو في كل من المكان والزمان، ثم محول خبير بهدف نشر يعتني بشكل مشترك برموز النص والفيديو المدمجة معًا. تولد نماذج CogVideoX (بأحجام مثل معلمات 2B و5B) عدة ثوانٍ من الفيديو المتماسك عالي الحركة بدقة مثل 720 × 480 وتدعم استمرارية الصورة إلى الفيديو والفيديو. والأهم من ذلك، أن الأوزان والأكواد متاحة للعامة، مما يغذي موجة من التعديلات والأدوات والأبحاث المجتمعية.
البصيرة الفنية
يعمل VAE السببي ثلاثي الأبعاد الخاص بـ CogVideoX على تقليص حجم الفيديو الخام إلى حجم كامن مضغوط، مما يؤدي إلى خفض عدد الرموز المميزة حتى يتمكن المحول من تصميم تسلسلات طويلة بتكلفة معقولة. يقوم برنامج Expert Transformer بتطبيق معيار الطبقة التكيفية ويقوم بتسلسل الرموز النصية والمرئية بحيث تتفاعل الطريقتان مع بعضهما البعض مباشرة، مما يؤدي إلى تحسين محاذاة النص والفيديو. التدريب التدريجي على زيادة الدقة والمدد، بالإضافة إلى التسميات التوضيحية الدقيقة للبيانات، يؤدي إلى حركة أكثر سلاسة وإخلاصًا لغويًا.
التأثير الاستراتيجي
السرعة والحجم
يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.
خيارات البناء
يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.
الفريق وسير العمل
يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.
مستقبل CogVideo وCogVideoX
باعتباره واحدًا من أقوى نماذج الفيديو المفتوحة، يقوم CogVideoX بتثبيت نظام بيئي سريع النمو من الضبط الدقيق ومحولات التحكم والامتدادات طويلة الأمد. توقع استمرار المكاسب في طول المقطع، والدقة، وواقعية الحركة، وإمكانية التحكم، بالإضافة إلى تكامل أكثر إحكامًا مع سير عمل التحويل من صورة إلى فيديو وتحريرها. تعني أوزانها المفتوحة أن المنظمات غير الربحية والباحثين والاستوديوهات الصغيرة يمكنها البناء على توليد فيديو من الدرجة الأولى دون مراقبة بوابة الملكية، مما يؤدي إلى تسريع التجارب الإبداعية التي تركز على السلامة.
التنفيذ في العالم الحقيقي
إنشاء مقطع روائي قصير من موجه صيني أو إنجليزي باستخدام الأوزان المفتوحة بالكامل
تحويل صورة ثابتة واحدة تم تحميلها إلى فيديو متحرك عبر CogVideoX من صورة إلى فيديو
ضبط النموذج المفتوح على نمط أو شخصية مخصصة للرسوم المتحركة المستقلة
يقوم الباحثون بقياس طرق إنتاج الفيديو الجديدة مقابل خط أساس مفتوح قابل للتكرار
المخاطر والدرابزين
يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.
يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.
قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.
خارطة طريق التنفيذ
تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.
اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.
أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.
تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the CogVideo and CogVideoX quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
تحرير التعليمات InstructPix2Pix
الأسئلة المتداولة
What is CogVideo and CogVideoX?
كان CogVideo (2022) أول نموذج مفتوح واسع النطاق لتحويل النص إلى فيديو، وCogVideoX (2024) هو خليفته مفتوح المصدر الأكثر قدرة بكثير من Tsinghua/Zhipu AI. إنها مهمة لأنها تضع إنتاج الفيديو عالي الجودة في أيدي المجتمع المفتوح، وليس فقط مختبرات الشركات الكبرى.
ما الذي يميز إصدار CogVideo لعام 2022؟
كان CogVideo أول نموذج واسع النطاق لتحويل النص إلى فيديو تم إصداره بشكل مفتوح، ويدعم المطالبات الصينية والإنجليزية.
ما الذي يحققه VAE السببي ثلاثي الأبعاد لـ CogVideoX؟
يقوم VAE السببي ثلاثي الأبعاد بضغط الفيديو عبر الأبعاد المكانية والزمانية، مما يقلل من عدد الرموز المميزة حتى يتمكن المحول من تصميمه بكفاءة.
كيف يتعامل Expert Transformer في CogVideoX مع النص والفيديو؟
يقوم برنامج Expert Transformer بدمج الرموز النصية والمرئية مع التطبيع التكيفي، مما يحسن التوافق بين الفيديو الفوري والمولد.
ما هي المجموعة التي قامت بتطوير CogVideo وCogVideoX؟
تأتي عائلة CogVideo من باحثين مرتبطين بجامعة Tsinghua وZhipu AI.
إلى جانب تحويل النص إلى فيديو، ما هي الإمكانية الإضافية التي يدعمها CogVideoX؟
يستطيع CogVideoX تحريك الصورة الثابتة (صورة إلى فيديو) وتوسيع المقاطع الموجودة (مواصلة)، بما يتجاوز مطالبات النص العادي.