محولات الانتشار
تقوم محولات الانتشار (DiTs) بتبديل شبكة U-Net التلافيفية في قلب مولدات الصور والفيديو للحصول على العمود الفقري للمحول.
نظرة عامة
تعمل هذه البنية على تشغيل أنظمة رائدة مثل Stable Diffusion 3 وOpenAI's Sora، وتتطور بشكل ملحوظ عند إضافة الحوسبة.
الغوص العميق
تولد نماذج الانتشار الصور عن طريق البدء من الضوضاء النقية وتقليل الضوضاء بشكل متكرر إلى صورة متماسكة. لسنوات عديدة، كانت الشبكة التي تقوم بهذا التقليل من الضوضاء عبارة عن شبكة U-Net، وهي عبارة عن بنية تلافيفية. محول الانتشار، الذي قدمه Peebles وXie في عام 2022، يستبدل U-Net بمحول. يتم ضغط الصورة أولاً في مساحة كامنة، ثم يتم تقسيمها إلى بقع صغيرة، وتصبح كل رقعة رمزًا مميزًا، تشبه إلى حد كبير الكلمات في نموذج اللغة. يقوم المحول بعد ذلك بمعالجة هذه الرموز المميزة مع الاهتمام الذاتي في كل خطوة لتقليل الضوضاء. وكان أحد النتائج الرئيسية هو أن أداء DiT يتحسن بشكل متوقع مع زيادة حجم النموذج وتقليل حجم التصحيح، وذلك باتباع قوانين القياس النظيف. إن قابلية التوسع هذه هي السبب وراء انتقال أنظمة تحويل النص إلى فيديو وأنظمة تحويل النص إلى صورة المتطورة إلى حد كبير إلى العمود الفقري للمحول.
البصيرة الفنية
الابتكار الأساسي هو كيفية قيام DiTs بحقن التكييف مثل الخطوة الزمنية والمطالبة النصية. بدلاً من التسلسل البسيط، يستخدمون تسوية الطبقة التكيفية (adaLN)، حيث تتنبأ الشبكة بمعلمات القياس والتحول لطبقات التسوية من إشارة التكييف. يقوم متغير adaLN-zero بتهيئة هذه العناصر بحيث تبدأ كل كتلة كوظيفة هوية، مما يؤدي إلى استقرار التدريب. يتم تسوية التصحيحات وتحويلها إلى رموز، وتتم معالجتها بواسطة كتل المحولات القياسية مع الاهتمام الذاتي، ثم يتم إعادة تجميعها وفك تشفيرها مرة أخرى إلى وحدات بكسل.
التأثير الاستراتيجي
السرعة والحجم
يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.
خيارات البناء
يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.
الفريق وسير العمل
يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.
مستقبل محولات الانتشار
أصبحت محولات الانتشار هي العمود الفقري الافتراضي للوسائط التوليدية. إن تصميمها القائم على الرمز المميز يجعلها طبيعية لتوحيد الصور والفيديو وحتى إنشاء الوسائط المتعددة ضمن بنية واحدة قابلة للتطوير. تتجه الأبحاث نحو مقاطع فيديو أطول ودقة أعلى واهتمام أكثر كفاءة لترويض التكلفة التربيعية للعديد من الرموز المميزة. توقع التقارب بين نماذج اللغة والرؤية، حيث تخدم وصفات قياس المحولات المماثلة والبنية التحتية كلاهما، مما يؤدي إلى تسريع التقدم في النماذج العالمية والفيديو التفاعلي.
التنفيذ في العالم الحقيقي
يستخدم OpenAI's Sora العمود الفقري للمحول عبر تصحيحات الزمكان لإنشاء مقاطع فيديو عالية الدقة مدتها دقيقة من المطالبات النصية.
يستخدم Stable Diffusion 3 محول الانتشار متعدد الوسائط (MMDiT) لمحاذاة الصور التي تم إنشاؤها بشكل أفضل مع الأوصاف النصية التفصيلية.
يقوم الباحثون بقياس DiT إلى مليارات المعلمات ويلاحظون تحسن جودة الصورة بشكل يمكن التنبؤ به، مما يؤدي إلى توجيه قرارات ميزانية الحوسبة.
يستخدم الاستوديو نموذجًا قائمًا على DiT لتمديد المقاطع القصيرة، ومعالجة إطارات الفيديو الإضافية كرموز تصحيح إضافية لتقليل الضوضاء.
المخاطر والدرابزين
يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.
يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.
قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.
خارطة طريق التنفيذ
تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.
اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.
أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.
تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
شبكات المحولات المكانية
الأسئلة المتداولة
ما هي محولات الانتشار؟
تقوم محولات الانتشار (DiTs) بتبديل شبكة U-Net التلافيفية في قلب مولدات الصور والفيديو للحصول على العمود الفقري للمحول. تعمل هذه البنية على تشغيل أنظمة رائدة مثل Stable Diffusion 3 وOpenAI's Sora، وتتدرج بشكل ملحوظ عند إضافة الحوسبة.
ما هو المكون الذي يحل محله محول الانتشار مقارنة بنماذج الانتشار التقليدية؟
تستبدل DiTs شبكة U-Net، وهي الشبكة التلافيفية التي تؤدي عملية تقليل الضوضاء، بعمود فقري للمحول.
كيف يقوم DiT بتحويل الصورة إلى شيء يمكن للمحول معالجته؟
وتنقسم الصورة الكامنة إلى بقع صغيرة، وتصبح كل رقعة رمزًا، مشابهًا للكلمات في نموذج اللغة.
ماذا وجدت ورقة DiT الأصلية حول القياس؟
تتحسن جودة DiT بطريقة نظيفة ويمكن التنبؤ بها حيث تقوم بزيادة حوسبة النموذج واستخدام تصحيحات أصغر، باتباع قوانين القياس.
كيف تقوم DiTs عادةً بحقن التكييف مثل الخطوة الزمنية والمطالبة النصية؟
تستخدم DiTs تطبيع الطبقة التكيفية للتنبؤ بمعلمات الحجم والتحول لطبقات التطبيع من إشارة التكييف.
ما الذي تحققه عملية التهيئة "adaLN-zero"؟
يقوم adaLN-zero بتهيئة التعديل بحيث تعمل كل كتلة في البداية كهوية، مما يؤدي إلى استقرار التدريب وتحسينه.