نماذج الانتشار الكامن
تعمل نماذج الانتشار الكامنة على إنشاء صور عن طريق تشغيل عملية الانتشار في مساحة كامنة مضغوطة بدلاً من وحدات البكسل الأولية، مما يؤدي إلى خفض تكاليف الحوسبة.
نظرة عامة
They are the engine behind Stable Diffusion and most modern open-source image generators.
الغوص العميق
يتعلم نموذج الانتشار القياسي عكس عملية التشويش: فهو يبدأ من ضوضاء نقية ويتحول تدريجيًا إلى صورة. يعد القيام بذلك مباشرة على وحدات البكسل أمرًا مكلفًا لأن الصورة مقاس 512 × 512 تحتوي على مئات الآلاف من القيم. يستخدم الانتشار الكامن، الذي قدمه رومباخ وزملاؤه في عام 2022، لأول مرة أداة التشفير التلقائي المتغيرة المدربة مسبقًا (VAE) لضغط الصورة في شبكة كامنة صغيرة (غالبًا 64 × 64 × 4، أصغر بمقدار 48 مرة تقريبًا). تتعلم شبكة U-Net الانتشار بعد ذلك تقليل الضوضاء داخل تلك المساحة الكامنة المدمجة، مسترشدة بالنص عبر الانتباه المتبادل. وأخيرًا، يقوم جهاز فك ترميز VAE بإعادة بناء وحدات البكسل ذات الدقة الكاملة. يحافظ هذا الضغط الإدراكي على المعلومات ذات المعنى الدلالي مع التخلص من التفاصيل غير المحسوسة، مما يجعل الإنتاج عالي الجودة ممكنًا على وحدات معالجة الرسومات الاستهلاكية.
البصيرة الفنية
الحيلة الأساسية هي فصل الضغط الإدراكي عن النمذجة التوليدية. يعالج VAE تفاصيل البكسل عالية التردد مرة واحدة، بينما تقوم U-Net فقط بنمذجة التوزيع الكامن ذي الأبعاد المنخفضة. يتم إدخال تكييف النص من خلال طبقات الانتباه المتبادل، حيث تهتم الميزات المكانية لـ U-Net بتضمين الرمز المميز من برنامج تشفير النص مثل CLIP. ونظرًا لأن العناصر الكامنة أصغر بحوالي 48 مرة من وحدات البكسل، فإن كل خطوة لتقليل الضوضاء تكون أرخص بشكل كبير في كل من الذاكرة وFLOPs.
التأثير الاستراتيجي
السرعة والحجم
يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.
خيارات البناء
يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.
الفريق وسير العمل
يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.
مستقبل نماذج الانتشار الكامنة
يتوسع الانتشار الكامن إلى ما هو أبعد من الصور إلى الفيديو (Stable Video Diffusion)، والأصول ثلاثية الأبعاد، والرسومات الطيفية الصوتية، وكلها تستخدم نفس وصفة الضغط ثم تقليل الضوضاء. تتجه الأبحاث نحو خطوات أقل لأخذ العينات من خلال نماذج التقطير والاتساق، وVAEs أفضل التي تحافظ على النصوص والوجوه الدقيقة، وتركيبات التدفق المصحح مثل تلك الموجودة في Stable Diffusion 3 التي تعمل على تقويم مسار التوليد للحصول على نتائج أسرع وأكثر وضوحًا.
التنفيذ في العالم الحقيقي
يقوم التوزيع المستقر بإنشاء تصميمات فنية ومفاهيمية من خلال مطالبات نصية على وحدة معالجة الرسومات (GPU) الخاصة بالمستهلك الواحد
يعمل Adobe وCanva على تشغيل ميزات تحويل النص إلى صورة والتعبئة التوليدية المبنية على أساسات النشر الكامنة
تنتج استوديوهات الألعاب خرائط نسيجية، ونقوشًا متحركة، وفن مفهوم البيئة لتسريع مرحلة ما قبل الإنتاج
تقوم فرق الصور المخزنة والتسويق بإنشاء نماذج بالحجم الطبيعي للمنتجات ذات العلامة التجارية ومرئيات إعلانية بدون التقاط صور
المخاطر والدرابزين
يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.
يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.
قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.
خارطة طريق التنفيذ
تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.
اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.
أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.
تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Latent Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
نماذج انتشار الفيديو
الأسئلة المتداولة
What is Latent Diffusion Models?
تعمل نماذج الانتشار الكامنة على إنشاء صور عن طريق تشغيل عملية الانتشار في مساحة كامنة مضغوطة بدلاً من وحدات البكسل الأولية، مما يؤدي إلى خفض تكاليف الحوسبة. إنهم المحرك وراء Stable Diffusion ومعظم مولدات الصور الحديثة مفتوحة المصدر.
ما هو الابتكار الرئيسي لنماذج الانتشار الكامن مقارنة بانتشار مساحة البكسل؟
يقوم الانتشار الكامن بضغط الصور في مساحة كامنة أصغر باستخدام VAE، وبالتالي يحدث تقليل التشويش الباهظ الثمن على قيم أقل بكثير من وحدات البكسل الكاملة.
ما المكون الذي يضغط الصورة في الفضاء الكامن ويعيد بنائها بعد ذلك؟
يقوم VAE المُدرب مسبقًا بتشفير الصورة إلى شبكة كامنة مدمجة ويقوم جهاز فك التشفير الخاص بها بإعادة بناء وحدات البكسل ذات الدقة الكاملة في النهاية.
كيف يتم عادةً حقن النص في شبكة U-Net التي تقلل الضوضاء في حالة الانتشار الكامن؟
يتم إدخال تضمينات الرمز المميز من أداة تشفير النص في طبقات الانتباه المتبادل، مما يسمح للميزات المكانية بالاهتمام بالمطالبة.
لماذا يعمل العمل في الفضاء الكامن على تقليل التكلفة الحسابية؟
انتظر - السبب الصحيح هو أن الشبكة الكامنة أصغر بكثير (غالبًا ~ 48x) من صورة البكسل، لذلك تحتاج كل خطوة تقليل الضوضاء إلى عدد أقل بكثير من FLOPs والذاكرة.
ما هو النموذج مفتوح المصدر المستخدم على نطاق واسع والذي شاع الانتشار الكامن؟
جلب الانتشار المستقر، الذي تم إصداره في عام 2022، الانتشار الكامن للأجهزة الاستهلاكية والاعتماد الشامل.