دليل الأساسيات

نماذج الانتشار

تقوم نماذج الانتشار بتوليد الصور من خلال تعلم عكس عملية التشويش، وتحويل البيانات العشوائية الساكنة إلى صور تفصيلية خطوة بخطوة.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

إنها تعمل على تشغيل أدوات تحويل النص إلى صورة الرائدة اليوم مثل Stable Diffusion، وDALL-E، وMidjourney.

الغوص العميق

يتم تدريب نموذج الانتشار في اتجاهين. في العملية الأمامية، يتم إتلاف الصورة النظيفة تدريجيًا عن طريق إضافة كميات صغيرة من الضوضاء العشوائية حتى تصبح ثابتة تمامًا. ثم يتعلم النموذج العكس: بدءًا من الضوضاء، فإنه يتنبأ ويزيل القليل من الضوضاء في كل خطوة، ويكرر عشرات أو مئات المرات حتى تظهر صورة واضحة. ولجعل هذا الأمر قابلاً للتحكم، يقوم موجه نصي بتوجيه كل خطوة لتقليل الضوضاء، وبالتالي فإن "رائد فضاء يركب حصانًا" يوجه الحركة الثابتة نحو تلك الصورة. تقوم الأنظمة الحديثة مثل Stable Diffusion بتشغيل هذه العملية في مساحة كامنة مضغوطة بدلاً من وحدات البكسل الأولية، مما يجعلها أسرع بكثير. بالمقارنة مع شبكات GAN، تتدرب نماذج الانتشار بشكل أكثر استقرارًا وتنتج تنوعًا أكبر، ولهذا السبب تفوقت على شبكات GAN باعتبارها النهج السائد لتوليد صور عالية الجودة بحلول عام 2022 تقريبًا.

البصيرة الفنية

الحيلة الأساسية هي أن الشبكة لن تضطر أبدًا إلى إنشاء صورة في لقطة واحدة؛ فهو يتعلم فقط التنبؤ بالضوضاء المضافة في خطوة معينة. أثناء التدريب، تتم إضافة كمية معروفة من الضوضاء إلى صورة حقيقية ويطلب من النموذج تقدير تلك الضوضاء؛ الفرق هو خطأ التدريب. في وقت التوليد، يطرح النموذج بشكل متكرر الضوضاء المتوقعة، ويكشف تدريجيًا عن بنيته. يتم إدخال تكييف النص من خلال الانتباه المتبادل، كما تعمل الإرشادات الخالية من المصنفات على تضخيم مدى قوة توجيه الموجه للمخرجات.

التأثير الاستراتيجي

قرارات أوضح

يساعدك على فصل المطالبات الفنية الواضحة عن لغة التسويق.

التكلفة والميزانية

يمكنك طرح أسئلة تنفيذ أفضل قبل إنفاق المال أو الوقت.

الفريق وسير العمل

تتخذ الفرق ذات الفهم المشترك قرارات أفضل بشأن المنتجات والسياسات والتعلم.

مستقبل نماذج الانتشار

الانتشار هو أحدث ما توصلت إليه التكنولوجيا في مجال إنشاء الصور والفيديوهات والصوتيات حاليًا، باستخدام أدوات مثل Sora لتوسيعها لتشمل الحركة. الدافع الكبير هو السرعة: تهدف تقنيات مثل التقطير ونماذج الاتساق إلى تقليل مئات خطوات تقليل الضوضاء إلى حفنة أو حتى خطوة واحدة، مما يتيح التوليد في الوقت الفعلي. توقع أن يتوسع الانتشار ليشمل الأصول ثلاثية الأبعاد، والتصميم العلمي مثل الجزيئات والبروتينات، والتحرير الذي يمكن التحكم فيه بإحكام، بينما يصبح رخيصًا بدرجة كافية لتشغيله على الهواتف.

التنفيذ في العالم الحقيقي

إنشاء عمل فني وصور أصلية من المطالبات النصية في Stable Diffusion وDALL-E وMidjourney

الطلاء الداخلي والطلاء الخارجي، وملء أجزاء من الصورة أو توسيعها بسلاسة

إنشاء فيديو من نص باستخدام أدوات مثل OpenAI's Sora

تصميم جزيئات وهياكل بروتينية جديدة لأبحاث اكتشاف الأدوية

المخاطر والدرابزين

قد تستخدم الفرق المختلفة نفس المصطلح بشكل مختلف، لذا حدد النطاق مبكرًا.

يمكن أن تبدو المعايير قوية بينما يكون الأداء في العالم الحقيقي غير متساوٍ.

غالبًا ما يؤدي تجاهل جودة البيانات وخطط التقييم إلى نتائج هشة.

خارطة طريق التنفيذ

1

ابدأ بتعريف لغة واضحة للنتيجة التي تحتاجها.

2

اختر مقياس نجاح واحد وحالة فشل واحدة قبل الاختبار.

3

قم بتشغيل برنامج تجريبي صغير يحتوي على بيانات تمثيلية، وليس مجموعة تجريبية مصقولة.

4

قم بالتوثيق حيث تساعد نماذج الانتشار وأين تكون الطرق الأبسط أفضل.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

نموذج نشر الإنزلاق

الأسئلة المتداولة

ما هي نماذج الانتشار؟

تقوم نماذج الانتشار بتوليد الصور من خلال تعلم عكس عملية التشويش، وتحويل البيانات العشوائية الساكنة إلى صور تفصيلية خطوة بخطوة. إنها تدعم أدوات تحويل النص إلى صورة الرائدة اليوم مثل Stable Diffusion وDALL-E وMidjourney.

ما هي الفكرة الأساسية وراء كيفية إنشاء نموذج الانتشار للصورة؟

ويتعلم نموذج الانتشار عكس عملية التشويش، بدءًا من الضوضاء النقية وتقليل الضوضاء خطوة بخطوة حتى تظهر صورة واضحة.

أثناء التدريب، ما الذي يتعلمه النموذج فعليًا للتنبؤ به في كل خطوة؟

يتم إعطاء النموذج صورة مشوشة ويتعلم تقدير الضوضاء التي تمت إضافتها، حتى يتمكن لاحقًا من طرح الضوضاء أثناء التوليد.

كيف تؤثر المطالبة النصية على الصورة التي تم إنشاؤها؟

يعمل تكييف النص (من خلال الانتباه والتوجيه) على دفع كل خطوة لتقليل الضوضاء بحيث تتطابق الصورة الناشئة مع الموجه.

لماذا يقوم Stable Diffusion بتشغيل العملية في "مساحة كامنة"؟

يؤدي التشغيل في مساحة كامنة مضغوطة بدلاً من وحدات البكسل ذات الدقة الكاملة إلى تقليل العمليات الحسابية بشكل كبير مع الحفاظ على الجودة.

ما هي الميزة الرئيسية لنماذج الانتشار عبر شبكات GAN؟

تتجنب نماذج الانتشار لعبة الخصومة غير المستقرة وانهيار الوضع في شبكات GAN، مما يؤدي إلى تدريب أكثر موثوقية وتنوع أكبر في المخرجات.