دليل الذكاء الاصطناعي المرئي

Stable Diffusion

Stable Diffusion هو نموذج مفتوح المصدر لتحويل النص إلى صورة، تم إصداره بواسطة Stability AI في عام 2022، والذي يقوم بإنشاء صور عن طريق إزالة الضوضاء تدريجيًا من نقطة بداية عشوائية.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

Being open and runnable on consumer GPUs, it sparked a massive community of tools, fine-tunes, and apps.

الغوص العميق

تتعلم نماذج الانتشار عكس عملية الضوضاء. أثناء التدريب، تتم إضافة ضوضاء عشوائية للصور الحقيقية خطوة بخطوة حتى تصبح ثابتة؛ يتعلم النموذج التنبؤ بهذه الضوضاء وطرحها. للتوليد، يبدأ من الضوضاء النقية ويقلل الضوضاء بشكل متكرر حتى تظهر صورة متماسكة، مسترشدة بالمطالبة النصية الخاصة بك. إن خدعة الكفاءة الرئيسية لـ Stable Diffusion هي الجزء "الكامن": فبدلاً من العمل على وحدات بكسل كاملة الدقة، تقوم بضغط الصور في مساحة كامنة أصغر باستخدام جهاز تشفير تلقائي متغير، وتشغيل تقليل التشويش البطيء هناك، ثم فك التشفير مرة أخرى إلى وحدات بكسل. ولهذا السبب يمكن تشغيله على وحدة معالجة رسومات الألعاب النموذجية بدلاً من مركز البيانات. يقوم برنامج تشفير النص (CLIP في الإصدارات القديمة) بتحويل مطالبتك إلى إرشاد، وتقوم شبكة U-Net بتقليل الضوضاء. مكّنت أوزانها المفتوحة ControlNet وLoRA من الضبط الدقيق وعدد لا يحصى من الأدوات الإبداعية.

البصيرة الفنية

الانتشار المستقر هو نموذج انتشار كامن. يعمل جهاز التشفير التلقائي على تقليص الصورة مقاس 512 × 512 إلى شبكة كامنة مدمجة، مما يؤدي إلى قطع العمليات الحسابية بشكل كبير. يتم تدريب شبكة U-Net على التنبؤ بالضوضاء المضافة في كل خطوة زمنية، بشرط تضمين النص عبر الانتباه المتبادل. تتيح لك الإرشادات الخالية من المصنفات تحديد مدى قوة اتباع الصورة للموجه عن طريق مزج التنبؤات المشروطة وغير المشروطة. عند الاستدلال، يأخذ جهاز أخذ العينات (مثل DDIM أو Euler) عددًا مختارًا من خطوات تقليل الضوضاء؛ المزيد من الخطوات تعني عمومًا نتائج أنظف على حساب السرعة.

التأثير الاستراتيجي

السرعة والحجم

يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.

خيارات البناء

يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.

الفريق وسير العمل

يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.

مستقبل الانتشار المستقر

يستمر النظام البيئي المفتوح في التسارع: تعمل البنى الأحدث (بما في ذلك الانتشار المعتمد على المحولات وأخذ العينات الأسرع في خطوات قليلة أو المقطرة) على خفض عملية التوليد من عشرات الخطوات إلى خطوة واحدة أو اثنتين، مما يتيح الإنشاء في الوقت الفعلي تقريبًا. توقع عرضًا أقوى للنص، والتزامًا سريعًا أفضل، وتحريرًا سلسًا للصور، بالإضافة إلى ملحقات الفيديو وثلاثية الأبعاد. ستستمر الأوزان المفتوحة في تعزيز الضبط الدقيق المتخصص، ولكنها تزيد أيضًا من حدة المناقشات حول الموافقة على بيانات التدريب، والتزييف العميق، والعلامات المائية، لذلك ستنمو أدوات الكشف والمصدر جنبًا إلى جنب مع النماذج.

التنفيذ في العالم الحقيقي

يقوم الفنانون والهواة بإنشاء مفهوم فني ورسوم توضيحية محليًا على وحدة معالجة الرسومات الخاصة بهم باستخدام إعدادات LoRA الدقيقة المخصصة

استخدام ControlNet لتقييد جيل بهيكل عظمي أو خريطة عمق أو رسم حافة للحصول على تكوين دقيق

Inpainting وoutpainting لتحرير الصور أو إزالة الكائنات أو توسيع المشهد خارج حدوده الأصلية

تقوم استوديوهات الألعاب المستقلة والمصممون بإنتاج الزخارف واللوحات المزاجية وتنوعات الأصول بسرعة وبتكلفة زهيدة

المخاطر والدرابزين

يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.

يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.

قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.

خارطة طريق التنفيذ

1

تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.

2

اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.

3

أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.

4

تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stable Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

نشر الفيديو مستقر

الأسئلة المتداولة

What is Stable Diffusion?

Stable Diffusion هو نموذج مفتوح المصدر لتحويل النص إلى صورة، تم إصداره بواسطة Stability AI في عام 2022، والذي يقوم بإنشاء صور عن طريق إزالة الضوضاء تدريجيًا من نقطة بداية عشوائية. نظرًا لكونه مفتوحًا وقابلاً للتشغيل على وحدات معالجة الرسومات الاستهلاكية، فقد أدى إلى ظهور مجتمع ضخم من الأدوات والضبط الدقيق والتطبيقات.

على مستوى عالٍ، كيف يقوم نموذج الانتشار بإنشاء صورة؟

تتعلم نماذج الانتشار عكس عملية التشويش: بدءًا من الضوضاء، فإنها تقلل الضوضاء بشكل متكرر حتى تظهر صورة متماسكة.

ما الذي يجعل Stable Diffusion فعالاً بما يكفي للتشغيل على وحدة معالجة الرسومات الخاصة بالمستهلك؟

يعد Stable Diffusion نموذج نشر كامن: يقوم جهاز التشفير التلقائي بضغط الصور بحيث يعمل تقليل الضوضاء الشديد في مساحة كامنة أصغر.

كيف يؤثر النص الخاص بك على الصورة التي تم إنشاؤها؟

يقوم برنامج تشفير النص بتحويل المطالبة إلى تضمينات تعمل على تكييف شبكة U-Net من خلال الانتباه المتبادل وتوجيه النتيجة.

ما الذي يتيح لك التوجيه الخالي من المصنفات التحكم فيه؟

يمزج التوجيه الخالي من المصنف بين التنبؤات المشروطة وغير المشروطة، مما يتيح لك رفع الالتزام الفوري لأعلى أو لأسفل.

لماذا أثار Stable Diffusion نظامًا بيئيًا كبيرًا من الأدوات مثل ControlNet وLoRA؟

تتيح الأوزان المفتوحة للمجتمع ضبط النموذج وتوسيعه، وإنتاج إضافات مثل ControlNet ومحولات LoRA خفيفة الوزن.