دليل الذكاء الاصطناعي المرئي

نماذج الاتساق الكامن

نماذج الاتساق الكامن (LCMs) هي تقنية تتيح لمولدات الصور المنتشرة إنتاج صور عالية الجودة في خطوة واحدة إلى أربع خطوات فقط بدلاً من العشرات المعتادة.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

They make near-real-time, interactive image generation practical even on modest hardware.

الغوص العميق

تبدأ نماذج الانتشار الكامن القياسية مثل Stable Diffusion من الضوضاء وتقليل الضوضاء بشكل متكرر، وغالبًا ما تحتاج إلى 20 إلى 50 تقييمًا للشبكة لإنشاء صورة واحدة، وهو أمر بطيء. تطبق LCMs، التي قدمها لوه وزملاؤه في عام 2023، التقطير المتسق في الفضاء الكامن لنموذج الانتشار المُدرب مسبقًا. الفكرة الرئيسية: تدريب شبكة من الطلاب على القفز مباشرة إلى النتيجة النظيفة من أي نقطة على طول مسار تقليل الضوضاء، بحيث يتم الوصول إلى نفس الإجابة في خطوة واحدة كبيرة كانت تتطلب في السابق العديد من الخطوات الصغيرة. والنتيجة هي صور حادة في 1 إلى 4 خطوات تقريبًا. تعمل التقنية المصاحبة، LCM-LoRA، على حزم هذا التسريع كمحول إضافي صغير يمكن إسقاطه على نماذج Stable Diffusion الحالية المضبوطة بدقة دون إعادة تدريب الشبكة بأكملها.

البصيرة الفنية

تفرض نماذج الاتساق خاصية "الاتساق الذاتي": أي نقطتين على نفس مسار تقليل الضوضاء (مسار ODE للتدفق الاحتمالي) يجب أن يتم تعيينهما لنفس الصورة النهائية النظيفة. يتم استخلاص الطالب من نموذج نشر المعلم لتلبية ذلك، وتعلم التنبؤ بنقطة نهاية المسار مباشرة. إن العمل في المساحة الكامنة المضغوطة بدلاً من البكسلات يجعل التقطير رخيصًا. ونظرًا لأن تقييمًا واحدًا يمكن أن يقفز عبر المسار، فإن أخذ العينات التكرارية الثقيلة ينهار إلى عدد قليل من الخطوات.

التأثير الاستراتيجي

السرعة والحجم

يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.

خيارات البناء

يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.

الفريق وسير العمل

يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.

مستقبل نماذج الاتساق الكامن

أصبح الآن الجيل قليل الخطوات هو الاتجاه السائد، مع خلفاء مثل SDXL-Turbo، وتحسينات LCM، وطرق التقطير التنافسي التي تدفع الجودة بخطوة أو خطوتين. توقع أن يؤدي ذلك إلى تشغيل تحرير الصور المباشر باستخدام الفرشاة أثناء التنقل، وإنشاء إطارات الفيديو في الوقت الفعلي، والتوليد على الجهاز على الهواتف. تعمل الحدود على سد فجوة الجودة الصغيرة من خلال النشر الكامل متعدد الخطوات وتوسيع نطاق التقطير المتسق ليشمل الفيديو وثلاثي الأبعاد، حيث يكون التوفير الناتج عن قطع عدد الخطوات أكثر دراماتيكية.

التنفيذ في العالم الحقيقي

أدوات اللوحة في الوقت الفعلي التي تعمل على تحديث الصورة التي تم إنشاؤها أثناء الكتابة أو الرسم، مع تأخر قريب من الصفر

تشغيل إنشاء صور Stable Diffusion على جهاز كمبيوتر محمول أو وحدة معالجة رسومات الهاتف في جزء من الثانية

إسقاط محول LCM-LoRA على نموذج موجود تم ضبطه بدقة لتسريعه على الفور دون إعادة التدريب

إنشاء مجموعات كبيرة من الصور بتكلفة زهيدة لاستكشاف التصميم عن طريق قطع الخطوات من ~30 إلى ~4

المخاطر والدرابزين

يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.

يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.

قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.

خارطة طريق التنفيذ

1

تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.

2

اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.

3

أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.

4

تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Latent Consistency Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

نماذج الانتشار الكامن

الأسئلة المتداولة

What is Latent Consistency Models?

نماذج الاتساق الكامن (LCMs) هي تقنية تتيح لمولدات الصور المنتشرة إنتاج صور عالية الجودة في خطوة واحدة إلى أربع خطوات فقط بدلاً من العشرات المعتادة. إنها تجعل إنشاء الصور التفاعلية في الوقت الفعلي تقريبًا أمرًا عمليًا حتى على الأجهزة المتواضعة.

ما هي الميزة الرئيسية لنماذج الاتساق الكامن مقارنة بالانتشار الكامن القياسي؟

تقوم LCMs بتفكيك العديد من خطوات تقليل الضوضاء للانتشار القياسي إلى ما يقرب من خطوة واحدة إلى أربع خطوات، مما يتيح التوليد في الوقت الفعلي تقريبًا.

ما هي خاصية "الاتساق الذاتي" التي تفرضها نماذج الاتساق؟

الاتساق يعني أن النقاط على طول نفس مسار ODE لتدفق الاحتمالية كلها تعين نفس الناتج النظيف النهائي.

في أي مساحة تقوم LCMs بالتقطير؟

إن التشغيل في المساحة الكامنة، كما يفعل التوزيع المستقر، يجعل عملية التقطير المتسقة فعالة.

ما الذي يتيح لك LCM-LoRA القيام به؟

يقوم LCM-LoRA بتجميع التسريع كمحول خفيف الوزن يسقط على نماذج Stable Diffusion الحالية المضبوطة بدقة.

كيف يمكن لنموذج الاتساق أن يحقق توليد بضع خطوات؟

يتم تقطير شبكة الطلاب للتنبؤ بنقطة النهاية لمسار تقليل الضوضاء بقفزة واحدة بدلاً من العديد من الخطوات الصغيرة.