دليل الذكاء الاصطناعي المرئي

تقدير عمق انتشار القطيفة

تعيد Marigold استخدام نموذج نشر توليد الصور المُدرب مسبقًا (Stable Diffusion) للتنبؤ بخرائط العمق المفصلة للغاية.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It shows you can turn a generator's rich visual knowledge into a precise perception tool with surprisingly little training data.

الغوص العميق

تعيد Marigold (جائزة ETH Zurich، CVPR لأفضل ورقة شرفية لعام 2024) صياغة تقدير العمق باعتباره مشكلة توليد مشروطة. بدلاً من تدريب شبكة عميقة من الصفر، فإنه يقوم بضبط Stable Diffusion من أجل "إنشاء" خريطة عمق مشروطة بصورة مدخلة. الفكرة هي أن النموذج الذي تم تدريبه على تجميع الصور الواقعية قد تعلم بالفعل هندسة المشهد، والإضاءة، والبنية في أعماق الفضاء الكامن، وهو بالضبط ما هو مفيد للعمق. ومن اللافت للنظر أنه تم ضبط Marigold بدقة على مجموعات البيانات الاصطناعية فقط (مثل Hypersim وVirtual KITTI) ومع ذلك يتم تعميمه بشكل جيد على الصور الحقيقية بدون لقطة. إنها تنتج عمقًا نسبيًا ثابتًا بتفاصيل دقيقة بشكل استثنائي، على الرغم من أن تقليل الضوضاء التكراري يجعلها أبطأ من نماذج التغذية الأمامية مثل DepthAnything.

البصيرة الفنية

تعمل Marigold في الفضاء الكامن لـ Stable Diffusion. يتم تشفير كل من الصورة وخريطة العمق بواسطة نفس VAE؛ تم ضبط شبكة U-Net بشكل دقيق لتقليل العمق الكامن المشروط بالصورة النظيفة الكامنة. عند الاستدلال، يتم تشغيل حلقة تقليل الضوضاء التكرارية القياسية، ثم يفك تشفير العمق الكامن. نظرًا لأنها عينات، يمكن تجميع عمليات التشغيل المتعددة لتحقيق الاستقرار، واستبدال الحساب بالدقة. قامت الإصدارات اللاحقة من "LCM" والإصدارات المقطرة بخطوة واحدة بتقطيع عشرات الخطوات إلى ممر واحد.

التأثير الاستراتيجي

السرعة والحجم

يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.

خيارات البناء

يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.

الفريق وسير العمل

يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.

مستقبل تقدير عمق انتشار القطيفة

إن وصفة القطيفة، وهي تمهيديات نشر دقيقة للتنبؤ الكثيف، يتم تعميمها إلى ما هو أبعد من العمق إلى المستويات الطبيعية السطحية، وتحلل الصور الجوهرية، وتقدير المواد. تعمل متغيرات نماذج التقطير الأسرع والنماذج المتسقة على سد فجوة السرعة مع شبكات التغذية الأمامية، مما يجعل الإدراك القائم على الانتشار قابلاً للتطبيق في الأدوات التفاعلية. توقع اتجاهًا أوسع حيث يتم تكييف العمود الفقري التوليدي المُدرب مسبقًا مع العديد من المهام الهندسية والإدراكية، مما يقلل الحاجة إلى مجموعات كبيرة من البيانات المُصنفة الخاصة بالمهام.

التنفيذ في العالم الحقيقي

استخراج العمق الدقيق من الصور المعمارية وصور المنتجات لإعادة الإضاءة والنماذج ثلاثية الأبعاد.

إنشاء خرائط عمق عالية التفاصيل تستخدم كتكييف لتوليد الصور والفيديوهات التي يمكن التحكم فيها.

مساعدة فرق الأفلام والمؤثرات البصرية في العمل غير اللامع والمنظر حيث تكون دقة الحواف مهمة.

بمثابة خط أساس بحثي يوضح كيفية تكييف الكهنة التوليديين مع مهام التنبؤ الكثيفة.

المخاطر والدرابزين

يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.

يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.

قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.

خارطة طريق التنفيذ

1

تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.

2

اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.

3

أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.

4

تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Marigold Diffusion Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

تقدير عمق أحادي

الأسئلة المتداولة

What is Marigold Diffusion Depth Estimation?

تعيد Marigold استخدام نموذج نشر توليد الصور المُدرب مسبقًا (Stable Diffusion) للتنبؤ بخرائط العمق المفصلة للغاية. إنه يوضح أنه يمكنك تحويل المعرفة المرئية الغنية للمولد إلى أداة إدراك دقيقة مع القليل من بيانات التدريب بشكل مدهش.

ما هو النموذج المُدرب مسبقًا الذي تعتمد عليه Marigold؟

يقوم Marigold بضبط نموذج الانتشار الكامن Stable Diffusion لإنتاج خرائط العمق.

كيف تضع ماريجولد إطارًا لمهمة تقدير العمق؟

فهو يتعامل مع العمق باعتباره شيئًا يجب "إنشاءه" مشروطًا بالصورة المدخلة، وإعادة استخدام آلات الانتشار.

ما الذي كان مفاجئًا بشأن بيانات تدريب ماريجولد؟

تم ضبط Marigold بدقة على البيانات الاصطناعية مثل Hypersim وVirtual KITTI، ولكنها عممت اللقطة الصفرية على الصور الحقيقية.

لماذا يكون Marigold عادةً أبطأ من نماذج عمق التغذية الأمامية؟

تقلل نماذج الانتشار من خلال خطوات متعددة، مما يجعل الاستدلال أبطأ من تمريرة أمامية واحدة.

في أي مساحة تقوم القطيفة بعملية الانتشار؟

يتم تشفير كل من الصورة والعمق في المساحة الكامنة VAE حيث تقلل شبكة U-Net.