دليل الذكاء الاصطناعي المرئي

تقدير عمق أحادي

يتنبأ تقدير العمق أحادي العين بمدى بُعد كل بكسل عن صورة عادية واحدة - لا حاجة إلى كاميرا استريو أو مستشعر ليدار أو مستشعر عمق.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It lets one camera perceive 3D structure from a flat 2D image.

الغوص العميق

يمكن للبشر الحكم على العمق من عين واحدة باستخدام إشارات مثل المنظور، والحجم النسبي، وتدرجات الملمس، والتظليل، والإطباق. يعلم تقدير العمق الأحادي الشبكات العصبية نفس الخدعة: التغذية بصورة RGB واحدة وإخراج قيمة عمق لكل بكسل. نظرًا لأن الصورة ثنائية الأبعاد غامضة بطبيعتها فيما يتعلق بالحجم المطلق، فإن المهمة صعبة، حيث يمكن للعديد من المشاهد ثلاثية الأبعاد أن تُسقط على نفس الصورة. تتعلم الشبكات الكهنة الإحصائيين من مجموعات البيانات الكبيرة لحل هذه المشكلة. يأتي التدريب في نسختين: تحت الإشراف، باستخدام عمق الحقيقة الأرضية من مستشعرات Lidar أو RGB-D، وتحت الإشراف الذاتي، والذي يتعلم العمق تمامًا من أزواج الفيديو أو الاستريو من خلال فرض أن العمق المتوقع يعيد عرض رؤية واحدة بشكل صحيح إلى أخرى. يتم تعميم النماذج الأساسية الحديثة مثل MiDaS وDepth Anything بشكل ملحوظ عبر المشاهد غير المرئية.

البصيرة الفنية

تستغل أساليب الإشراف الذاتي الهندسة بدلاً من التسميات. بالنظر إلى عرضين (إطارات فيديو استريو أو متتالية) وخريطة عمق متوقعة بالإضافة إلى حركة الكاميرا، يقوم النموذج بتشويه صورة واحدة لإعادة بناء الأخرى؛ يصبح خطأ إعادة البناء على مستوى البكسل إشارة التدريب. تعني خسارة "تركيب العرض" أنه يمكن تعلم العمق من الفيديو الخام غير المسمى. يتمثل أحد القيود الرئيسية في غموض المقياس: غالبًا ما يكون العمق الأحادي صحيحًا فقط حتى مضاعف غير معروف ما لم تتم معايرته وفقًا لمرجع معروف أو إشراف متري.

التأثير الاستراتيجي

السرعة والحجم

يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.

خيارات البناء

يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.

الفريق وسير العمل

يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.

مستقبل تقدير العمق الأحادي

تدفع نماذج أساس العمق العامة المدربة على ملايين الصور المختلطة نحو عمق متري موثوق (بمقياس حقيقي) في أي مشهد، حتى تلك التي لم يسبق لها مثيل في التدريب. توقع اندماجًا أكثر إحكامًا مع التدفق البصري وSLAM لإعادة بناء المشهد ثلاثي الأبعاد بالكامل، ونماذج أخف تعمل مباشرة على الهواتف وسماعات الرأس، ومتانة أقوى بدون لقطة. وهذا سيجعل الإدراك المكاني الغني رخيصًا ومنتشرًا في كل مكان، ومتاحًا من أي كاميرا واحدة بدلاً من أجهزة استشعار العمق باهظة الثمن.

التنفيذ في العالم الحقيقي

وضع عمودي للهاتف الذكي يحاكي طمس الخلفية (بوكيه) عن طريق تقدير المسافة بين الهدف والخلفية

تضع تطبيقات الواقع المعزز كائنات افتراضية بحيث توضع بشكل صحيح خلف الأثاث الواقعي

طائرات بدون طيار وروبوتات منخفضة التكلفة تتجنب العوائق باستخدام كاميرا واحدة أمامية

تحويل الصور والأفلام ثنائية الأبعاد إلى ثلاثية الأبعاد عن طريق استنتاج عمق كل بكسل للعرض المجسم

المخاطر والدرابزين

يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.

يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.

قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.

خارطة طريق التنفيذ

1

تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.

2

اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.

3

أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.

4

تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Monocular Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

تقدير عمق ستيريو

الأسئلة المتداولة

What is Monocular Depth Estimation?

يتنبأ تقدير العمق أحادي العين بمدى بُعد كل بكسل عن صورة عادية واحدة - لا حاجة إلى كاميرا استريو أو مستشعر ليدار أو مستشعر عمق. فهو يتيح لكاميرا واحدة إدراك البنية ثلاثية الأبعاد من صورة مسطحة ثنائية الأبعاد.

ما الذي يجعل تقدير العمق "أحادي"؟

"أحادي العين" يعني عين/كاميرا واحدة؛ تتنبأ الطريقة بالعمق من صورة RGB واحدة بدون أجهزة استشعار عمق استريو أو نشطة.

لماذا يعد تقدير العمق الأحادي غامضًا بشكل أساسي؟

يفقد العرض ثنائي الأبعاد معلومات المقياس، لذا فإن الترتيبات ثلاثية الأبعاد المتعددة تكون متسقة مع صورة واحدة؛ تعتمد الشبكات على الأسبقية المستفادة لإزالة الغموض.

كيف تتعلم أساليب الإشراف الذاتي العمق دون تسميات الحقيقة الأرضية؟

وباستخدام العمق المتوقع وحركة الكاميرا، يقوم النموذج بإعادة عرض صورة على أخرى؛ يوفر الخطأ الضوئي إشارة التعلم، ولا حاجة إلى تسميات.

ما هي الإشارة التي لا تعتمد عليها الشبكات الأحادية بشكل مباشر في العمق؟

يتطلب تباين الاستريو وجود كاميرتين؛ تعتمد الأساليب الأحادية على إشارات صورة واحدة مثل الحجم والمنظور والملمس والانسداد.

ما هو "غموض المقياس" في العمق الأحادي؟

بدون إشراف متري أو مرجع معروف، يعطي العمق الأحادي بنية نسبية صحيحة ولكن مقياسًا مطلقًا غير مؤكد.