شبكات CNN على أساس المنطقة
إن شبكات CNN القائمة على المنطقة (R-CNNs) هي مجموعة من أجهزة كشف الكائنات التي تقترح أولاً المناطق المرشحة في الصورة، ثم تستخدم CNN لتصنيف كل كائن ووضعه في مربع بدقة.
نظرة عامة
They turned image classification into full object detection, locating and labeling many objects at once.
الغوص العميق
تصنيف الصور يجيب على السؤال "ماذا يوجد في هذه الصورة؟" لكن الكشف يجب أن يجيب أيضًا على السؤال "أين وكم؟" استخدم R-CNN الأصلي (2014) خوارزمية خارجية (بحث انتقائي) لاقتراح حوالي 2000 منطقة، مع تعديل كل منطقة إلى حجم ثابت، وتشغيل CNN على كل منطقة، وكان ذلك دقيقًا ولكنه بطيء للغاية. قامت Fast R-CNN بتسريع هذا الأمر عن طريق تشغيل CNN مرة واحدة على الصورة بأكملها وتجميع الميزات لكل منطقة (تجميع RoI). ثم استبدلت R-CNN الأسرع البحث الانتقائي بشبكة اقتراح المنطقة المستفادة (RPN)، مما يجعل خط الأنابيب بأكمله شاملاً وفي الوقت الفعلي تقريبًا. قام قناع R-CNN بتوسيع نطاقه بشكل أكبر لإخراج أقنعة على مستوى البكسل لكل كائن تم اكتشافه.
البصيرة الفنية
قفزة الكفاءة الرئيسية هي تجميع عائد الاستثمار: فبدلاً من إعادة تشغيل CNN على كل صندوق مقترح، تحسب الشبكة خريطة ميزات مشتركة واحدة للصورة، ثم تقوم باقتصاص وتغيير حجم الميزات داخل كل منطقة تهم شبكة ثابتة. ينزلق RPN الأسرع من R-CNN على خريطة الميزات التي تتنبأ بدرجات "الموضوعية" وتعديلات الصندوق لمربعات التثبيت المعدة مسبقًا ذات الأحجام ونسب العرض إلى الارتفاع المختلفة، مما يؤدي إلى إنشاء مقترحات مجانًا تقريبًا.
التأثير الاستراتيجي
السرعة والحجم
يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.
خيارات البناء
يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.
الفريق وسير العمل
يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.
مستقبل شبكات CNN القائمة على المنطقة
تظل كاشفات R-CNN ذات المرحلتين قوية عندما تكون الدقة أكثر أهمية، ولكن الكاشفات أحادية المرحلة (YOLO وSSD) والكاشفات القائمة على المحولات مثل DETR، والتي تتخطى نقاط التثبيت والمقترحات المصممة يدويًا بالكامل، تحظى بشعبية متزايدة بسبب السرعة والبساطة. الاتجاه هو نحو الكشف الشامل والخالي من المرساة والمستند إلى الاستعلام. ومع ذلك، فإن الأفكار الأساسية لسلالة R-CNN، والميزات المشتركة والتفكير على مستوى المنطقة، تستمر في التأثير على أنظمة التجزئة والفيديو والكشف ثلاثي الأبعاد.
التنفيذ في العالم الحقيقي
كشف وحصر المنتجات على رفوف البيع بالتجزئة لإدارة المخزون
مثيل تجزئة الخلايا أو الأعضاء في عمليات الفحص الطبي باستخدام Mask R-CNN
تحديد العيوب ومواقعها على خط إنتاج المصنع
تحديد موقع العديد من المركبات والمشاة في خلاصات كاميرا القيادة الذاتية
المخاطر والدرابزين
يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.
يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.
قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.
خارطة طريق التنفيذ
تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.
اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.
أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.
تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Region-Based CNNs quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
النماذج التوليدية القائمة على النتيجة
الأسئلة المتداولة
What is Region-Based CNNs?
إن شبكات CNN القائمة على المنطقة (R-CNNs) هي مجموعة من أجهزة كشف الكائنات التي تقترح أولاً المناطق المرشحة في الصورة، ثم تستخدم CNN لتصنيف كل كائن ووضعه في مربع بدقة. لقد حولوا تصنيف الصور إلى اكتشاف كامل للكائنات، وتحديد موقع العديد من الكائنات ووضع علامات عليها في وقت واحد.
ما هي الفكرة الأساسية لشبكة CNN الإقليمية؟
تقترح شبكات R-CNN المناطق التي قد تحتوي على كائنات، ثم تقوم بتشغيل CNN لتصنيف كل منطقة وتحسين المربع المحيط بها.
لماذا كان R-CNN الأصلي (2014) بطيئًا؟
قام R-CNN الأصلي بتشغيل CNN بشكل مستقل على ما يقرب من 2000 مقترح منطقة لكل صورة، وهو ما كان مكلفًا للغاية من الناحية الحسابية.
ما الذي قدمته Faster R-CNN ليحل محل البحث الانتقائي؟
قدمت شبكة Faster R-CNN شبكة مقترحات المنطقة المستفادة، مما يجعل إنشاء المقترحات جزءًا من الشبكة القابلة للتدريب وأسرع بكثير.
ما الذي يحققه تجميع عائد الاستثمار؟
يقوم تجميع العائد على الاستثمار باستخراج شبكات الميزات ذات الحجم الثابت من خريطة ميزات مشتركة واحدة لكل منطقة، مما يؤدي إلى تجنب إعادة الحساب وتسريع الاكتشاف.
ما هي القدرة الإضافية التي يضيفها Mask R-CNN؟
يعمل قناع R-CNN على توسيع شبكة R-CNN الأسرع من خلال التنبؤ بقناع دقيق على مستوى البكسل لكل كائن، مما يتيح تجزئة المثيلات.