دليل الذكاء الاصطناعي المرئي

الكشف عن كائن المفردات المفتوحة

يتيح اكتشاف الكائنات ذات المفردات المفتوحة للنموذج العثور على الكائنات الموصوفة بنص عشوائي ووضعها في مربع، بما في ذلك الفئات التي لم يسبق له رؤيتها مُصنفة أثناء التدريب.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters because traditional detectors are locked to a fixed list of classes, while open-vocabulary models can detect almost anything you can name.

الغوص العميق

يتم تدريب أجهزة الكشف الكلاسيكية على مجموعة مغلقة من الفئات، مثل الفئات الـ 80 في COCO، ولا يمكنها التعرف على "شيء" خارج تلك القائمة. فواصل الكشف عن المفردات المفتوحة التي تحد من خلال محاذاة ميزات المنطقة المرئية مع مساحة تضمين لغة الرؤية المشتركة، يتم تعلمها عادةً من أزواج الصور والنص الضخمة (كما هو الحال في CLIP). عند الاستدلال، تقوم بتوفير تسميات نصية، ويقوم النموذج بتضمين تلك التسميات، ويطابق المناطق المكتشفة مع أي نص يكون تضمينه هو الأقرب، لذلك تعمل الفئات الجديدة طالما يمكنك وصفها. قامت أنظمة مثل ViLD، وGLIP، وOWL-ViT، وDetic، وGrounding DINO بتعميم هذا النهج من خلال الجمع بين العمود الفقري للكشف مع أسس اللغة ومن خلال التدريب على مجموعات البيانات الكبيرة أو الضعيفة أو المؤرضة.

البصيرة الفنية

الحيلة هي استبدال طبقة المصنف الثابتة بتضمينات النص. بدلاً من تعلم ناقل وزن واحد لكل فئة معروفة، يقوم الكاشف بإسقاط كل منطقة في نفس المساحة مثل برنامج تشفير اللغة؛ ويصبح التصنيف عبارة عن مقارنة تشابه بين ميزات المنطقة وتضمينات أسماء أو عبارات الفئات المقدمة من قبل المستخدم. نظرًا لأن برنامج تشفير النص يعمم على الكلمات غير المرئية، فإن تبديل سلاسل العناوين الجديدة في وقت الاختبار يتيح اكتشاف الفئات الغائبة عن بيانات تدريب المربع المحيط.

التأثير الاستراتيجي

السرعة والحجم

يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.

خيارات البناء

يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.

الفريق وسير العمل

يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.

مستقبل الكشف عن الكائنات ذات المفردات المفتوحة

يتقارب اكتشاف المفردات المفتوحة مع التأريض والتجزئة، حيث تقوم العبارات ذات الشكل الحر (وليس الكلمات المفردة فقط) بتحديد موضع الكائنات، ومع أنظمة سريعة مقترنة بنماذج مثل SAM للأقنعة. توقع دقة صفرية أقوى، واستعلامات نصية أطول وأكثر تركيبًا ("الكوب الأحمر خلف الكمبيوتر المحمول")، واقتران محكم مع المساعدين متعددي الوسائط الذين يكتشفون عند الطلب. ومع تحسن التدريب على الصور والنصوص على نطاق الويب، فإن الخط الفاصل بين الاكتشاف والاسترجاع وفهم اللغة سيظل غير واضح نحو الأساس البصري العام.

التنفيذ في العالم الحقيقي

البحث في الصور عن الكائنات النادرة أو المخصصة عن طريق كتابة أسمائها دون إعادة التدريب

تحدد أنظمة الروبوتات موقع العنصر الذي يسميه المستخدم باللغة الطبيعية قبل الإمساك به

تصنيف مجموعات البيانات تلقائيًا عن طريق اكتشاف العديد من الفئات الجديدة من قائمة نصية

الإشراف على المحتوى الذي يشير إلى كائنات تصف كائنات غير موجودة في تسميات التدريب الأصلية

المخاطر والدرابزين

يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.

يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.

قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.

خارطة طريق التنفيذ

1

تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.

2

اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.

3

أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.

4

تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Open-Vocabulary Object Detection quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الأسئلة المتداولة

What is Open-Vocabulary Object Detection?

يتيح اكتشاف الكائنات ذات المفردات المفتوحة للنموذج العثور على الكائنات الموصوفة بنص عشوائي ووضعها في مربع، بما في ذلك الفئات التي لم يسبق له رؤيتها مُصنفة أثناء التدريب. وهذا مهم لأن أجهزة الكشف التقليدية مقيدة بقائمة ثابتة من الفئات، في حين أن نماذج المفردات المفتوحة يمكنها اكتشاف أي شيء يمكنك تسميته تقريبًا.

ما هي القدرة المحددة لاكتشاف الكائنات ذات المفردات المفتوحة؟

يمكن لاكتشاف المفردات المفتوحة أن يقوم بترجمة الفئات المحددة بواسطة النص في وقت الاختبار، حتى تلك التي لم يتم رؤيتها مطلقًا مُصنفة بمربعات محيطة.

كيف تصنف هذه النماذج المنطقة المكتشفة؟

إنهم يعرضون المناطق في مساحة تضمين لغة الرؤية ويطابقون كل منطقة مع أقرب تضمين تسمية نصية.

ما هو مصدر التدريب المسبق الذي يتيح اكتشاف المفردات المفتوحة بشكل أكبر؟

تعمل بيانات نص الصورة الضخمة (كما تستخدمها نماذج نمط CLIP) على إنشاء مساحة التضمين المشتركة التي تتيح تعميم النص على فئات جديدة.

ما هو المكون الذي يتم استبداله مقارنة بكاشف المجموعة المغلقة؟

بدلاً من متجهات وزن الفئة الثابتة، يستخدم التصنيف التشابه مع تضمينات النص، لذلك يمكن إضافة سلاسل تسمية جديدة في وقت الاختبار.

أي مما يلي يعد نموذجًا للمفردات المفتوحة أو نموذج اكتشاف التأريض؟

تعتبر Grounding DINO، إلى جانب GLIP وOWL-ViT وViLD وDetic، من أجهزة الكشف عن المفردات المفتوحة أو التأريض المعروفة.