دليل الذكاء الاصطناعي المرئي

التعرف على العمل

التعرف على الحركة هو مهمة تعليم أجهزة الكمبيوتر كيفية التعرف على ما يفعله الأشخاص أو الأشياء في الفيديو - مثل الركض، والتلويح، والسقوط، وفتح الباب - وليس فقط ما يظهر في إطار واحد.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters because understanding motion over time unlocks applications from sports analytics to elderly fall detection.

الغوص العميق

يتجاوز التعرف على الإجراءات تصنيف الصور الثابتة من خلال التفكير في كيفية تغير وحدات البكسل عبر الوقت. قد يظهر إطار واحد شخصًا في الهواء؛ يكشف التسلسل فقط ما إذا كانوا يقفزون أو يسقطون أو يغوصون. تتميز الأنظمة المبكرة بميزات الحركة المصنوعة يدويًا مثل التدفق البصري والمسارات الكثيفة. تستخدم الأساليب الحديثة الشبكات العميقة: حيث تعالج البنى ثنائية التدفق المظهر (إطارات RGB) والحركة (التدفق البصري) بشكل منفصل؛ تعمل الشبكات التلافيفية ثلاثية الأبعاد (مثل C3D وI3D) على تمرير المرشحات عبر المكان * والزمن؛ وتقوم محولات الفيديو (TimeSformer، VideoMAE) بتوجيه الانتباه عبر التصحيحات المكانية والزمانية. تشمل المعايير القياسية علم الحركة (700 فصل عن العمل البشري من موقع يوتيوب)، وUCF101، وشيء ما، والذي يجبر النماذج على فهم الاتجاه الزمني بدلاً من مجرد سياق المشهد.

البصيرة الفنية

التحدي الأساسي هو نمذجة البعد الزمني. يعمل الالتواء ثلاثي الأبعاد على توسيع مرشح ثنائي الأبعاد عادي بمحور عمق يمتد لعدة إطارات، بحيث يتعلم أنماط الحركة مباشرة. تعمل خدعة I3D على "تضخيم" الأوزان من شبكة صور ثنائية الأبعاد تم تدريبها مسبقًا على ImageNet إلى ثلاثية الأبعاد عن طريق تكرارها بمرور الوقت، مما يوفر نقطة بداية قوية. بدلاً من ذلك، تعمل الطرق ثنائية التدفق على تغذية التدفق البصري المحسوب مسبقًا في فرع منفصل، مما يؤدي إلى تشفير الحركة بوضوح ثم دمجها مع ميزات المظهر.

التأثير الاستراتيجي

السرعة والحجم

يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.

خيارات البناء

يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.

الفريق وسير العمل

يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.

مستقبل التعرف على العمل

يتحول المجال نحو محولات الفيديو الفعالة والتدريب المسبق الخاضع للإشراف الذاتي (نمذجة الفيديو المقنع) الذي يتعلم من اللقطات غير المُعلَّمة، مما يقلل الاعتماد على التعليقات التوضيحية باهظة الثمن. توقع تكاملًا أكثر إحكامًا مع نماذج اللغة متعددة الوسائط بحيث لا تتمكن الأنظمة من تصنيف الإجراءات فحسب، بل يمكنها أيضًا وصفها والتفكير فيها باللغة الطبيعية. ويُعد التعرف في الوقت الفعلي على الأجهزة القابلة للارتداء، والروبوتات، والكاميرات الذكية حدودًا رئيسية، إلى جانب التعرف الدقيق الذي يميز الحركات الدقيقة شبه المتطابقة.

التنفيذ في العالم الحقيقي

أنظمة الكشف عن السقوط في دور رعاية المسنين والتي تنبه الموظفين عند انهيار أحد المقيمين، مما يميز السقوط عن الجلوس أو الاستلقاء

منصات التحليلات الرياضية التي تقوم تلقائيًا بوضع علامات على الإرسال والتدخلات والتسديدات في لقطات المباراة للتدريب وأبرز أحداث البث

المراقبة ومراقبة السلامة التي تشير إلى سلوك غير طبيعي مثل القتال أو التسكع أو تسلق شخص ما السياج

واجهات يتم التحكم فيها بالإيماءات وتطبيقات اللياقة البدنية التي تحسب عدد الممثلين وتتحقق من شكل التمرين من خلال التعرف على حركات الجسم بمرور الوقت

المخاطر والدرابزين

يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.

يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.

قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.

خارطة طريق التنفيذ

1

تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.

2

اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.

3

أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.

4

تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Action Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

التعرف على الوجه

الأسئلة المتداولة

What is Action Recognition?

التعرف على الحركة هو مهمة تعليم أجهزة الكمبيوتر كيفية التعرف على ما يفعله الأشخاص أو الأشياء في الفيديو - مثل الركض، والتلويح، والسقوط، وفتح الباب - وليس فقط ما يظهر في إطار واحد. وهذا مهم لأن فهم الحركة مع مرور الوقت يفتح المجال أمام التطبيقات بدءًا من التحليلات الرياضية وحتى اكتشاف السقوط عند كبار السن.

ما الذي يميز التعرف على الأحداث بشكل أساسي عن تصنيف الصور العادي؟

تتحرك نماذج التعرف على الحركة عبر سلسلة من الإطارات، نظرًا لأن الصورة الثابتة الواحدة غالبًا لا يمكنها الكشف عما إذا كان شخص ما يقفز أو يسقط أو يغوص.

في شبكة التعرف على الإجراءات الكلاسيكية ذات الدفقين، ما الذي يعالجه الدفق الثاني عادةً؟

تستخدم البنى ثنائية التدفق فرعًا واحدًا للمظهر (إطارات RGB) وفرعًا ثانيًا للتدفق البصري، والذي يقوم بتشفير الحركة بين الإطارات بشكل صريح.

ما الذي يضيفه الإلتواء ثلاثي الأبعاد مقارنةً بالإلتواء القياسي ثنائي الأبعاد؟

يعمل الالتفاف ثلاثي الأبعاد على توسيع المرشح ببُعد العمق/الوقت، مما يسمح له بتعلم أنماط الحركة مباشرة عبر الإطارات المتتالية.

ما هي خدعة "التضخم" التي يستخدمها نموذج I3D؟

يقوم I3D "بتضخيم" الأوزان المعدة مسبقًا على صور ثنائية الأبعاد (مثل ImageNet) إلى ثلاثية الأبعاد عن طريق نسخها على طول المحور الزمني، مما يوفر تهيئة قوية.

لماذا تعتبر مجموعة بيانات شيء ما مميزة للتعرف على الإجراء؟

تم تصميم شيء ما بحيث يعتمد الإجراء على الترتيب الزمني والحركة، مما يمنع النماذج من الغش باستخدام الخلفية أو مظهر الكائن وحده.