التدفق البصري
يقدر التدفق البصري كيفية تحرك كل بكسل بين إطارات الفيديو المتتالية، مما ينتج عنه خريطة كثيفة لمتجهات الحركة.
نظرة عامة
It is how machines perceive movement, speed, and direction in video.
الغوص العميق
يعين التدفق البصري سهم حركة صغير لكل بكسل، ويصف المكان الذي يبدو أنه ينتقل فيه من إطار إلى آخر. تعتمد الأساليب الكلاسيكية على افتراض «ثبات السطوع» - حيث تحتفظ النقطة بنفس السطوع أثناء تحركها - بالإضافة إلى قيود السلاسة، كما هو الحال في خوارزميات Lucas-Kanade (المتناثرة)، وHorn-Schunck (الكثيفة). تعمل هذه بشكل جيد مع الحركات الصغيرة واللطيفة ولكنها تعاني من الحركة السريعة والانسدادات والمناطق الكبيرة التي لا تحتوي على نسيج. غيّر التعلم العميق هذا المجال: تتعلم شبكات مثل FlowNet، وPWC-Net، وخاصة RAFT كيفية مطابقة الميزات عبر الإطارات وتحسين مجال التدفق بشكل متكرر. يؤدي الإخراج إلى فهم الفيديو حيثما لا يكون السؤال مجرد "ما هو الموجود في الإطار؟" ولكن "كيف تتحرك؟"
البصيرة الفنية
يقوم RAFT، وهو نهج بارز، ببناء "حجم تكلفة" رباعي الأبعاد يسجل مدى تطابق كل بكسل في الإطار الأول مع كل بكسل في الإطار الثاني، ثم يستخدم عامل التحديث المتكرر (GRU) لتحسين تقدير التدفق عبر العديد من الخطوات الصغيرة - مثل دفع الأسهم بشكل متكرر نحو تطابقات أفضل. يوفر هذا التحسين التكراري، بدلاً من تخمين واحد كبير، تدفقًا حادًا ودقيقًا حتى بالنسبة للإزاحات الكبيرة والتفاصيل الدقيقة، كما أنه يعمم بشكل جيد عبر المشاهد المختلفة.
التأثير الاستراتيجي
السرعة والحجم
يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.
خيارات البناء
يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.
الفريق وسير العمل
يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.
مستقبل التدفق البصري
يتجه التدفق البصري نحو التقدير عالي الدقة في الوقت الفعلي على الأجهزة الطرفية، والتكامل الأكثر إحكامًا مع العمق وتدفق المشهد ثلاثي الأبعاد، والتدريب الخاضع للإشراف الذاتي الذي يتعلم من الفيديو الخام بدون ملصقات الحقيقة الأرضية باهظة الثمن. نظرًا لأن الأنظمة المستقلة والروبوتات تتطلب فهمًا أكثر ثراءً للحركة، توقع دمج التدفق مع تتبع الكائنات والتنبؤ بها حتى لا ترى الآلات الحركة الحالية فحسب، بل تتوقع إلى أين ستتجه الأمور بعد ذلك، حتى من خلال عمليات الانسداد وحركة الكاميرا السريعة.
التنفيذ في العالم الحقيقي
تثبيت الفيديو في الهواتف وكاميرات الحركة التي تلغي الحركة اليدوية المهتزة
استيفاء الإطار الذي يتم إنشاؤه بين الإطارات لجعل الفيديو يبدو أكثر سلاسة أو يتم تشغيله بحركة بطيئة
مساعدة السائق والمركبات ذاتية القيادة التي تقدر سرعة واتجاه السيارات والمشاة القريبة
برامج ترميز ضغط الفيديو تتنبأ بالحركة بين الإطارات لتخزين الفيديو بشكل أكثر كفاءة
المخاطر والدرابزين
يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.
يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.
قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.
خارطة طريق التنفيذ
تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.
اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.
أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.
تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Optical Flow quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
مطابقة التدفق
الأسئلة المتداولة
What is Optical Flow?
يقدر التدفق البصري كيفية تحرك كل بكسل بين إطارات الفيديو المتتالية، مما ينتج عنه خريطة كثيفة لمتجهات الحركة. إنها الطريقة التي تدرك بها الآلات الحركة والسرعة والاتجاه في الفيديو.
ما الذي يقدره التدفق البصري فعليًا؟
ينتج التدفق البصري نواقل حركة تصف كيفية تحرك كل بكسل من إطار إلى آخر.
ما هو افتراض "ثبات السطوع" المستخدم في التدفق البصري الكلاسيكي؟
تفترض الطرق الكلاسيكية أن سطوع النقطة المادية يظل ثابتًا أثناء تحركها، مما يتيح لها مطابقته بين الإطارات.
ما هي طريقة التعلم العميق الحديثة المعروفة بتحسين التدفق التكراري باستخدام حجم التكلفة والتحديثات المتكررة؟
يبني RAFT حجم تكلفة رباعي الأبعاد ويستخدم مشغلًا متكررًا لتحسين التدفق عبر العديد من الخطوات الصغيرة، مما يحقق الدقة المتطورة.
لماذا تواجه طرق التدفق البصري الكلاسيكية صعوبة في التعامل مع الحركات الكبيرة والسريعة؟
تفقد الأساليب المبنية على افتراضات الحركة الصغيرة المسار عندما يقفز البكسل بعيدًا بين الإطارات، مما يتسبب في حدوث أخطاء.
ما التطبيق الذي يعتمد بشكل مباشر على تقدير الحركة بين الإطارات؟
يعمل استيفاء الإطار على تجميع الإطارات المتوسطة باستخدام حركة البكسل المقدرة، مما يؤدي إلى إنتاج فيديو أكثر سلاسة أو حركة بطيئة.