دليل الذكاء الاصطناعي المرئي

الإجابة على الأسئلة البصرية

تتيح الإجابة المرئية على الأسئلة (VQA) للنظام الإجابة على أسئلة ذات صيغة حرة باللغة الطبيعية حول صورة ما، مثل "كم عدد الأشخاص الذين يرتدون القبعات؟" يتطلب الأمر فهمًا مشتركًا لكل من الصورة والسؤال لإنتاج إجابة صحيحة.

قراءة لمدة دقيقتينآخر تحديث

الغوص العميق

تجمع الإجابة المرئية على الأسئلة بين رؤية الكمبيوتر ومعالجة اللغة الطبيعية: بالنظر إلى صورة وسؤال، يقوم النموذج بإرجاع إجابة، والتي قد تكون كلمة واحدة، أو عبارة قصيرة، أو إجابة بنعم/لا. تم نشر هذه المهمة من خلال مجموعة بيانات VQA (Antol et al., 2015) وإصدار VQA v2.0 المحسّن الخاص بها، والذي يوازن الإجابات لتثبيط النماذج عن التخمين من النص وحده. تقوم الأنظمة بتشفير الصورة والسؤال، ودمج التمثيلين، ثم التنبؤ بالإجابة، تاريخيًا عن طريق التصنيف على مفردات الإجابة الثابتة. اليوم، تتعامل نماذج لغة الرؤية الكبيرة مثل GPT-4V، وLLaVA، وPaLI مع VQA مفتوحة النهاية، والتفكير في الأشياء، والسمات، والأعداد، والعلاقات المكانية، وحتى النص المكتوب داخل الصور.

البصيرة الفنية

يقوم نموذج VQA النموذجي بتشفير الصورة (CNN أو محول الرؤية) والسؤال (محول تشفير النص)، ثم يدمجهما، غالبًا مع الاهتمام المتبادل بحيث تحضر كلمات السؤال إلى مناطق الصورة. يقوم المتجه المدمج بتغذية مصنف عبر الإجابات الشائعة أو وحدة فك ترميز اللغة للردود المفتوحة. أحد المآزق المعروفة هو التحيز اللغوي: يمكن للنماذج استغلال إحصائيات الإجابات وتجاهل الصورة، وهو ما تتعارض معه مجموعات البيانات المتوازنة مثل VQA v2.0 على وجه التحديد.

التأثير الاستراتيجي

السرعة والحجم

يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.

خيارات البناء

يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.

الفريق وسير العمل

يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.

مستقبل الإجابة على الأسئلة البصرية

يتطور تحليل جودة التعليم (VQA) من تصنيف الإجابات القصيرة إلى التفكير البصري المفتوح متعدد الخطوات مع التوضيحات. توقع معالجة أقوى لعمليات العد والمخططات والرسوم البيانية والنص الموجود في الصورة (المستند VQA)، بالإضافة إلى VQA للفيديو الذي يتم تفسيره بمرور الوقت. يظل الحد من انحياز الاختصارات والهلوسة يمثل أولوية، كما هو الحال بالنسبة لتأسيس الإجابات في مناطق محددة من الصورة من أجل الثقة. سوف يجيب المساعدون متعددو الوسائط بشكل متزايد على الأسئلة المرئية عبر الهواتف، وفي الروبوتات، وفي أدوات الوصول التي تساعد المستخدمين على استجواب محيطهم.

التنفيذ في العالم الحقيقي

السماح للمستخدمين المكفوفين بتصوير منتج والسؤال "ما هذه النكهة؟" أو "ما هو تاريخ انتهاء الصلاحية؟"

الإجابة على الأسئلة حول المخططات والنماذج والمستندات الممسوحة ضوئيًا (مستند VQA) في سير عمل الأعمال

دعم مساعدي البيع بالتجزئة والتجارة الإلكترونية الذين يستجيبون لسؤال "هل تحتوي هذه السترة على غطاء للرأس؟" من صورة المنتج

دعم مراجعة الصور الطبية أو العلمية من خلال الإجابة على الأسئلة المستهدفة حول عمليات المسح أو الصور المجهرية

المخاطر والدرابزين

يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.

يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.

قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.

خارطة طريق التنفيذ

1

تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.

2

اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.

3

أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.

4

تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Visual Question Answering quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الأسئلة المتداولة

What is Visual Question Answering?

تتيح الإجابة المرئية على الأسئلة (VQA) للنظام الإجابة على أسئلة ذات صيغة حرة باللغة الطبيعية حول صورة ما، مثل "كم عدد الأشخاص الذين يرتدون القبعات؟" يتطلب الأمر فهمًا مشتركًا لكل من الصورة والسؤال لإنتاج إجابة صحيحة.

ما المدخلان اللذان يأخذهما نظام الإجابة على الأسئلة المرئية؟

يأخذ VQA صورة وسؤالًا عنها، ثم ينتج إجابة مرتكزة على الصورة.

لماذا تم إنشاء مجموعة بيانات VQA v2.0 بإجابات "متوازنة"؟

يقوم VQA v2.0 بدمج الأسئلة مع الصور التي لها إجابات مختلفة، مما يجبر النماذج على استخدام المدخلات المرئية فعليًا بدلاً من استغلال إحصائيات النص.

ما هو "التحيز اللغوي" في VQA؟

يحدث تحيز اللغة عندما يستغل النموذج إحصائيات الإجابات المرتبطة بصياغة السؤال بدلاً من النظر إلى الصورة.

كيف تجمع العديد من نماذج VQA بين معلومات الصورة والسؤال؟

تقوم نماذج VQA بتشفير كل طريقة ودمجها، وذلك باستخدام الانتباه المتبادل في كثير من الأحيان بحيث تهتم كلمات الاستفهام بمناطق الصورة ذات الصلة.

غالبًا ما تنتج أنظمة VQA الكلاسيكية إجابات عن طريق القيام بماذا؟

تعاملت العديد من نماذج VQA المبكرة مع المهمة على أنها تصنيف للإجابات الأكثر شيوعًا، على الرغم من أن النماذج الحديثة تولد نصًا مفتوحًا.