دليل الذكاء الاصطناعي المرئي

محولات الرؤية

تطبق محولات الرؤية (ViTs) بنية المحولات التي تعمل على تشغيل ChatGPT على الصور، حيث تتعامل مع الصورة كسلسلة من التصحيحات بدلاً من شبكة من وحدات البكسل.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

They proved that you do not need convolutions to achieve state-of-the-art image recognition.

الغوص العميق

لسنوات عديدة، هيمنت الشبكات العصبية التلافيفية (CNN) على رؤية الكمبيوتر عن طريق مسح المرشحات الصغيرة عبر الصورة. تحدت ورقة عام 2020 بعنوان "الصورة تستحق 16 × 16 كلمة" من Google هذا الأمر عن طريق تقطيع الصورة إلى بقع ثابتة، عادةً 16 × 16 بكسل، وتسطيح كل منها في متجه، وتغذية التسلسل الناتج في محول قياسي. تصبح كل رقعة "رمزًا مميزًا"، تمامًا مثل كلمة في جملة. يستخدم النموذج بعد ذلك الاهتمام الذاتي بحيث يمكن لكل رقعة أن ترتبط مباشرة بكل رقعة أخرى، وتلتقط علاقات طويلة المدى لا يمكن لمرشح تلافيفي صغير رؤيتها في خطوة واحدة. المعضلة: إن ViTs متعطشة للبيانات لأنها تفتقر إلى الافتراضات المضمنة في شبكات CNN. وبعد تدريبهم على مجموعات بيانات هائلة مثل JFT-300M، تمكنوا من مطابقة أفضل شبكات CNN أو التغلب عليها، مما أعاد تشكيل أبحاث الرؤية الحديثة.

البصيرة الفنية

يقوم ViT بتقسيم الصورة إلى تصحيحات غير متداخلة، وعرض كل تصحيح خطيًا في التضمين، وإضافة ترميزات موضعية حتى يعرف النموذج مكان وجود كل تصحيح في الصورة الأصلية. يتم إضافة "رمز مميز للفئة" خاص قابل للتعلم؛ تمثيلها النهائي يقود التصنيف. تسمح طبقات الاهتمام الذاتي المكدسة لكل تصحيح بوزن المعلومات الواردة من جميع التصحيحات الأخرى، مما يوفر مجال استقبال عالمي من الطبقة الأولى. نظرًا لأن الاهتمام يتزايد بشكل تربيعي مع عدد التصحيحات، تصبح الصور عالية الدقة باهظة الثمن، ولهذا السبب يهم حجم التصحيح ومتغيرات الانتباه الفعالة.

التأثير الاستراتيجي

السرعة والحجم

يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.

خيارات البناء

يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.

الفريق وسير العمل

يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.

مستقبل محولات الرؤية

تعمل الآن أجهزة ViTs وCNN-transformer الهجينة على تشغيل أنظمة الرؤية الرائدة، وتدعم الهندسة المعمارية النماذج متعددة الوسائط التي تدمج الصور مع النص، مثل CLIP ومساعدي لغة الرؤية الحديثة. نتوقع استمرار العمل على جعل الاهتمام بالدقة العالية والفيديو أرخص، بالإضافة إلى التدريب المسبق الخاضع للإشراف الذاتي (مثل نمذجة الصور المقنعة) الذي يقلل من الشهية الهائلة للبيانات المصنفة. مع نمو الحوسبة، يظل الخط الفاصل بين "نموذج اللغة" و"نموذج الرؤية" غير واضح، حيث تعمل المحولات كعمود فقري مشترك عبر الطرائق بدلاً من التصميمات المتخصصة المنفصلة.

التنفيذ في العالم الحقيقي

Google أنظمة تصنيف الصور وتصنيف البحث التي اعتمدت العمود الفقري للمحولات بعد أن أثبت ViT قدرته على المنافسة مع شبكات CNN

CLIP ونماذج نص الصور الأخرى التي تستخدم ViT لتشفير الصور بحيث يمكن مطابقة الصور والتسميات التوضيحية في مساحة مشتركة

أبحاث التصوير الطبي باستخدام ViTs لاكتشاف الأنماط عبر الفحص بأكمله بدلاً من الأنسجة المحلية فقط

مجموعات إدراك القيادة الذاتية والروبوتات التي تجمع بين الاهتمام بأسلوب ViT لفهم المشهد عبر مجال الرؤية الكامل

المخاطر والدرابزين

يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.

يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.

قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.

خارطة طريق التنفيذ

1

تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.

2

اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.

3

أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.

4

تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Vision Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

CLIP ونماذج لغة الرؤية

الأسئلة المتداولة

What is Vision Transformers?

تطبق محولات الرؤية (ViTs) بنية المحولات التي تعمل على تشغيل ChatGPT على الصور، حيث تتعامل مع الصورة كسلسلة من التصحيحات بدلاً من شبكة من وحدات البكسل. لقد أثبتوا أنك لا تحتاج إلى تلافيفات لتحقيق التعرف على الصور على أحدث طراز.

كيف يقوم محول الرؤية في البداية بمعالجة صورة الإدخال؟

يقوم ViT بتقسيم الصورة إلى بقع ثابتة (غالبًا 16 × 16 بكسل)، ويدمج كل تصحيح كرمز، ويغذي التسلسل في محول.

ما هي الآلية الرئيسية التي تسمح لـ ViT بربط الأجزاء البعيدة من الصورة ببعضها البعض؟

يتيح الاهتمام الذاتي لكل رقعة تقييم المعلومات من كل رقعة أخرى مباشرة، مما يوفر رؤية شاملة من الطبقة الأولى.

لماذا تحتاج محولات الرؤية البسيطة عادةً إلى مجموعات بيانات تدريب كبيرة جدًا للتفوق؟

على عكس CNNs، لا تفترض ViTs المحلية أو ثبات الترجمة، لذلك يجب أن تتعلم هذه الأنماط من كميات كبيرة من البيانات.

ما هو الغرض من الترميزات الموضعية في محول الرؤية؟

الاهتمام الذاتي هو أمر حيادي، لذا فإن الترميز الموضعي يستعيد الموقع المكاني لكل رقعة.

ما هي العبارة التي تعكس بشكل أفضل تأثير ViT على رؤية الكمبيوتر؟

أثبت ViT أن المحول النقي، الذي يتمتع ببيانات وحجم كافٍ، يمكنه منافسة أفضل الشبكات التلافيفية أو تجاوزها.