شريحة أي نموذج
نموذج تقسيم أي شيء (SAM) هو Meta النموذج الأساسي للذكاء الاصطناعي لتجزئة الصورة: بالنظر إلى نقطة أو مربع أو تلميح تقريبي، فإنه يحدد على الفور الكائن المقابل.
نظرة عامة
It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.
الغوص العميق
تم إصدار SAM بواسطة Meta AI في عام 2023، وهو يعيد صياغة التجزئة باعتبارها مشكلة قابلة للتنفيذ: حيث تقوم بإعطائها مطالبة (نقرة أو مربع أو قناع أو تلميح مشتق من النص) وتقوم بإرجاع واحد أو أكثر من أقنعة الكائنات. وتأتي قوتها جزئيًا من الحجم: فقد تم تدريبها على SA-1B، وهي مجموعة بيانات تضم أكثر من مليار قناع عبر 11 مليون صورة، تم تصميمها باستخدام محرك التعليقات التوضيحية للنموذج داخل الحلقة. من الناحية المعمارية، يحتوي SAM على برنامج تشفير صور ثقيل يعمل مرة واحدة لكل صورة، وبرنامج تشفير فوري خفيف الوزن، وجهاز فك تشفير قناع سريع، بحيث يمكن إعادة مطالبة صورة واحدة مضمنة بشكل تفاعلي في الوقت الفعلي. إنه يتيح النقل بدون طلقة إلى العديد من المهام. يعمل SAM 2، الذي تم إصداره في عام 2024، على توسيع نطاق هذا ليشمل الفيديو، حيث يتتبع الكائنات عبر الإطارات.
البصيرة الفنية
يستخدم SAM برنامج تشفير الصور Vision Transformer (ViT)، والذي غالبًا ما يتم تدريبه مسبقًا باستخدام التشفير التلقائي المقنع، لإنتاج تضمين صورة كثيف. يتم تشفير المطالبات في رموز مميزة، ويقوم جهاز فك التشفير القائم على المحولات المزود بصمامات الانتباه المتقاطع بتوجيه الرموز المميزة مع تضمين الصورة لأقنعة الإخراج بالإضافة إلى درجات الثقة. لحل الغموض (قد تعني النقرة زرًا أو قميصًا أو شخصًا)، يتنبأ SAM بعدة أقنعة صالحة في وقت واحد ويصنفها، مما يسمح بتوضيح الاستخدام النهائي أو المطالبات الإضافية.
التأثير الاستراتيجي
السرعة والحجم
يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.
خيارات البناء
يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.
الفريق وسير العمل
يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.
مستقبل نموذج أي شيء
لقد أصبح SAM العمود الفقري الافتراضي لأدوات التعليقات التوضيحية، والتصوير الطبي، والروبوتات، وخطوط أنابيب الواقع المعزز، وغالبًا ما يتم إقرانها بأجهزة كشف أو نماذج نصية لسير عمل "القطعة حسب الاسم" للمفردات المفتوحة. توقع وجود إصدارات أخف وأسرع (MobileSAM، وEfficientSAM) للاستخدام على الجهاز، وتكامل أعمق مع اللغة للتجزئة المستندة إلى النص بالكامل، والتوسع المستمر في الفيديو والأبعاد الثلاثية. كنموذج أساسي، يتم إعادة استخدام تضميناته بشكل متزايد كطبقة إدراك تغذي الأنظمة الأخرى.
التنفيذ في العالم الحقيقي
تستخدم منصات التعليقات التوضيحية للصور SAM للسماح لواضعي الملصقات بالنقر مرة واحدة وإنشاء أقنعة كائنات دقيقة تلقائيًا، مما يقلل وقت وضع العلامات.
يقوم الباحثون بتكييف SAM (على سبيل المثال، MedSAM) لتحديد الأعضاء والأورام في الأشعة المقطعية والتصوير بالرنين المغناطيسي.
يقوم محررو الصور والفيديو بدمج SAM لقص الموضوعات أو إزالة الخلفيات بنقرة واحدة.
يقوم SAM 2 بتتبع الكائنات وتقسيمها عبر إطارات الفيديو للحصول على تأثيرات الواقع المعزز وإدراك الروبوتات.
المخاطر والدرابزين
يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.
يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.
قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.
خارطة طريق التنفيذ
تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.
اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.
أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.
تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Segment Anything Model quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
نماذج الاتساق
الأسئلة المتداولة
What is Segment Anything Model?
نموذج تقسيم أي شيء (SAM) هو Meta النموذج الأساسي للذكاء الاصطناعي لتجزئة الصورة: بالنظر إلى نقطة أو مربع أو تلميح تقريبي، فإنه يحدد على الفور الكائن المقابل. لقد تم تصميمه للتعميم على الأشياء والصور التي لم يسبق له رؤيتها أثناء التدريب، مما يجعل التجزئة مهمة سريعة.
ما هي الفكرة الأساسية التي تجعل SAM "نموذجًا أساسيًا" للتجزئة؟
تعيد SAM صياغة التجزئة على أنها سريعة وتم تصميمها لنقل اللقطة الصفرية إلى الأشياء والصور خارج مجموعة التدريب الخاصة بها.
ما هو حجم مجموعة البيانات SA-1B تقريبًا المستخدمة لتدريب SAM؟
يحتوي SA-1B على أكثر من مليار قناع على حوالي 11 مليون صورة، تم تصميمه باستخدام محرك التعليقات التوضيحية للنموذج داخل الحلقة.
لماذا قامت SAM بتقسيم بنيتها إلى برنامج تشفير صور ثقيل وجهاز تشفير/فك تشفير فوري خفيف الوزن؟
يتم تشغيل ترميز الصور الباهظ الثمن مرة واحدة؛ ثم يسمح التشفير السريع وفك تشفير القناع بإعادة المطالبة السريعة والتفاعلية لنفس الصورة.
كيف يتعامل SAM مع مطالبة غامضة، مثل نقرة واحدة قد تعني عدة أشياء؟
يقوم SAM بإخراج العديد من الأقنعة المرشحة ذات الدرجات بحيث يمكن حل الغموض عن طريق الترتيب أو المطالبات الإضافية.
ما نوع العمود الفقري الذي يستخدمه SAM لتشفير صورة الإدخال؟
برنامج تشفير الصور الخاص بـ SAM هو عبارة عن محول رؤية، وغالبًا ما يتم تدريبه مسبقًا باستخدام تشفير تلقائي مقنع، مما يؤدي إلى تضمين صورة كثيفة.