کسی بھی چیز کے ماڈل کو سیگمنٹ کریں۔
Segment Anything Model (SAM) Meta تصویر کی تقسیم کے لیے AI کا فاؤنڈیشن ماڈل ہے: ایک نقطہ، باکس، یا کسی حد تک اشارہ دیا جائے، یہ فوری طور پر متعلقہ شے کا خاکہ بناتا ہے۔
جائزہ
It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.
گہرا غوطہ
2023 میں Meta AI کے ذریعہ جاری کیا گیا، SAM ایک فوری مسئلہ کے طور پر سیگمنٹیشن کو ری فریم کرتا ہے: آپ اسے ایک پرامپٹ (ایک کلک، ایک باکس، ایک ماسک، یا ٹیکسٹ سے حاصل کردہ اشارہ) دیتے ہیں اور یہ ایک یا زیادہ آبجیکٹ ماسک واپس کرتا ہے۔ اس کی طاقت جزوی طور پر پیمانے سے آتی ہے: اسے SA-1B پر تربیت دی گئی تھی، جو کہ 11 ملین تصاویر پر 1 بلین ماسک کا ڈیٹا سیٹ ہے، جو ایک ماڈل-ان-دی-لوپ تشریح انجن کے ساتھ بنایا گیا ہے۔ آرکیٹیکچرل طور پر، SAM میں ایک ہیوی امیج انکوڈر ہوتا ہے جو فی امیج ایک بار چلتا ہے، ایک ہلکا پھلکا پرامپٹ انکوڈر، اور ایک تیز ماسک ڈیکوڈر ہے، لہذا ایک ہی ایمبیڈڈ امیج کو حقیقی وقت میں انٹرایکٹو طور پر دوبارہ اشارہ کیا جا سکتا ہے۔ یہ بہت سے کاموں میں زیرو شاٹ ٹرانسفر کو قابل بناتا ہے۔ SAM 2، جو 2024 میں ریلیز ہوا، اسے ویڈیو تک بڑھاتا ہے، فریموں میں اشیاء کو ٹریک کرتا ہے۔
تکنیکی بصیرت
SAM ایک وژن ٹرانسفارمر (ViT) امیج انکوڈر کا استعمال کرتا ہے، جو اکثر ماسک شدہ آٹو انکوڈنگ کے ساتھ پہلے سے تربیت یافتہ ہوتا ہے، تاکہ ایک گھنی امیج ایمبیڈنگ تیار کی جا سکے۔ پرامپٹس کو ٹوکنز میں انکوڈ کیا جاتا ہے، اور ایک ٹرانسفارمر پر مبنی ڈیکوڈر کراس اٹینشن فیوز پرامپٹ ٹوکنز کے ساتھ امیج کو ایمبیڈنگ کرتے ہوئے آؤٹ پٹ ماسکس کے علاوہ اعتماد کے اسکور بھی دیتا ہے۔ ابہام کو حل کرنے کے لیے (ایک کلک کا مطلب ایک بٹن، ایک شرٹ، یا کوئی شخص ہو سکتا ہے)، SAM ایک ساتھ کئی درست ماسک کی پیش گوئی کرتا ہے اور ان کی درجہ بندی کرتا ہے، نیچے کی طرف استعمال یا اضافی اشارے کو غیر واضح کرنے دیتا ہے۔
اسٹریٹجک اثر
رفتار اور پیمانہ
بصری AI پیمانے پر معائنہ، پتہ لگانے، اور ٹیگنگ کے کاموں کو خودکار کر سکتا ہے۔
Build choices
تخلیقی ٹیمیں کم دستی ترمیم کے ساتھ تصورات کو تیزی سے پروٹو ٹائپ کر سکتی ہیں۔
Team and workflow
آپریشنز امیج اور ویڈیو سگنلز کا استعمال کر سکتے ہیں جن پر کارروائی کرنا پہلے مشکل تھا۔
سیگمنٹ اینیتھنگ ماڈل کا مستقبل
SAM تشریحی ٹولز، میڈیکل امیجنگ، روبوٹکس، اور AR پائپ لائنز کے لیے ایک ڈیفالٹ ریڑھ کی ہڈی بن گیا ہے، جو اکثر کھلے الفاظ کے 'سگمنٹ بذریعہ نام' ورک فلو کے لیے ڈیٹیکٹر یا ٹیکسٹ ماڈل کے ساتھ جوڑا جاتا ہے۔ ڈیوائس پر استعمال کے لیے ہلکی، تیز تر مختلف حالتوں (MobileSAM، EfficientSAM) کی توقع کریں، مکمل طور پر ٹیکسٹ پر مبنی سیگمنٹیشن کے لیے زبان کے ساتھ گہرا انضمام، اور ویڈیو اور 3D میں مسلسل توسیع کی توقع کریں۔ ایک فاؤنڈیشن ماڈل کے طور پر، اس کی سرایت کو دوسرے سسٹمز کو فیڈ کرنے والی پرسیپشن لیئر کے طور پر تیزی سے دوبارہ استعمال کیا جا رہا ہے۔
حقیقی دنیا کا نفاذ
تصویری تشریح کے پلیٹ فارمز SAM کا استعمال کرتے ہیں تاکہ لیبلرز کو ایک بار کلک کرنے دیں اور لیبلنگ کے وقت کو کم کرتے ہوئے درست آبجیکٹ ماسک خود بخود تیار کریں۔
محققین CT اور MRI اسکینوں میں اعضاء اور ٹیومر کا خاکہ بنانے کے لیے SAM (جیسے، MedSAM) کو اپناتے ہیں۔
تصویر اور ویڈیو ایڈیٹرز ایک کلک سے مضامین کو کاٹنے یا پس منظر کو ہٹانے کے لیے SAM کو مربوط کرتے ہیں۔
SAM 2 اے آر ایفیکٹس اور روبوٹکس پرسیپشن کے لیے تمام ویڈیو فریموں میں اشیاء کو ٹریک اور سیگمنٹ کرتا ہے۔
خطرات اور گارڈریلز
تصویر کے حقوق اور رضامندی قانونی خطرات بن سکتے ہیں اگر ثبوت واضح نہ ہو۔
ماڈل کی کارکردگی روشنی، ڈیموگرافکس اور ماحول میں مختلف ہو سکتی ہے۔
جب تک اعتماد کی حدوں کی نگرانی نہ کی جائے غلط مثبتات پر کسی کا دھیان نہیں جا سکتا۔
نفاذ کا روڈ میپ
درستگی، یاد کرنے، اور غلطی کے اخراجات کے لیے قبولیت کے معیار کی وضاحت کریں۔
اعداد و شمار کے ساتھ ٹیسٹ کریں جو حقیقی پیداوار کے حالات سے میل کھاتا ہے۔
کم اعتماد یا زیادہ اثر والی پیشین گوئیوں کے لیے انسانی جائزہ شامل کریں۔
کیمرہ یا ڈیٹاسیٹ کی تبدیلیوں کے بعد ماڈل ڈرفٹ کو ٹریک کریں اور دوبارہ تصدیق کریں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Segment Anything Model quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
مستقل مزاجی کے ماڈل
اکثر پوچھے گئے سوالات
What is Segment Anything Model?
Segment Anything Model (SAM) Meta تصویر کی تقسیم کے لیے AI کا فاؤنڈیشن ماڈل ہے: ایک نقطہ، باکس، یا کسی حد تک اشارہ دیا جائے، یہ فوری طور پر متعلقہ شے کا خاکہ بناتا ہے۔ اسے ان اشیاء اور تصاویر کو عام کرنے کے لیے بنایا گیا تھا جو اس نے تربیت کے دوران کبھی نہیں دیکھے تھے، جس سے سیگمنٹیشن کو ایک فوری کام بنایا گیا تھا۔
کون سا بنیادی خیال SAM کو سیگمنٹیشن کے لیے 'فاؤنڈیشن ماڈل' بناتا ہے؟
SAM سیگمنٹیشن کو فوری طور پر ری فریم کرتا ہے اور اسے اس کے تربیتی سیٹ سے باہر اشیاء اور تصاویر میں زیرو شاٹ ٹرانسفر کے لیے ڈیزائن کیا گیا تھا۔
SAM کو تربیت دینے کے لیے استعمال ہونے والا SA-1B ڈیٹا سیٹ تقریباً کتنا بڑا ہے؟
SA-1B تقریباً 11 ملین تصاویر پر 1 بلین ماسک پر مشتمل ہے، جو ایک ماڈل-ان-دی-لوپ تشریح انجن کے ساتھ بنایا گیا ہے۔
SAM اپنے فن تعمیر کو ہیوی امیج انکوڈر اور ہلکے وزن کے پرامپٹ انکوڈر/ڈیکوڈر میں کیوں تقسیم کرتا ہے؟
مہنگی امیج انکوڈنگ ایک بار چلتی ہے۔ پھر سستے پرامپٹ انکوڈنگ اور ماسک ڈی کوڈنگ ایک ہی تصویر کو تیز، انٹرایکٹو ری پرامٹنگ کی اجازت دیتے ہیں۔
SAM ایک مبہم پرامپٹ کو کیسے ہینڈل کرتا ہے، جیسے کہ ایک کلک جس کا مطلب کئی اشیاء ہو سکتا ہے؟
SAM اسکور کے ساتھ کئی امیدواروں کے ماسک تیار کرتا ہے تاکہ ابہام کو درجہ بندی یا اضافی اشارے سے حل کیا جا سکے۔
ان پٹ امیج کو انکوڈ کرنے کے لیے SAM کس قسم کی بیک بون استعمال کرتا ہے؟
SAM کا امیج انکوڈر ایک وژن ٹرانسفارمر ہے، جو اکثر ماسک شدہ آٹو انکوڈنگ کے ساتھ پہلے سے تربیت یافتہ ہوتا ہے، جس سے ایک گھنی امیج ایمبیڈنگ ہوتی ہے۔