সেগমেন্ট এনিথিং মডেল
সেগমেন্ট এনিথিং মডেল (SAM) হল Meta ছবি বিভাজনের জন্য AI এর ভিত্তি মডেল: একটি বিন্দু, বাক্স বা রুক্ষ ইঙ্গিত দেওয়া হলে, এটি সঙ্গে সঙ্গে সংশ্লিষ্ট বস্তুর রূপরেখা দেয়।
ওভারভিউ
It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.
গভীর ডুব
2023 সালে Meta AI দ্বারা প্রকাশিত, SAM একটি প্রম্পটযোগ্য সমস্যা হিসাবে সেগমেন্টেশনকে রিফ্রেম করে: আপনি এটিকে একটি প্রম্পট দেন (একটি ক্লিক, একটি বাক্স, একটি মাস্ক, বা পাঠ্য থেকে প্রাপ্ত ইঙ্গিত) এবং এটি এক বা একাধিক অবজেক্ট মাস্ক ফেরত দেয়৷ এর শক্তি আংশিকভাবে স্কেল থেকে আসে: এটি SA-1B-তে প্রশিক্ষিত হয়েছিল, 11 মিলিয়ন ইমেজ জুড়ে 1 বিলিয়ন মাস্কের একটি ডেটাসেট, একটি মডেল-ইন-দ্য-লুপ টীকা ইঞ্জিন দিয়ে তৈরি। স্থাপত্যগতভাবে, SAM-এ একটি ভারী ইমেজ এনকোডার রয়েছে যা প্রতি ছবিতে একবার চালানো হয়, একটি লাইটওয়েট প্রম্পট এনকোডার এবং একটি দ্রুত মাস্ক ডিকোডার, তাই একটি একক এমবেড করা ছবিকে রিয়েল টাইমে ইন্টারেক্টিভভাবে পুনরায় প্রম্পট করা যেতে পারে। এটি অনেক কাজে শূন্য-শট স্থানান্তর সক্ষম করে। 2024 সালে প্রকাশিত SAM 2, এটিকে ভিডিওতে প্রসারিত করে, ফ্রেম জুড়ে অবজেক্ট ট্র্যাক করে।
প্রযুক্তিগত অন্তর্দৃষ্টি
SAM একটি ভিশন ট্রান্সফরমার (ViT) ইমেজ এনকোডার ব্যবহার করে, প্রায়শই মুখোশযুক্ত অটোএনকোডিং এর সাথে প্রশিক্ষিত, একটি ঘন ইমেজ এম্বেডিং তৈরি করতে। প্রম্পটগুলি টোকেনে এনকোড করা হয়, এবং ক্রস-অ্যাটেনশন সহ একটি ট্রান্সফরমার-ভিত্তিক ডিকোডার আউটপুট মাস্ক প্লাস কনফিডেন্স স্কোরে ইমেজ এম্বেড করার সাথে প্রম্পট টোকেন ফিউজ করে। অস্পষ্টতা সমাধান করতে (একটি ক্লিকের অর্থ একটি বোতাম, একটি শার্ট বা একজন ব্যক্তি হতে পারে), SAM একবারে বেশ কয়েকটি বৈধ মুখোশের ভবিষ্যদ্বাণী করে এবং সেগুলিকে র্যাঙ্ক করে, ডাউনস্ট্রিম ব্যবহার বা অতিরিক্ত প্রম্পটগুলিকে দ্ব্যর্থতাহীন হতে দেয়৷
কৌশলগত প্রভাব
গতি এবং স্কেল
ভিজ্যুয়াল এআই স্কেলে পরিদর্শন, সনাক্তকরণ এবং ট্যাগিং কাজগুলি স্বয়ংক্রিয়ভাবে করতে পারে।
পছন্দগুলি তৈরি করুন
সৃজনশীল দলগুলি কম ম্যানুয়াল সংশোধন সহ ধারণাগুলিকে দ্রুত প্রোটোটাইপ করতে পারে।
টিম এবং ওয়ার্কফ্লো
অপারেশনগুলি ইমেজ এবং ভিডিও সংকেত ব্যবহার করতে পারে যা আগে প্রক্রিয়া করা কঠিন ছিল।
সেগমেন্ট এনিথিং মডেলের ভবিষ্যত
এসএএম টীকা সরঞ্জাম, মেডিকেল ইমেজিং, রোবোটিক্স এবং এআর পাইপলাইনগুলির জন্য একটি ডিফল্ট ব্যাকবোন হয়ে উঠেছে, প্রায়শই খোলা শব্দভান্ডারের 'নাম অনুসারে সেগমেন্ট' ওয়ার্কফ্লোগুলির জন্য ডিটেক্টর বা টেক্সট মডেলগুলির সাথে যুক্ত। অন-ডিভাইস ব্যবহারের জন্য হালকা, দ্রুত ভেরিয়েন্ট (MobileSAM, EfficientSAM), সম্পূর্ণ টেক্সট-চালিত সেগমেন্টেশনের জন্য ভাষার সাথে গভীর একীকরণ এবং ভিডিও এবং 3D তে ক্রমাগত সম্প্রসারণের প্রত্যাশা করুন। একটি ফাউন্ডেশন মডেল হিসাবে, এর এম্বেডিংগুলি ক্রমবর্ধমানভাবে একটি উপলব্ধি স্তর হিসাবে পুনঃব্যবহৃত হচ্ছে যা অন্যান্য সিস্টেমকে খাওয়ানো হয়।
বাস্তব-বিশ্ব বাস্তবায়ন
ইমেজ-টীকা প্ল্যাটফর্মগুলি লেবেলারদের একবার ক্লিক করতে এবং লেবেলিংয়ের সময় কমিয়ে সুনির্দিষ্ট অবজেক্ট মাস্ক স্বয়ংক্রিয়ভাবে তৈরি করতে SAM ব্যবহার করে।
গবেষকরা সিটি এবং এমআরআই স্ক্যানে অঙ্গ এবং টিউমারের রূপরেখার জন্য SAM (যেমন, MedSAM) মানিয়ে নেন।
ফটো এবং ভিডিও এডিটররা SAM কে একীভূত করে বিষয়গুলিকে কাটছাঁট করতে বা একক ক্লিকে ব্যাকগ্রাউন্ড মুছে ফেলতে।
SAM 2 এআর ইফেক্ট এবং রোবোটিক্স উপলব্ধির জন্য ভিডিও ফ্রেম জুড়ে অবজেক্ট ট্র্যাক এবং সেগমেন্ট করে।
ঝুঁকি এবং প্রহরী
প্রমাণ অস্পষ্ট হলে ছবির অধিকার এবং সম্মতি আইনি ঝুঁকিতে পরিণত হতে পারে।
মডেলের কর্মক্ষমতা আলো, জনসংখ্যা এবং পরিবেশ জুড়ে পরিবর্তিত হতে পারে।
আস্থার থ্রেশহোল্ডগুলি পর্যবেক্ষণ করা না হলে মিথ্যা ইতিবাচকগুলি অলক্ষিত হতে পারে।
বাস্তবায়ন রোডম্যাপ
নির্ভুলতা, প্রত্যাহার, এবং ত্রুটি খরচের জন্য গ্রহণযোগ্যতার মানদণ্ড নির্ধারণ করুন।
প্রকৃত উৎপাদন অবস্থার সাথে মেলে এমন ডেটা দিয়ে পরীক্ষা করুন।
কম-আস্থা বা উচ্চ-প্রভাব ভবিষ্যদ্বাণীর জন্য মানুষের পর্যালোচনা যোগ করুন।
মডেল ড্রিফ্ট ট্র্যাক করুন এবং ক্যামেরা বা ডেটাসেট পরিবর্তনের পরে পুনরায় যাচাই করুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Segment Anything Model quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
সামঞ্জস্যপূর্ণ মডেল
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Segment Anything Model?
সেগমেন্ট এনিথিং মডেল (SAM) হল Meta ছবি বিভাজনের জন্য AI এর ভিত্তি মডেল: একটি বিন্দু, বাক্স বা রুক্ষ ইঙ্গিত দেওয়া হলে, এটি সঙ্গে সঙ্গে সংশ্লিষ্ট বস্তুর রূপরেখা দেয়। এটি এমন বস্তু এবং চিত্রগুলির সাধারণীকরণের জন্য তৈরি করা হয়েছিল যা এটি প্রশিক্ষণের সময় কখনও দেখেনি, বিভাজন একটি প্রম্পটযোগ্য কাজ করে তোলে।
কোন মূল ধারণা SAM কে সেগমেন্টেশনের জন্য 'ফাউন্ডেশন মডেল' করে তোলে?
SAM সেগমেন্টেশনকে প্রম্পটেবল হিসাবে রিফ্রেম করে এবং এটির প্রশিক্ষণ সেটের বাইরে বস্তু এবং চিত্রগুলিতে শূন্য-শট স্থানান্তরের জন্য ডিজাইন করা হয়েছিল।
মোটামুটিভাবে কত বড় SA-1B ডেটাসেট SAM প্রশিক্ষণের জন্য ব্যবহৃত হয়?
SA-1B-এ প্রায় 11 মিলিয়ন ছবিতে 1 বিলিয়নের বেশি মুখোশ রয়েছে, যা একটি মডেল-ইন-দ্য-লুপ টীকা ইঞ্জিন দিয়ে তৈরি।
কেন SAM তার আর্কিটেকচারকে একটি ভারী ইমেজ এনকোডার এবং একটি লাইটওয়েট প্রম্পট এনকোডার/ডিকোডারে বিভক্ত করে?
ব্যয়বহুল ইমেজ এনকোডিং একবার সঞ্চালিত হয়; তারপর সস্তা প্রম্পট এনকোডিং এবং মাস্ক ডিকোডিং একই চিত্রের দ্রুত, ইন্টারেক্টিভ রি-প্রম্পটিংয়ের অনুমতি দেয়।
SAM কিভাবে একটি অস্পষ্ট প্রম্পট পরিচালনা করে, যেমন একটি একক ক্লিক যার অর্থ বিভিন্ন বস্তু হতে পারে?
SAM স্কোর সহ একাধিক প্রার্থীর মুখোশ আউটপুট করে যাতে অস্পষ্টতা র্যাঙ্কিং বা অতিরিক্ত প্রম্পট দ্বারা সমাধান করা যায়।
ইনপুট ইমেজ এনকোড করতে SAM কোন ধরনের ব্যাকবোন ব্যবহার করে?
SAM-এর ইমেজ এনকোডার হল একটি ভিশন ট্রান্সফরমার, প্রায়শই মুখোশযুক্ত অটোএনকোডিং এর সাথে প্রশিক্ষিত, একটি ঘন ইমেজ এম্বেডিং তৈরি করে।