РЪКОВОДСТВО за визуален AI

Сегментирайте всичко модел

Моделът Segment Anything (SAM) е основният модел на Meta AI за сегментиране на изображения: дадена точка, кутия или груб намек, той незабавно очертава съответния обект.

2 min readПоследна актуализация

Преглед

It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.

Дълбоко гмуркане

Издаден от Meta AI през 2023 г., SAM прерамкира сегментирането като проблем, който може да бъде подканян: вие му давате подкана (щракване, кутия, маска или извлечена от текст подсказка) и тя връща една или повече маски на обекти. Силата му идва отчасти от мащаба: той беше обучен на SA-1B, набор от данни от над 1 милиард маски в 11 милиона изображения, изграден с машина за анотации модел в цикъла. Архитектурно, SAM има тежък енкодер на изображения, изпълняван веднъж на изображение, олекотен енкодер за подкани и бърз декодер за маска, така че едно вградено изображение може да бъде повторно подканено интерактивно в реално време. Позволява безпроблемно прехвърляне към много задачи. SAM 2, издаден през 2024 г., разширява това до видео, проследявайки обекти през кадри.

Техническа информация

SAM използва енкодер за изображение Vision Transformer (ViT), често предварително обучен с маскирано автоматично кодиране, за да създаде плътно вграждане на изображение. Подканите се кодират в токени, а декодер, базиран на трансформатор с кръстосано внимание, слива токени за подкани с вграждане на изображението в изходни маски плюс резултати за доверие. За разрешаване на двусмислието (едно щракване може да означава копче, риза или човек), SAM прогнозира няколко валидни маски наведнъж и ги класира, като позволява използването надолу по веригата или допълнителните подкани да разсеят двусмислието.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на модела Segment Anything

SAM се превърна в гръбнак по подразбиране за инструменти за анотации, медицински изображения, роботика и AR тръбопроводи, често съчетани с детектори или текстови модели за работни потоци „сегментиране по име“ с отворен речник. Очаквайте по-леки, по-бързи варианти (MobileSAM, EfficientSAM) за използване на устройството, по-дълбока интеграция с език за изцяло управлявано от текст сегментиране и непрекъснато разширяване във видео и 3D. Като основен модел, неговите вграждания все повече се използват повторно като слой на възприятие, захранващ други системи.

Внедряване в реалния свят

Платформите за анотации на изображения използват SAM, за да позволят на етикетиращите да щракнат веднъж и автоматично да генерират точни маски на обекти, намалявайки времето за етикетиране.

Изследователите адаптират SAM (напр. MedSAM), за да очертаят органи и тумори при CT и MRI сканирания.

Фото и видео редакторите интегрират SAM за изрязване на обекти или премахване на фонове с едно щракване.

SAM 2 проследява и сегментира обекти във видео рамки за AR ефекти и роботизирано възприятие.

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Segment Anything Model quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Модели на последователност

Frequently asked questions

What is Segment Anything Model?

Моделът Segment Anything (SAM) е основният модел на Meta AI за сегментиране на изображения: дадена точка, кутия или груб намек, той незабавно очертава съответния обект. Той е създаден, за да обобщава обекти и изображения, които никога не е виждал по време на обучение, което прави сегментирането бърза задача.

Каква основна идея прави SAM „основен модел“ за сегментиране?

SAM преформулира сегментирането като подлежащо на подканване и е проектирано за нулев изстрел трансфер към обекти и изображения извън неговия набор за обучение.

Приблизително колко голям е наборът от данни SA-1B, използван за обучение на SAM?

SA-1B съдържа над 1 милиард маски на около 11 милиона изображения, създадени с машина за анотации модел в цикъла.

Защо SAM разделя своята архитектура на тежък енкодер за изображения и лек енкодер/декодер за подкани?

Скъпото кодиране на изображения се изпълнява веднъж; след това евтиното бързо кодиране и масковото декодиране позволяват бързо, интерактивно повторно подканване на същото изображение.

Как SAM обработва двусмислена подкана, като едно кликване, което може да означава няколко обекта?

SAM извежда няколко кандидат маски с резултати, така че неяснотата може да бъде разрешена чрез класиране или допълнителни подкани.

Какъв тип гръбнак използва SAM за кодиране на входното изображение?

Кодерът на изображения на SAM е Vision Transformer, често предварително обучен с маскирано автоматично кодиране, създавайки плътно вграждане на изображение.