Сегментируйте любую модель
Модель Segment Anything Model (SAM) — это Meta базовая модель ИИ для сегментации изображений: при наличии точки, прямоугольника или грубой подсказки он мгновенно выделяет соответствующий объект.
Обзор
It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.
Глубокое погружение
Выпущенный Meta AI в 2023 году, SAM переосмысливает сегментацию как проблему, требующую подсказки: вы даете ей подсказку (щелчок, поле, маска или текстовая подсказка), и она возвращает одну или несколько масок объекта. Его мощь частично обусловлена масштабом: он был обучен на SA-1B, наборе данных, содержащем более 1 миллиарда масок на 11 миллионах изображений, созданном с помощью механизма аннотаций «модель в цикле». Архитектурно SAM имеет мощный кодировщик изображений, запускаемый один раз для каждого изображения, облегченный кодировщик подсказок и быстрый декодер маски, поэтому одно встроенное изображение может повторно запрашиваться в интерактивном режиме в реальном времени. Это обеспечивает нулевую передачу для многих задач. SAM 2, выпущенный в 2024 году, расширяет возможности видео, отслеживая объекты по кадрам.
Техническая информация
SAM использует кодировщик изображений Vision Transformer (ViT), часто предварительно обученный маскированному автокодированию, для создания плотного встраивания изображений. Подсказки кодируются в токены, а декодер на основе преобразователя с предохранителями перекрестного внимания подсказывает токены с встраиванием изображения для выходных масок плюс оценки достоверности. Чтобы устранить неоднозначность (щелчок может означать кнопку, рубашку или человека), SAM прогнозирует несколько действительных масок одновременно и ранжирует их, позволяя использовать последующие или дополнительные подсказки для устранения неоднозначности.
Стратегическое воздействие
Скорость и масштаб
Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.
Выбор сборки
Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.
Команда и рабочий процесс
Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.
Будущее модели сегментации чего угодно
SAM стал основой по умолчанию для инструментов аннотирования, медицинской визуализации, робототехники и конвейеров AR, часто в сочетании с детекторами или текстовыми моделями для рабочих процессов «сегментации по имени» с открытым словарем. Ожидайте более легкие и быстрые варианты (MobileSAM, EfficientSAM) для использования на устройстве, более глубокую интеграцию с языком для полностью текстовой сегментации и дальнейшее расширение видео и 3D. В качестве базовой модели ее вложения все чаще используются повторно в качестве уровня восприятия, питающего другие системы.
Реальная реализация
Платформы аннотаций изображений используют SAM, чтобы позволить маркировщикам щелкнуть один раз и автоматически сгенерировать точные маски объектов, сокращая время маркировки.
Исследователи адаптируют SAM (например, MedSAM) для определения органов и опухолей на КТ и МРТ.
Редакторы фотографий и видео интегрируют SAM, позволяющий вырезать объекты или удалять фон одним щелчком мыши.
SAM 2 отслеживает и сегментирует объекты по видеокадрам для создания AR-эффектов и восприятия робототехники.
Риски и ограничения
Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.
Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.
Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.
Дорожная карта реализации
Определите критерии приемки точности, стоимости отзыва и ошибок.
Тестируйте с данными, которые соответствуют реальным производственным условиям.
Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.
Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Segment Anything Model quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Модели согласованности
Часто задаваемые вопросы
What is Segment Anything Model?
Модель Segment Anything Model (SAM) — это Meta базовая модель ИИ для сегментации изображений: при наличии точки, прямоугольника или грубой подсказки он мгновенно выделяет соответствующий объект. Он был создан для обобщения объектов и изображений, которые он никогда не видел во время обучения, что делает сегментацию быстрой задачей.
Какая основная идея делает SAM «базовой моделью» сегментации?
SAM переосмысливает сегментацию как подсказку и был разработан для нулевой передачи объектов и изображений за пределами своего обучающего набора.
Какой примерно объем набора данных SA-1B используется для обучения SAM?
SA-1B содержит более 1 миллиарда масок примерно для 11 миллионов изображений, созданных с помощью механизма аннотаций модели в цикле.
Почему SAM разделяет свою архитектуру на тяжелый кодер изображений и легкий кодер/декодер мгновенных сообщений?
Дорогостоящее кодирование изображений выполняется один раз; затем дешевое кодирование подсказок и декодирование по маске позволяют быстро и интерактивно повторно запрашивать одно и то же изображение.
Как SAM обрабатывает неоднозначное приглашение, например, один щелчок может означать несколько объектов?
SAM выводит несколько масок кандидатов с оценками, поэтому неоднозначность можно устранить путем ранжирования или дополнительных подсказок.
Какой тип магистрали использует SAM для кодирования входного изображения?
Кодер изображений SAM представляет собой Vision Transformer, часто предварительно обученный с помощью маскированного автокодирования, обеспечивающий плотное встраивание изображений.