Визуальное руководство по искусственному интеллекту

Паноптическая сегментация

Паноптическая сегментация дает каждому пикселю изображения метку, объединяющую «что это за область» и «что это за конкретный объект». Это наиболее полная форма понимания сцены в компьютерном зрении.

2 минуты чтенияПоследнее обновление

Глубокое погружение

Компьютерное зрение долгое время решало две отдельные задачи. Семантическая сегментация маркирует каждый пиксель по категориям (дорога, небо, человек), но не позволяет отличить двух людей. Сегментация экземпляров находит и выделяет отдельные счетные объекты, но игнорирует фоновые «вещи», такие как небо или трава. Паноптическая сегментация, формализованная исследователями искусственного интеллекта Facebook в 2018 году, объединяет оба подхода: каждому пикселю присваивается категория, а для счетных «вещей» также присваивается уникальный идентификатор экземпляра. В результате получается единая последовательная карта без пробелов и наложений. Качество измеряется Panoptic Quality (PQ), которое сочетает в себе точность распознавания регионов и соответствие их границ. Это важно везде, где машина должна полностью понимать всю сцену, например, когда беспилотный автомобиль интерпретирует улицу.

Техническая информация

Паноптические модели разделяют метки на «вещи» (исчисляемые объекты, такие как машины и люди, которые получают идентификаторы экземпляров) и «материалы» (аморфные области, такие как дорога или небо, которые не имеют). Ранние системы использовали отдельные семантические ветви и ветви экземпляров, а затем объединяли их с правилами для разрешения конфликтов пикселей. Новые методы на основе преобразователей, такие как Mask2Former, напрямую прогнозируют набор масок со связанными метками классов, обрабатывая как вещи, так и прочее в одной унифицированной архитектуре.

Стратегическое воздействие

Скорость и масштаб

Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.

Выбор сборки

Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.

Команда и рабочий процесс

Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.

Будущее паноптической сегментации

Эта область консолидируется вокруг унифицированных архитектур преобразователей на основе запросов, которые решают семантические, экземплярные и паноптические задачи с помощью одной модели. Исследования направлены на паноптическую сегментацию видео, которая обеспечивает единообразие идентификаторов экземпляров во всех кадрах, модели с открытым словарным запасом, которые сегментируют категории, описанные в тексте, и более легкие модели, достаточно эффективные для роботов и транспортных средств. Более качественные синтетические данные обучения и самоконтроль снижают высокую стоимость ручного аннотирования с точностью до пикселя.

Реальная реализация

Автономные транспортные средства создают полную карту на уровне пикселей, различающую каждый автомобиль, пешехода, дорогу и тротуар.

Медицинская визуализация, которая маркирует области органов и подсчитывает отдельные поражения или клетки

Приложения дополненной реальности, которые разделяют каждый объект и поверхность для реалистичного размещения виртуального контента.

Робототехнические системы, которые полностью анализируют захламленную сцену, чтобы спланировать захват и навигацию.

Риски и ограничения

Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.

Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.

Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.

Дорожная карта реализации

1

Определите критерии приемки точности, стоимости отзыва и ошибок.

2

Тестируйте с данными, которые соответствуют реальным производственным условиям.

3

Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.

4

Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Panoptic Segmentation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Сегментация изображений

Часто задаваемые вопросы

What is Panoptic Segmentation?

Паноптическая сегментация дает каждому пикселю изображения метку, объединяющую «что это за область» и «что это за конкретный объект». Это наиболее полная форма понимания сцены в компьютерном зрении.

Что паноптическая сегментация присваивает каждому пикселю изображения?

Паноптическая сегментация помечает каждый пиксель категорией и дополнительно дает счетным «вещам» уникальный идентификатор экземпляра, не оставляя пробелов или перекрытий.

Что такое «вещественные» классы в паноптической терминологии?

«Вещи» относятся к бесчисленным аморфным фоновым областям, таким как небо или дорога, которым присваивается категория, но не присваивается идентификатор экземпляра.

Каково основное ограничение семантической сегментации, которое преодолевает паноптическая сегментация?

Семантическая сегментация маркирует пиксели по категориям, но не может отделить двух людей друг от друга; panoptic добавляет идентичность экземпляра.

Какая метрика используется для оценки качества паноптической сегментации?

Panoptic Quality (PQ) сочетает в себе точность распознавания с перекрытием сегментации, чтобы оценить, насколько хорошо прогнозируются вещи и прочее.

Что получают классы «вещей», а классы «вещей» — нет?

Счетные «вещи» получают уникальный идентификатор экземпляра, поэтому отдельные объекты можно отличить друг от друга, тогда как «вещи» получают только категорию.