РЪКОВОДСТВО за визуален AI

Паноптична сегментация

Паноптичната сегментация дава на всеки отделен пиксел в изображение етикет, обединяващ „какъв е този регион“ с „кой конкретен обект е това“. Това е най-пълната форма на разбиране на сцена в компютърното зрение.

2 min readПоследна актуализация

Дълбоко гмуркане

Компютърното зрение дълго време имаше две отделни задачи. Семантичното сегментиране етикетира всеки пиксел по категория (път, небе, човек), но не може да различи двама души. Сегментирането на екземпляри намира и очертава отделни изброими обекти, но игнорира фонови „неща“ като небе или трева. Паноптичната сегментация, формализирана от изследователите на Facebook AI през 2018 г., обединява и двете: присвоява на всеки пиксел категория, а за преброими „неща“ също присвоява уникален идентификатор на екземпляр. Резултатът е една съгласувана карта без пропуски или припокривания. Качеството се измерва чрез Panoptic Quality (PQ), което съчетава колко точно се разпознават регионите с това колко добре съвпадат техните граници. От съществено значение е навсякъде, където машината трябва да разбере напълно цяла сцена, като например самоуправляваща се кола, интерпретираща улица.

Техническа информация

Паноптичните модели разделят етикетите на „неща“ (изброими обекти като коли и хора, които получават идентификатори на екземпляри) и „неща“ (аморфни региони като път или небе, които не го правят). Ранните системи изпълняваха отделни семантични и екземплярни клонове, след което ги сляха с правила за разрешаване на пикселни конфликти. По-нови методи, базирани на трансформатор, като Mask2Former, предсказват директно набор от маски със свързани етикети на класове, обработвайки както неща, така и неща в една унифицирана архитектура.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на паноптичното сегментиране

Полето се консолидира около унифицирани трансформаторни архитектури, базирани на заявки, които обработват семантични, екземплярни и панорамни задачи с един модел. Изследванията се насочват към видеопаноптична сегментация, която поддържа идентичността на екземплярите последователна в кадрите, модели с отворен речник, които сегментират категории, описани в текст, и по-леки модели, достатъчно ефективни за роботи и превозни средства. По-добрите синтетични данни за обучение и самоконтролът намаляват високата цена на перфектното до пиксели ръчно анотиране.

Внедряване в реалния свят

Автономни превозни средства, изграждащи пълна карта на ниво пиксел, разграничаваща всяка кола, пешеходец, път и тротоар

Медицинско изображение, което маркира области на органи, докато брои отделни лезии или клетки

Приложения за разширена реалност, които отделят всеки обект и повърхност, за да поставят реалистично виртуално съдържание

Роботизирани системи, които напълно анализират претрупана сцена, за да планират хващане и навигация

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Panoptic Segmentation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Сегментиране на изображението

Frequently asked questions

What is Panoptic Segmentation?

Паноптичната сегментация дава на всеки отделен пиксел в изображение етикет, обединяващ „какъв е този регион“ с „кой конкретен обект е това“. Това е най-пълната форма на разбиране на сцена в компютърното зрение.

Какво присвоява паноптичното сегментиране на всеки пиксел в изображение?

Паноптичното сегментиране обозначава всеки пиксел с категория и допълнително дава на броя „неща“ уникален идентификатор на екземпляр, без да оставя пропуски или припокривания.

В паноптична терминология какво представляват класовете „неща“?

„Неща“ се отнася до безброй, аморфни фонови региони като небе или път, които получават категория, но не идентификационен номер на екземпляр.

Кое е основното ограничение на семантичното сегментиране, което паноптичното сегментиране преодолява?

Семантичното сегментиране етикетира пикселите по категория, но не може да раздели двама души един от друг; panoptic добавя самоличност на екземпляр.

Кой показател се използва за оценка на качеството на паноптичното сегментиране?

Panoptic Quality (PQ) съчетава точността на разпознаване с припокриване на сегментиране, за да оцени колко добре са предвидени нещата и други неща.

Какво получават класовете „неща“, което не получават класовете „неща“?

Изброимите „неща“ получават уникален идентификатор на екземпляр, така че отделните обекти да могат да бъдат разграничени, докато „нещата“ получават само категория.