Регионално базирани CNN
Регионално базираните CNN (R-CNN) са семейство от детектори на обекти, които първо предлагат кандидат региони в изображение, след което използват CNN, за да класифицират и прецизно поставят в кутия всеки обект.
Преглед
They turned image classification into full object detection, locating and labeling many objects at once.
Дълбоко гмуркане
Класификацията на изображения отговаря на „какво има на тази снимка?“ но откриването също трябва да отговаря на „къде и колко?“ Оригиналният R-CNN (2014) използва външен алгоритъм (селективно търсене), за да предложи около 2000 региона, изкриви всеки до фиксиран размер и пусна CNN на всеки един, което беше точно, но болезнено бавно. Бързият R-CNN ускори това, като пусна CNN веднъж върху цялото изображение и обедини функциите за регион (обединяване на ROI). След това по-бързият R-CNN замени селективното търсене с научена мрежа за предложения за региони (RPN), което направи цялата линия от край до край и почти в реално време. Маска R-CNN го разшири допълнително, за да изведе маски на ниво пиксел за всеки открит обект.
Техническа информация
Ключовият скок в ефективността е обединяването на възвръщаемостта на инвестициите: вместо да пусне повторно CNN на всяко предложено поле, мрежата изчислява една споделена карта на характеристиките за изображението, след което изрязва и преоразмерява характеристиките във всеки интересен регион към фиксирана мрежа. По-бързият RPN на R-CNN се плъзга върху тази карта на характеристиките, предвиждайки резултати за „обектност“ и корекции на кутии за предварително зададени анкерни кутии с различни размери и пропорции, генерирайки предложения почти безплатно.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на регионалните CNN
Двустепенните R-CNN детектори остават силни там, където точността има най-голямо значение, но едностепенните детектори (YOLO, SSD) и базираните на трансформатор детектори като DETR, които пропускат изцяло ръчно проектираните котви и предложения, стават все по-популярни заради скоростта и простотата. Тенденцията е към откриване от край до край, без закотвяне, базирано на заявки. И все пак, основните идеи на линията на R-CNN, споделените функции и разсъжденията на регионално ниво продължават да влияят върху системите за сегментиране, видео и 3D откриване.
Внедряване в реалния свят
Откриване и преброяване на продукти на рафтовете на дребно за управление на инвентара
Сегментиране на екземпляри на клетки или органи в медицински сканирания с помощта на Mask R-CNN
Идентифициране на дефекти и тяхното местоположение на фабрична производствена линия
Локализиране на множество превозни средства и пешеходци в емисии на камера за автономно шофиране
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Region-Based CNNs quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Генеративни модели, базирани на резултати
Frequently asked questions
What is Region-Based CNNs?
Регионално базираните CNN (R-CNN) са семейство от детектори на обекти, които първо предлагат кандидат региони в изображение, след което използват CNN, за да класифицират и прецизно поставят в кутия всеки обект. Те превърнаха класифицирането на изображения в пълно откриване на обекти, локализиране и етикетиране на много обекти наведнъж.
Каква е основната идея на регионално базирана CNN?
R-CNN предлагат региони, които могат да съдържат обекти, след което стартират CNN, за да класифицират всеки регион и да прецизират неговата ограничителна кутия.
Защо оригиналният R-CNN (2014) беше бавен?
Оригиналният R-CNN управляваше CNN независимо от приблизително 2000 предложения за регион на изображение, което беше изключително скъпо от изчислителна гледна точка.
Какво въведе Faster R-CNN, за да замени селективното търсене?
По-бърз R-CNN въведе научена регионална мрежа за предложения, правейки генерирането на предложения част от обучаемата мрежа и много по-бързо.
Какво постига обединяването на ROI?
Обединяването на RoI извлича решетки с фиксирани размери от една споделена карта на характеристики за регион, като избягва повторното изчисляване и ускорява откриването.
Какви допълнителни възможности добавя Mask R-CNN?
Mask R-CNN разширява Faster R-CNN чрез предвиждане на точна маска на ниво пиксел за всеки обект, което позволява сегментиране на екземпляри.