CNN regionalne
Sieci CNN oparte na regionach (R-CNN) to rodzina detektorów obiektów, które najpierw proponują obszary kandydujące na obrazie, a następnie wykorzystują CNN do klasyfikacji i precyzyjnego umieszczania w ramkach każdego obiektu.
Przegląd
They turned image classification into full object detection, locating and labeling many objects at once.
Głębokie nurkowanie
Klasyfikacja obrazu odpowiada na pytanie „co jest na tym obrazku?” ale wykrywanie musi także odpowiadać na pytania: „gdzie i ile?” Oryginalna stacja R-CNN (2014) wykorzystała zewnętrzny algorytm (wyszukiwanie selektywne), aby zaproponować około 2000 regionów, zniekształciła każdy z nich do ustalonego rozmiaru i na każdym z nich uruchomiła CNN, co było dokładne, ale boleśnie powolne. Szybka R-CNN przyspieszyła to, uruchamiając CNN raz na całym obrazie i łącząc funkcje dla każdego regionu (łączenie ROI). Szybsza sieć R-CNN zastąpiła następnie wyszukiwanie selektywne wyszkoloną siecią propozycji regionów (RPN), dzięki czemu cały rurociąg był kompleksowy i realizowany niemal w czasie rzeczywistym. Maska R-CNN rozszerzyła tę funkcję, tworząc maski na poziomie pikseli dla każdego wykrytego obiektu.
Wgląd techniczny
Kluczowym skokiem w wydajności jest łączenie ROI: zamiast ponownie uruchamiać CNN na każdym proponowanym urządzeniu, sieć oblicza jedną wspólną mapę obiektów dla obrazu, a następnie przycina i zmienia rozmiar obiektów w każdym interesującym regionie do stałej siatki. Szybciej RPN R-CNN przesuwa się po tej mapie obiektów, przewidując wyniki „obiektywności” i korekty ramek dla wstępnie ustawionych bloków kontrolnych o różnych rozmiarach i proporcjach, generując propozycje niemal za darmo.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość regionalnych CNN
Dwustopniowe detektory R-CNN pozostają mocne tam, gdzie dokładność ma największe znaczenie, ale detektory jednostopniowe (YOLO, SSD) i detektory oparte na transformatorach, takie jak DETR, które całkowicie pomijają ręcznie zaprojektowane kotwice i propozycje, są coraz bardziej popularne ze względu na szybkość i prostotę. Trend polega na wykrywaniu kompleksowym, pozbawionym kotwic i opartym na zapytaniach. Mimo to podstawowe idee, wspólne funkcje i rozumowanie linii R-CNN nadal wpływają na systemy segmentacji, wideo i detekcji 3D.
Implementacja w świecie rzeczywistym
Wykrywanie i liczenie produktów na półkach detalicznych w celu zarządzania zapasami
Segmentacja komórek lub narządów na skanach medycznych przy użyciu maski R-CNN
Identyfikacja usterek i ich lokalizacji na fabrycznej linii produkcyjnej
Lokalizowanie wielu pojazdów i pieszych na obrazach z kamer pojazdów autonomicznych
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Region-Based CNNs quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Modele generatywne oparte na wynikach
Często zadawane pytania
What is Region-Based CNNs?
Sieci CNN oparte na regionach (R-CNN) to rodzina detektorów obiektów, które najpierw proponują obszary kandydujące na obrazie, a następnie wykorzystują CNN do klasyfikacji i precyzyjnego umieszczania w ramkach każdego obiektu. Zamienili klasyfikację obrazów w pełne wykrywanie obiektów, lokalizowanie i oznaczanie wielu obiektów jednocześnie.
Jaka jest podstawowa idea CNN opartego na regionie?
R-CNN proponują regiony, które mogą zawierać obiekty, a następnie uruchamiają CNN, aby sklasyfikować każdy region i udoskonalić jego obwiednię.
Dlaczego oryginalny R-CNN (2014) był powolny?
Oryginalna stacja R-CNN niezależnie prowadziła CNN w oparciu o około 2000 propozycji regionów na obraz, co było niezwykle kosztowne pod względem obliczeniowym.
Co wprowadził Faster R-CNN, aby zastąpić wyszukiwanie selektywne?
Szybciej R-CNN wprowadziło wyuczoną Sieć Propozycji Regionów, dzięki czemu generowanie propozycji stało się częścią sieci, którą można przeszkolić, i jest znacznie szybsze.
Co osiąga łączenie RoI?
Łączenie RoI wyodrębnia siatki obiektów o stałym rozmiarze z jednej udostępnionej mapy obiektów na region, unikając ponownego obliczania i przyspieszając wykrywanie.
Jakie dodatkowe możliwości dodaje Mask R-CNN?
Maska R-CNN rozszerza Faster R-CNN, przewidując precyzyjną maskę na poziomie pikseli dla każdego obiektu, umożliwiając segmentację instancji.