PRZEWODNIK Wizualnej AI

Funkcja Sieci piramid

Sieci piramid obiektowych (FPN) umożliwiają detektorom wykrywanie obiektów o bardzo różnych rozmiarach poprzez tanie budowanie wieloskalowej „piramidy” cech.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

They are the reason modern detectors find both a tiny faraway pedestrian and a huge nearby truck in the same image.

Głębokie nurkowanie

Obiekty na obrazach pojawiają się w wielu skalach, a pojedyncza mapa obiektów nie jest w stanie obsłużyć ich wszystkich. Starsze podejścia budowały piramidy obrazów poprzez wielokrotną zmianę rozmiaru zdjęcia i uruchamianie sieci na każdej kopii, co było powolne. FPN, wprowadzone przez Lin i in. w 2017 r. zamiast tego ponownie wykorzystuje naturalną piramidę znajdującą się już w sieci splotowej. Szkielet taki jak ResNet tworzy mapy obiektów, które stają się mniejsze i bardziej semantyczne głębiej w sieci. FPN dodaje ścieżkę odgórną: próbkuje głębokie, bogate semantycznie funkcje i łączy je za pomocą połączeń bocznych z płytkimi funkcjami o wysokiej rozdzielczości. Rezultatem jest zestaw map obiektów, które są semantycznie mocne, a jednocześnie zachowują drobne szczegóły przestrzenne, co radykalnie poprawia wykrywanie małych obiektów niemal bez dodatkowych kosztów.

Wgląd techniczny

FPN ma ścieżkę oddolną (szkielet) i ścieżkę odgórną. Każdy poziom z góry na dół jest próbkowany 2x (najbliższy sąsiad) i dodawany elementowo do mapy cech poprzecznych o splątaniu 1x1 o odpowiedniej rozdzielczości. Następnie splot 3x3 wygładza każdą połączoną mapę, aby zmniejszyć aliasing. Daje to poziomy P2-P5 ze stałą liczbą kanałów (często 256), z których każdy ma za zadanie wykrywanie obiektów o określonym zakresie skali.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość sieci piramid obiektowych

Projekt FPN typu top-down dał początek wielu następcom: PANet dodaje ścieżkę od dołu do góry, BiFPN (używany w EfficientDet) umożliwia naukę fuzji i jest dwukierunkowy z połączeniami ważonymi, a NAS-FPN automatycznie wyszukuje topologię fuzji. Detektory transformatorowe, takie jak DETR, omijają wyraźne piramidy, ale centralna pozostaje fuzja wieloskalowa. Można się spodziewać, że pomysły w stylu FPN utrwalą się w transformatorach wizyjnych i wydajnych detektorach na urządzeniach, w coraz większym stopniu dzięki wyuczonemu, adaptacyjnemu ważeniu skali, a nie stałym połączeniom.

Implementacja w świecie rzeczywistym

Jednoczesne wykrywanie małych, odległych pieszych i dużych pojazdów w pobliżu w stosach percepcji samochodów autonomicznych

Wspieranie segmentacji instancji w Mask R-CNN, gdzie FPN dostarcza funkcje wieloskalowe do propozycji regionu i głów masek

Wykrywanie drobnych guzów obok dużych narządów w rurociągach do wykrywania obrazowania medycznego

Znajdowanie obiektów o różnej wielkości na zdjęciach satelitarnych i lotniczych, od małych łodzi po duże budynki

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Feature Pyramid Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Przestrzenne sieci transformatorowe

Często zadawane pytania

What is Feature Pyramid Networks?

Sieci piramid obiektowych (FPN) umożliwiają detektorom wykrywanie obiektów o bardzo różnych rozmiarach poprzez tanie budowanie wieloskalowej „piramidy” cech. To dzięki nim nowoczesne detektory znajdują na tym samym obrazie zarówno małego, odległego pieszego, jak i ogromną ciężarówkę znajdującą się w pobliżu.

Jaki podstawowy problem rozwiązuje przede wszystkim sieć piramid funkcjonalnych?

FPN tworzy wieloskalową reprezentację cech, dzięki czemu detektor może w jednym przejściu obsłużyć obiekty od małych do bardzo dużych.

Jaka jest rola ścieżki odgórnej w FPN?

Ścieżka odgórna próbkuje głębokie, semantyczne funkcje i łączy je z płytszymi mapami o wysokiej rozdzielczości, dzięki czemu każdy poziom jest zarówno szczegółowy, jak i silny semantycznie.

W jaki sposób połączenia boczne są zwykle łączone z funkcjami próbkowania z góry na dół?

Splot 1x1 dostosowuje liczbę kanałów mapy cech poprzecznych, która jest następnie dodawana elementarnie do funkcji od góry do dołu 2x powiększonej.

Dlaczego do każdej połączonej mapy obiektów w FPN stosuje się splot 3x3?

Po dodaniu elementów splot 3x3 redukuje artefakty aliasingu wprowadzone przez upsampling, tworząc czystsze poziomy piramidy.

Która późniejsza architektura rozszerzyła FPN o możliwą do nauczenia się, ważoną dwukierunkową fuzję?

BiFPN, wprowadzony wraz z EfficientDet, sprawia, że ​​fuzja funkcji jest dwukierunkowa i uczy się wag określających wpływ poszczególnych danych wejściowych.