PRZEWODNIK Wizualnej AI

Przestrzenne sieci transformatorowe

Przestrzenne sieci transformatorowe (STN) to moduły, których można się nauczyć, które pozwalają sieci neuronowej aktywnie wypaczać, obracać, przycinać lub zmieniać skalowanie danych wejściowych, aby skupić się na tym, co ważne.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

They give CNNs a built-in sense of spatial attention and invariance.

Głębokie nurkowanie

Standardowe sieci splotowe są jedynie słabo niezmienne w przypadku zmian położenia, skali i rotacji, opierając się na łączeniu w celu uzyskania niewielkiej tolerancji. Przestrzenne sieci transformatorowe, wprowadzone przez Jaderberga i in. w 2015 r. napraw ten problem, wstawiając różniczkowalny moduł, który wykonuje jawną transformację geometryczną na mapach obiektów. Moduł składa się z trzech części: sieci lokalizacyjnej, która przewiduje parametry transformacji, generatora siatki, który buduje siatkę próbkowania na podstawie tych parametrów, oraz próbnika, który interpoluje dane wejściowe w punktach siatki. Ponieważ każdy krok jest różniczkowy, cały transformator jest szkolony od początku do końca poprzez propagację wsteczną, bez dodatkowego nadzoru. Sieć uczy się na przykład prostowania przechylonych cyfr lub powiększania odpowiedniego regionu, zwiększając dokładność i niezawodność.

Wgląd techniczny

Sieć lokalizacyjna wyprowadza parametry (często macierz afiniczną 2x3) dla translacji, skali, rotacji i ścinania. Generator siatki odwzorowuje każdy piksel wyjściowy z powrotem na współrzędną źródłową za pośrednictwem tej matrycy. Próbnik następnie odczytuje dane wejściowe za pomocą interpolacji dwuliniowej, która jest różniczkowalna, dzięki czemu gradienty przepływają do sieci lokalizacyjnej. Dzięki temu moduł uczy się transformacji wyłącznie na podstawie utraty zadania, obsługi i kanonizacji odpowiednich regionów.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość przestrzennych sieci transformatorowych

STN wpłynęły na sposób, w jaki sieci radzą sobie z geometrią i uwagą, tworząc odkształcalne sploty i moduły wyuczonego wypaczania. Chociaż obecnie dominują transformatory samouważności, różniczkowe próbkowanie w stylu STN jest nadal stosowane w zadaniach wymagających wyraźnego wyrównania geometrycznego: rozpoznawanie tekstu, drobnoziarnista klasyfikacja i normalizacja pozycji. Można się spodziewać, że zróżnicowane zniekształcenia będą nadal pojawiać się w obrazie 3D, renderowaniu neuronowym i rejestracji obrazów medycznych, często w połączeniu z uwagą, a nie przez nią zastępowaną.

Implementacja w świecie rzeczywistym

Prostowanie i wyrównywanie zakrzywionego lub obróconego tekstu przed rozpoznaniem w systemach OCR z tekstem sceny

Powiększanie obszarów wyróżniających się (takich jak dziób lub skrzydła ptaka) w celu drobnoziarnistej klasyfikacji obrazu

Normalizowanie ułożenia i wyrównania twarzy jako etap przetwarzania wstępnego w potokach rozpoznawania twarzy

Korygowanie zniekształceń i wyrównywanie skanów w rejestracji obrazu medycznego

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Spatial Transformer Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

DETR Wykrywanie transformatora

Często zadawane pytania

What is Spatial Transformer Networks?

Przestrzenne sieci transformatorowe (STN) to moduły, których można się nauczyć, które pozwalają sieci neuronowej aktywnie wypaczać, obracać, przycinać lub zmieniać skalowanie danych wejściowych, aby skupić się na tym, co ważne. Dają CNN wbudowane poczucie uwagi przestrzennej i niezmienności.

Jakie możliwości dodaje przestrzenna sieć transformatorowa do sieci neuronowej?

STN wstawiają moduł, którego można się nauczyć, który może tłumaczyć, obracać, skalować lub wypaczać mapy obiektów, aby skupić się na odpowiedniej treści.

Jakie trzy elementy składają się na przestrzenny moduł transformatora?

STN składa się z sieci lokalizacyjnej (przewiduje parametry), generatora siatki (buduje współrzędne próbkowania) i próbnika (interpoluje dane wejściowe).

Dlaczego sieć transformatorów przestrzennych można trenować za pomocą zwykłej propagacji wstecznej?

Interpolacja dwuliniowa w próbniku jest różniczkowalna, więc gradienty przepływają z powrotem przez generator siatki do sieci lokalizacyjnej, umożliwiając kompleksowe szkolenie.

Co zazwyczaj generuje sieć lokalizacyjna w przypadku transformacji afinicznej?

W przypadku transformacji afinicznych sieć lokalizacji przewiduje sześć wartości ułożonych w macierz 2x3 kodującą translację, skalę, obrót i ścinanie.

Dlaczego standardowe CNN są tylko słabo niezmienne w stosunku do zmian przestrzennych, co motywuje STN?

CNN osiągają jedynie niewielką niezmienność przestrzenną poprzez łączenie; STN dodają wyraźny, możliwy do nauczenia sposób obsługi pozycji, skali i obrotu.