Przestrzenne sieci transformatorowe
Przestrzenne sieci transformatorowe (STN) to moduły, których można się nauczyć, które pozwalają sieci neuronowej aktywnie wypaczać, obracać, przycinać lub zmieniać skalowanie danych wejściowych, aby skupić się na tym, co ważne.
Przegląd
They give CNNs a built-in sense of spatial attention and invariance.
Głębokie nurkowanie
Standardowe sieci splotowe są jedynie słabo niezmienne w przypadku zmian położenia, skali i rotacji, opierając się na łączeniu w celu uzyskania niewielkiej tolerancji. Przestrzenne sieci transformatorowe, wprowadzone przez Jaderberga i in. w 2015 r. napraw ten problem, wstawiając różniczkowalny moduł, który wykonuje jawną transformację geometryczną na mapach obiektów. Moduł składa się z trzech części: sieci lokalizacyjnej, która przewiduje parametry transformacji, generatora siatki, który buduje siatkę próbkowania na podstawie tych parametrów, oraz próbnika, który interpoluje dane wejściowe w punktach siatki. Ponieważ każdy krok jest różniczkowy, cały transformator jest szkolony od początku do końca poprzez propagację wsteczną, bez dodatkowego nadzoru. Sieć uczy się na przykład prostowania przechylonych cyfr lub powiększania odpowiedniego regionu, zwiększając dokładność i niezawodność.
Wgląd techniczny
Sieć lokalizacyjna wyprowadza parametry (często macierz afiniczną 2x3) dla translacji, skali, rotacji i ścinania. Generator siatki odwzorowuje każdy piksel wyjściowy z powrotem na współrzędną źródłową za pośrednictwem tej matrycy. Próbnik następnie odczytuje dane wejściowe za pomocą interpolacji dwuliniowej, która jest różniczkowalna, dzięki czemu gradienty przepływają do sieci lokalizacyjnej. Dzięki temu moduł uczy się transformacji wyłącznie na podstawie utraty zadania, obsługi i kanonizacji odpowiednich regionów.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość przestrzennych sieci transformatorowych
STN wpłynęły na sposób, w jaki sieci radzą sobie z geometrią i uwagą, tworząc odkształcalne sploty i moduły wyuczonego wypaczania. Chociaż obecnie dominują transformatory samouważności, różniczkowe próbkowanie w stylu STN jest nadal stosowane w zadaniach wymagających wyraźnego wyrównania geometrycznego: rozpoznawanie tekstu, drobnoziarnista klasyfikacja i normalizacja pozycji. Można się spodziewać, że zróżnicowane zniekształcenia będą nadal pojawiać się w obrazie 3D, renderowaniu neuronowym i rejestracji obrazów medycznych, często w połączeniu z uwagą, a nie przez nią zastępowaną.
Implementacja w świecie rzeczywistym
Prostowanie i wyrównywanie zakrzywionego lub obróconego tekstu przed rozpoznaniem w systemach OCR z tekstem sceny
Powiększanie obszarów wyróżniających się (takich jak dziób lub skrzydła ptaka) w celu drobnoziarnistej klasyfikacji obrazu
Normalizowanie ułożenia i wyrównania twarzy jako etap przetwarzania wstępnego w potokach rozpoznawania twarzy
Korygowanie zniekształceń i wyrównywanie skanów w rejestracji obrazu medycznego
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Spatial Transformer Networks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
DETR Wykrywanie transformatora
Często zadawane pytania
What is Spatial Transformer Networks?
Przestrzenne sieci transformatorowe (STN) to moduły, których można się nauczyć, które pozwalają sieci neuronowej aktywnie wypaczać, obracać, przycinać lub zmieniać skalowanie danych wejściowych, aby skupić się na tym, co ważne. Dają CNN wbudowane poczucie uwagi przestrzennej i niezmienności.
Jakie możliwości dodaje przestrzenna sieć transformatorowa do sieci neuronowej?
STN wstawiają moduł, którego można się nauczyć, który może tłumaczyć, obracać, skalować lub wypaczać mapy obiektów, aby skupić się na odpowiedniej treści.
Jakie trzy elementy składają się na przestrzenny moduł transformatora?
STN składa się z sieci lokalizacyjnej (przewiduje parametry), generatora siatki (buduje współrzędne próbkowania) i próbnika (interpoluje dane wejściowe).
Dlaczego sieć transformatorów przestrzennych można trenować za pomocą zwykłej propagacji wstecznej?
Interpolacja dwuliniowa w próbniku jest różniczkowalna, więc gradienty przepływają z powrotem przez generator siatki do sieci lokalizacyjnej, umożliwiając kompleksowe szkolenie.
Co zazwyczaj generuje sieć lokalizacyjna w przypadku transformacji afinicznej?
W przypadku transformacji afinicznych sieć lokalizacji przewiduje sześć wartości ułożonych w macierz 2x3 kodującą translację, skalę, obrót i ścinanie.
Dlaczego standardowe CNN są tylko słabo niezmienne w stosunku do zmian przestrzennych, co motywuje STN?
CNN osiągają jedynie niewielką niezmienność przestrzenną poprzez łączenie; STN dodają wyraźny, możliwy do nauczenia sposób obsługi pozycji, skali i obrotu.