PRZEWODNIK Wizualnej AI

Transformator świń

Swin Transformer to transformator wizyjny, który przetwarza obrazy w przesuniętych, hierarchicznych oknach, dzięki czemu uwaga jest wystarczająco wydajna, aby można ją było skalować na obrazach o wysokiej rozdzielczości.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It works as a general-purpose backbone for classification, detection, and segmentation.

Głębokie nurkowanie

Standardowe transformatory wizyjne obliczają uwagę we wszystkich obszarach obrazu, a koszty rosną kwadratowo wraz z rozmiarem obrazu, co stanowi przeszkodę w przypadku gęstych zadań, takich jak wykrywanie. Wprowadzony przez Microsoft Research w 2021 r., Swin (Shifted WINdows) zamiast tego dzieli obraz na małe, nienakładające się okna i oblicza samouważność tylko w każdym oknie, dzięki czemu koszt rośnie liniowo wraz z rozmiarem obrazu. Aby informacje mogły przekraczać granice okien, naprzemienne warstwy przesuwają siatkę okna, tak że oddzielone fragmenty dzielą teraz okno. Swin buduje także hierarchię: zaczyna od małych poprawek i stopniowo je łączy, tworząc wieloskalowe mapy obiektów, podobne do CNN, które doskonale wpasowują się w istniejące ramy wykrywania i segmentacji.

Wgląd techniczny

Wydajność Swina wynika z wielogłowicowej samouważności opartej na oknach (W-MSA): uwaga jest ograniczona do stałych okien (na przykład pól 7x7), więc złożoność skaluje się liniowo, a nie kwadratowo wraz z liczbą poprawek. Następny blok wykorzystuje uwagę przesuniętego okna (SW-MSA), przesuwając przegrodę okienną o połowę okna, tak aby utworzyły się połączenia między oknami. Warstwy łączące poprawki łączą sąsiednie obszary pomiędzy etapami, zmniejszając o połowę rozdzielczość przestrzenną i podwajając kanały, tworząc piramidę funkcji.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość transformatora Swin

Swin pokazał, że hierarchiczne, świadome lokalizacji transformatory mogą konkurować z CNN lub je pokonać w roli uniwersalnych szkieletów wizyjnych, a Swin V2 przesunął to na modele miliardowe parametry i bardzo wysokie rozdzielczości. Spodziewaj się ciągłego łączenia splotowo-indukcyjnego odchylenia z uwagą, bardziej wydajnymi wariantami uwagi i szkieletami w stylu Swina zasilającymi modele multimodalne i wideo. W miarę dojrzewania modeli podstawowych wizji, projekty hierarchiczne, które tworzą cechy wieloskalowe, pozostają szczególnie cenne w przypadku gęstych zadań predykcyjnych.

Implementacja w świecie rzeczywistym

Klasyfikacja ImageNet o wysokiej dokładności jako wstępnie wytrenowany szkielet

Szkielety wykrywania obiektów i segmentacji instancji w ramach takich jak Mask R-CNN i Cascade R-CNN

Semantyczna segmentacja scen ulicznych i zdjęć satelitarnych

Analiza obrazu medycznego, gdzie liczy się wysoka rozdzielczość i wieloskalowość szczegółów

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Swin Transformer quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Transformatory dyfuzyjne

Często zadawane pytania

What is Swin Transformer?

Swin Transformer to transformator wizyjny, który przetwarza obrazy w przesuniętych, hierarchicznych oknach, dzięki czemu uwaga jest wystarczająco wydajna, aby można ją było skalować na obrazach o wysokiej rozdzielczości. Działa jako szkielet ogólnego przeznaczenia do klasyfikacji, wykrywania i segmentacji.

Co oznacza „Swin” w Swin Transformer?

Swin oznacza Shifted Windows, mechanizm umożliwiający lokalnym oknom uwagi wymianę informacji między warstwami.

Dlaczego korzystanie z samouważności w lokalnych oknach jest korzystne?

Ograniczenie uwagi do okien o stałym rozmiarze powoduje, że koszty obliczeń rosną liniowo wraz z rozmiarem obrazu, w przeciwieństwie do kwadratowego wzrostu globalnej uwagi.

W jaki sposób Swin umożliwia przepływ informacji między oddzielnymi oknami?

Naprzemienne warstwy przesuwają siatkę okna o połowę okna, dzięki czemu poprawki znajdujące się wcześniej w różnych oknach mogą się wzajemnie uzupełniać.

Co robią warstwy łączące łaty pomiędzy etapami Swin?

Łączenie łatek łączy sąsiednie łaty, aby zmniejszyć o połowę rozdzielczość przestrzenną i podwójną głębokość kanału, tworząc wieloskalową hierarchię.

Dlaczego hierarchiczne, wieloskalowe wyniki Swina są szczególnie przydatne?

Wieloskalowe mapy obiektów naśladują szkielet CNN, dzięki czemu Swin łatwo integruje się z platformami o gęstej predykcji, takimi jak Mask R-CNN.