Transformator świń
Swin Transformer to transformator wizyjny, który przetwarza obrazy w przesuniętych, hierarchicznych oknach, dzięki czemu uwaga jest wystarczająco wydajna, aby można ją było skalować na obrazach o wysokiej rozdzielczości.
Przegląd
It works as a general-purpose backbone for classification, detection, and segmentation.
Głębokie nurkowanie
Standardowe transformatory wizyjne obliczają uwagę we wszystkich obszarach obrazu, a koszty rosną kwadratowo wraz z rozmiarem obrazu, co stanowi przeszkodę w przypadku gęstych zadań, takich jak wykrywanie. Wprowadzony przez Microsoft Research w 2021 r., Swin (Shifted WINdows) zamiast tego dzieli obraz na małe, nienakładające się okna i oblicza samouważność tylko w każdym oknie, dzięki czemu koszt rośnie liniowo wraz z rozmiarem obrazu. Aby informacje mogły przekraczać granice okien, naprzemienne warstwy przesuwają siatkę okna, tak że oddzielone fragmenty dzielą teraz okno. Swin buduje także hierarchię: zaczyna od małych poprawek i stopniowo je łączy, tworząc wieloskalowe mapy obiektów, podobne do CNN, które doskonale wpasowują się w istniejące ramy wykrywania i segmentacji.
Wgląd techniczny
Wydajność Swina wynika z wielogłowicowej samouważności opartej na oknach (W-MSA): uwaga jest ograniczona do stałych okien (na przykład pól 7x7), więc złożoność skaluje się liniowo, a nie kwadratowo wraz z liczbą poprawek. Następny blok wykorzystuje uwagę przesuniętego okna (SW-MSA), przesuwając przegrodę okienną o połowę okna, tak aby utworzyły się połączenia między oknami. Warstwy łączące poprawki łączą sąsiednie obszary pomiędzy etapami, zmniejszając o połowę rozdzielczość przestrzenną i podwajając kanały, tworząc piramidę funkcji.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość transformatora Swin
Swin pokazał, że hierarchiczne, świadome lokalizacji transformatory mogą konkurować z CNN lub je pokonać w roli uniwersalnych szkieletów wizyjnych, a Swin V2 przesunął to na modele miliardowe parametry i bardzo wysokie rozdzielczości. Spodziewaj się ciągłego łączenia splotowo-indukcyjnego odchylenia z uwagą, bardziej wydajnymi wariantami uwagi i szkieletami w stylu Swina zasilającymi modele multimodalne i wideo. W miarę dojrzewania modeli podstawowych wizji, projekty hierarchiczne, które tworzą cechy wieloskalowe, pozostają szczególnie cenne w przypadku gęstych zadań predykcyjnych.
Implementacja w świecie rzeczywistym
Klasyfikacja ImageNet o wysokiej dokładności jako wstępnie wytrenowany szkielet
Szkielety wykrywania obiektów i segmentacji instancji w ramach takich jak Mask R-CNN i Cascade R-CNN
Semantyczna segmentacja scen ulicznych i zdjęć satelitarnych
Analiza obrazu medycznego, gdzie liczy się wysoka rozdzielczość i wieloskalowość szczegółów
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Swin Transformer quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Transformatory dyfuzyjne
Często zadawane pytania
What is Swin Transformer?
Swin Transformer to transformator wizyjny, który przetwarza obrazy w przesuniętych, hierarchicznych oknach, dzięki czemu uwaga jest wystarczająco wydajna, aby można ją było skalować na obrazach o wysokiej rozdzielczości. Działa jako szkielet ogólnego przeznaczenia do klasyfikacji, wykrywania i segmentacji.
Co oznacza „Swin” w Swin Transformer?
Swin oznacza Shifted Windows, mechanizm umożliwiający lokalnym oknom uwagi wymianę informacji między warstwami.
Dlaczego korzystanie z samouważności w lokalnych oknach jest korzystne?
Ograniczenie uwagi do okien o stałym rozmiarze powoduje, że koszty obliczeń rosną liniowo wraz z rozmiarem obrazu, w przeciwieństwie do kwadratowego wzrostu globalnej uwagi.
W jaki sposób Swin umożliwia przepływ informacji między oddzielnymi oknami?
Naprzemienne warstwy przesuwają siatkę okna o połowę okna, dzięki czemu poprawki znajdujące się wcześniej w różnych oknach mogą się wzajemnie uzupełniać.
Co robią warstwy łączące łaty pomiędzy etapami Swin?
Łączenie łatek łączy sąsiednie łaty, aby zmniejszyć o połowę rozdzielczość przestrzenną i podwójną głębokość kanału, tworząc wieloskalową hierarchię.
Dlaczego hierarchiczne, wieloskalowe wyniki Swina są szczególnie przydatne?
Wieloskalowe mapy obiektów naśladują szkielet CNN, dzięki czemu Swin łatwo integruje się z platformami o gęstej predykcji, takimi jak Mask R-CNN.