Transformatory wizji
Transformatory wizyjne (ViT) wykorzystują architekturę transformatora, która zasila obrazy ChatGPT, traktując obraz jako sekwencję plam, a nie siatkę pikseli.
Przegląd
Udowodnili, że nie potrzebujesz konwolucji, aby osiągnąć nowoczesne rozpoznawanie obrazów.
Głębokie nurkowanie
Przez lata splotowe sieci neuronowe (CNN) zdominowały widzenie komputerowe, skanując małe filtry na obrazie. Artykuł z 2020 r. „An Image Is Worth 16x16 Words” opublikowany przez Google rzucił wyzwanie temu problemowi, pocinając obraz na stałe fragmenty, zwykle o wymiarach 16x16 pikseli, spłaszczając je do wektora i wprowadzając powstałą sekwencję do standardowego transformatora. Każda łatka staje się „znakiem”, podobnie jak słowo w zdaniu. Następnie model wykorzystuje samouważność, dzięki czemu każda łata może bezpośrednio odnosić się do każdej innej łaty, wychwytując w jednym kroku relacje dalekiego zasięgu, których mały filtr splotowy nie jest w stanie zobaczyć. Haczyk: ViT żądni danych, ponieważ brakuje im wbudowanych założeń CNN. Wyszkoleni na ogromnych zbiorach danych, takich jak JFT-300M, dorównali lub pobili najlepsze CNN, zmieniając kształt współczesnych badań nad wizją.
Wgląd techniczny
ViT dzieli obraz na nienakładające się obszary, liniowo rzutuje każdy z nich na osadzenie i dodaje kodowanie pozycyjne, dzięki czemu model wie, gdzie znajduje się każdy fragment oryginalnego obrazu. Dołączony jest specjalny, możliwy do nauczenia „token klasy”; jego ostateczna reprezentacja wpływa na klasyfikację. Nałożone na siebie warstwy samouważności pozwalają każdej łacie ważyć informacje od wszystkich pozostałych, zapewniając globalne pole recepcyjne z warstwy pierwszej. Ponieważ uwaga skaluje się kwadratowo wraz z liczbą plam, obrazy o wysokiej rozdzielczości stają się drogie, dlatego ważny jest rozmiar plamy i efektywne warianty skupienia uwagi.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość transformatorów wizyjnych
Hybrydy transformatorów ViT i CNN zasilają obecnie wiodące systemy wizyjne, a architektura stanowi podstawę modeli multimodalnych, które łączą obrazy z tekstem, takich jak CLIP i nowi asystenci wizyjno-językowi. Można się spodziewać ciągłych prac nad zmniejszeniem kosztów uwagi w przypadku wysokiej rozdzielczości i wideo, a także samonadzorowanego szkolenia wstępnego (takiego jak modelowanie zamaskowanego obrazu), które zmniejsza ogromny apetyt na oznaczone etykietami dane. W miarę zwiększania się mocy obliczeniowej granica między „modelem języka” a „modelem widzenia” stale się zaciera, a transformatory służą jako wspólny szkielet dla wszystkich modalności, a nie jako oddzielne, wyspecjalizowane projekty.
Implementacja w świecie rzeczywistym
Google systemy klasyfikacji obrazów i rankingu wyszukiwania, w których zastosowano szkielety transformatorów po tym, jak ViT okazał się konkurencyjny w stosunku do CNN
CLIP i inne modele obrazu i tekstu, które wykorzystują ViT do kodowania obrazów, dzięki czemu zdjęcia i podpisy można dopasowywać we wspólnej przestrzeni
Badania obrazowania medycznego z wykorzystaniem ViT w celu wykrycia wzorców na całym skanie, a nie tylko na lokalnych teksturach
Stosy percepcji autonomicznej i robotyki, które łączą uwagę w stylu ViT w celu zrozumienia sceny w pełnym polu widzenia
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vision Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Modele CLIP i języka wizyjnego
Często zadawane pytania
Czym są Vision Transformers?
Transformatory wizyjne (ViT) wykorzystują architekturę transformatora, która zasila obrazy ChatGPT, traktując obraz jako sekwencję plam, a nie siatkę pikseli. Udowodnili, że nie potrzeba splotów, aby uzyskać najnowocześniejsze rozpoznawanie obrazu.
W jaki sposób transformator wizyjny początkowo przetwarza obraz wejściowy?
ViT dzieli obraz na stałe obszary (często 16x16 pikseli), osadza każdy fragment jako token i podaje sekwencję do transformatora.
Jaki kluczowy mechanizm pozwala ViT powiązać ze sobą odległe części obrazu?
Samouważność pozwala każdej łacie bezpośrednio analizować informacje z każdej innej łaty, dając globalny widok z pierwszej warstwy.
Dlaczego zwykłe transformatory wizyjne zazwyczaj potrzebują bardzo dużych zbiorów danych szkoleniowych, aby osiągnąć sukces?
W przeciwieństwie do CNN, ViT nie zakładają niezmienności lokalizacji ani translacji, więc muszą uczyć się tych wzorców na podstawie dużych ilości danych.
Jaki jest cel kodowania pozycyjnego w transformatorze wizyjnym?
Samouważność jest niezależna od porządku, więc kodowanie pozycyjne przywraca lokalizację przestrzenną każdej łaty.
Które stwierdzenie najlepiej odzwierciedla wpływ ViT na obraz komputerowy?
ViT wykazało, że czysty transformator, dysponujący wystarczającymi danymi i skalą, może konkurować lub przewyższać najlepsze sieci splotowe.