Równoległe dekodowanie tokenów MaskGIT
MaskGIT generuje obrazy, przewidując wiele tokenów na raz i wypełniając najpierw te najbardziej pewne, zastępując powolne generowanie od lewej do prawej kilkoma szybkimi równoległymi krokami.
Głębokie nurkowanie
MaskGIT (Masked Generative Image Transformer) z Google w 2022 r. ponownie zastanawia się nad sposobem dekodowania modeli obrazów opartych na tokenach. Wcześniejsze transformatory, takie jak VQGAN, generowały tokeny autoregresywnie, pojedynczo w kolejności rastrowej, co jest powolne i nienaturalne w przypadku obrazów 2D. Zamiast tego MaskGIT ćwiczy z zamaskowanym celem modelowania, takim jak BERT: losowe podzbiory tokenów obrazów są ukryte, a model uczy się przewidywać je wszystkie jednocześnie, wykorzystując uwagę dwukierunkową. W czasie generowania zaczyna się od w pełni zamaskowanej siatki i dekoduje w ustalonej liczbie iteracji (często od 8 do 12). Na każdym kroku przewiduje każdy zamaskowany token, zachowuje przewidywania o najwyższej pewności i ponownie maskuje resztę na następną rundę. Daje to obrazy wysokiej jakości w mniej więcej o rząd wielkości mniejszej liczbie kroków niż dekodowanie autoregresyjne.
Wgląd techniczny
Kluczowym elementem jest harmonogram maskowania oparty na zaufaniu. Harmonogram cosinusów decyduje, ile tokenów ujawnić w każdej iteracji, zaczynając powoli i przyspieszając. Ponieważ uwaga jest dwukierunkowa, każdy token widzi cały częściowy obraz, więc wykonanie najbardziej pewnych przewidywań w pierwszej kolejności pozwala na uzależnienie późniejszych kroków od solidnego kontekstu, podobnie jak rozwiązywanie łatwych części łamigłówki przed niejednoznacznymi.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość równoległego dekodowania tokenów MaskGIT
Równoległe, iteracyjne dekodowanie w MaskGIT zainspirowało falę generatorów nieautoregresyjnych, w tym MUSE do przetwarzania tekstu na obraz i podejścia maskowane do wideo. Wzorzec, przewidujący tokeny równolegle i udoskonalający w kilku krokach, mieści się pomiędzy jednoetapowymi sieciami GAN a wieloetapową dyfuzją, oferując regulowany kompromis w zakresie jakości i szybkości. Spodziewaj się, że dekodowanie tokenów maskowanych będzie nadal pojawiać się w szybkich generatorach multimodalnych i systemach edycyjnych, w których naturalne dopasowanie polega na malowaniu i wypełnieniach warunkowych.
Implementacja w świecie rzeczywistym
Generowanie pełnego obrazu w około 8 do 12 równoległych krokach zamiast setek przewidywań tokenów autoregresyjnych
Malowanie zamaskowanego obszaru zdjęcia poprzez ponowne przewidywanie tylko ukrytych tokenów z otaczającym kontekstem
Synteza obrazu warunkowego klasowo w ImageNet z jakością konkurencyjną w stosunku do znacznie wolniejszych modeli
Służy jako szkielet dekodujący dla systemów przetwarzania tekstu na obraz, takich jak MUSE Google, które wymagają szybkiego generowania
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the MaskGIT Parallel Token Decoding quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Równoległe dekodowanie szkieletu myśli
Często zadawane pytania
What is MaskGIT Parallel Token Decoding?
MaskGIT generuje obrazy, przewidując wiele tokenów na raz i wypełniając najpierw te najbardziej pewne, zastępując powolne generowanie od lewej do prawej kilkoma szybkimi równoległymi krokami.
W jaki sposób MaskGIT dekoduje tokeny obrazu inaczej niż transformator VQGAN?
MaskGIT przewiduje wszystkie zamaskowane tokeny jednocześnie z dwukierunkową uwagą, w przeciwieństwie do powolnego dekodowania autoregresyjnego od lewej do prawej VQGAN.
Jaki cel szkoleniowy MaskGIT zapożycza z modeli językowych?
MaskGIT ukrywa losowe podzbiory tokenów i uczy się je przewidywać, co jest zamaskowanym celem modelowania podobnym do BERT.
Które tokeny MaskGIT zatwierdza podczas generowania w każdej iteracji?
Każdy krok zachowuje najbardziej pewne przewidywania i ponownie maskuje resztę, więc późniejsze kroki zależą od wiarygodnego kontekstu.
Mniej więcej, ile iteracji zwykle potrzebuje MaskGIT, aby wygenerować obraz?
MaskGIT dekoduje w małej, ustalonej liczbie kroków, często od 8 do 12, czyli znacznie mniej niż podejścia autoregresyjne lub dyfuzyjne.
Jaki harmonogram kontroluje liczbę tokenów MaskGIT ujawnianych w każdym kroku?
Harmonogram cosinus ujawnia kilka tokenów wcześniej i więcej później, równoważąc jakość i szybkość w iteracjach.