PRZEWODNIK Wizualnej AI

Równoległe dekodowanie tokenów MaskGIT

MaskGIT generuje obrazy, przewidując wiele tokenów na raz i wypełniając najpierw te najbardziej pewne, zastępując powolne generowanie od lewej do prawej kilkoma szybkimi równoległymi krokami.

2 minuty czytaniaOstatnia aktualizacja

Głębokie nurkowanie

MaskGIT (Masked Generative Image Transformer) z Google w 2022 r. ponownie zastanawia się nad sposobem dekodowania modeli obrazów opartych na tokenach. Wcześniejsze transformatory, takie jak VQGAN, generowały tokeny autoregresywnie, pojedynczo w kolejności rastrowej, co jest powolne i nienaturalne w przypadku obrazów 2D. Zamiast tego MaskGIT ćwiczy z zamaskowanym celem modelowania, takim jak BERT: losowe podzbiory tokenów obrazów są ukryte, a model uczy się przewidywać je wszystkie jednocześnie, wykorzystując uwagę dwukierunkową. W czasie generowania zaczyna się od w pełni zamaskowanej siatki i dekoduje w ustalonej liczbie iteracji (często od 8 do 12). Na każdym kroku przewiduje każdy zamaskowany token, zachowuje przewidywania o najwyższej pewności i ponownie maskuje resztę na następną rundę. Daje to obrazy wysokiej jakości w mniej więcej o rząd wielkości mniejszej liczbie kroków niż dekodowanie autoregresyjne.

Wgląd techniczny

Kluczowym elementem jest harmonogram maskowania oparty na zaufaniu. Harmonogram cosinusów decyduje, ile tokenów ujawnić w każdej iteracji, zaczynając powoli i przyspieszając. Ponieważ uwaga jest dwukierunkowa, każdy token widzi cały częściowy obraz, więc wykonanie najbardziej pewnych przewidywań w pierwszej kolejności pozwala na uzależnienie późniejszych kroków od solidnego kontekstu, podobnie jak rozwiązywanie łatwych części łamigłówki przed niejednoznacznymi.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość równoległego dekodowania tokenów MaskGIT

Równoległe, iteracyjne dekodowanie w MaskGIT zainspirowało falę generatorów nieautoregresyjnych, w tym MUSE do przetwarzania tekstu na obraz i podejścia maskowane do wideo. Wzorzec, przewidujący tokeny równolegle i udoskonalający w kilku krokach, mieści się pomiędzy jednoetapowymi sieciami GAN a wieloetapową dyfuzją, oferując regulowany kompromis w zakresie jakości i szybkości. Spodziewaj się, że dekodowanie tokenów maskowanych będzie nadal pojawiać się w szybkich generatorach multimodalnych i systemach edycyjnych, w których naturalne dopasowanie polega na malowaniu i wypełnieniach warunkowych.

Implementacja w świecie rzeczywistym

Generowanie pełnego obrazu w około 8 do 12 równoległych krokach zamiast setek przewidywań tokenów autoregresyjnych

Malowanie zamaskowanego obszaru zdjęcia poprzez ponowne przewidywanie tylko ukrytych tokenów z otaczającym kontekstem

Synteza obrazu warunkowego klasowo w ImageNet z jakością konkurencyjną w stosunku do znacznie wolniejszych modeli

Służy jako szkielet dekodujący dla systemów przetwarzania tekstu na obraz, takich jak MUSE Google, które wymagają szybkiego generowania

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MaskGIT Parallel Token Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Równoległe dekodowanie szkieletu myśli

Często zadawane pytania

What is MaskGIT Parallel Token Decoding?

MaskGIT generuje obrazy, przewidując wiele tokenów na raz i wypełniając najpierw te najbardziej pewne, zastępując powolne generowanie od lewej do prawej kilkoma szybkimi równoległymi krokami.

W jaki sposób MaskGIT dekoduje tokeny obrazu inaczej niż transformator VQGAN?

MaskGIT przewiduje wszystkie zamaskowane tokeny jednocześnie z dwukierunkową uwagą, w przeciwieństwie do powolnego dekodowania autoregresyjnego od lewej do prawej VQGAN.

Jaki cel szkoleniowy MaskGIT zapożycza z modeli językowych?

MaskGIT ukrywa losowe podzbiory tokenów i uczy się je przewidywać, co jest zamaskowanym celem modelowania podobnym do BERT.

Które tokeny MaskGIT zatwierdza podczas generowania w każdej iteracji?

Każdy krok zachowuje najbardziej pewne przewidywania i ponownie maskuje resztę, więc późniejsze kroki zależą od wiarygodnego kontekstu.

Mniej więcej, ile iteracji zwykle potrzebuje MaskGIT, aby wygenerować obraz?

MaskGIT dekoduje w małej, ustalonej liczbie kroków, często od 8 do 12, czyli znacznie mniej niż podejścia autoregresyjne lub dyfuzyjne.

Jaki harmonogram kontroluje liczbę tokenów MaskGIT ujawnianych w każdym kroku?

Harmonogram cosinus ujawnia kilka tokenów wcześniej i więcej później, równoważąc jakość i szybkość w iteracjach.