Generowanie obrazu autoregresyjnego
Autoregresyjne generowanie obrazów buduje obrazy pojedynczo, przewidując każdy token na podstawie wszystkiego, co zostało wcześniej wygenerowane.
Przegląd
It matters because the same next-token machinery powering language models can produce coherent, controllable images.
Głębokie nurkowanie
Autoregresyjne generowanie obrazu traktuje obraz jako sekwencję i przewiduje go element po elemencie, przy czym każdy nowy element jest warunkowany wszystkimi poprzednimi. Wczesne prace, takie jak PixelRNN i PixelCNN, przewidywały obrazy jeden surowy piksel na raz, skanowanie rząd po rzędzie, co było powolne, ale teoretycznie czyste. Zamiast tego nowoczesne systemy najpierw kompresują obraz w siatkę dyskretnych tokenów za pomocą kodera w stylu VQ-VAE, a następnie Transformer przewiduje te tokeny od lewej do prawej. DALL-E 1 firmy OpenAI i Parti firmy Google postępowały zgodnie z tym przepisem, generując tokeny obrazu uwarunkowane komunikatem tekstowym przed dekodowaniem ich z powrotem do pikseli. Dużą zaletą jest dokładne modelowanie wiarygodności i ujednolicona architektura współdzielona z językiem. Kosztem jest sekwencyjne, powolne pobieranie próbek.
Wgląd techniczny
Model rozkłada łączne prawdopodobieństwo wszystkich żetonów na iloczyn warunków warunkowych: p(x) = iloczyn p(x_i przy danym x_1...x_{i-1}). Transformator z uwagą przyczynową (zamaskowaną) wymusza, aby każda pozycja widziała tylko wcześniejsze żetony. Podczas uczenia przewiduje każdy token równolegle, używając wymuszania przez nauczyciela, ale podczas wnioskowania musi próbkować jeden token na raz, podając każdy z powrotem. Wyuczony słownik odwzorowuje tokeny z powrotem na fragmenty obrazu, które dekoder przetwarza w końcowe piksele.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość generowania obrazu autoregresyjnego
Prędkość jest głównym polem bitwy. Techniki takie jak dekodowanie równoległe i dekodowanie tokenów maskowanych (MaskGIT, Muse) generują wiele tokenów jednocześnie, a dekodowanie spekulatywne zapożyczone z modeli językowych jest dostosowywane do obrazów. Badacze łączą także tokeny tekstowe i graficzne w jednym szkielecie autoregresyjnym, aby jeden model mógł czytać i rysować, jak ma to miejsce w systemach multimodalnych. Oczekuj, że pomysły autoregresyjne i dyfuzyjne będą się nadal mieszać, a modele hybrydowe przechwytują kontrolę tokenów i jakość rozpowszechniania.
Implementacja w świecie rzeczywistym
DALL-E 1 wygenerował obrazy poprzez autoregresyjne przewidywanie siatki odrębnych tokenów obrazów na podstawie podpisu tekstowego.
Parti firmy Google przeskalował autoregresyjny transformator przekształcający tekst na obraz do 20 miliardów parametrów, aby uzyskać szczegółowe i natychmiastowo wierne sceny.
PixelCNN i PixelRNN zademonstrowały generowanie surowego piksela po pikselu i nadal są wykorzystywane jako podstawy nauczania dla modeli opartych na prawdopodobieństwie.
MaskGIT i Muse wykorzystują równoległe dekodowanie tokenów maskowanych, aby przyspieszyć syntezę obrazów opartą na tokenach, zachowując jednocześnie szkolenie w stylu autoregresyjnym.
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Autoregressive Image Generation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Generowanie obrazu AI
Często zadawane pytania
What is Autoregressive Image Generation?
Autoregresyjne generowanie obrazów buduje obrazy pojedynczo, przewidując każdy token na podstawie wszystkiego, co zostało wcześniej wygenerowane. Ma to znaczenie, ponieważ ta sama maszyna, która napędza modele językowe, może tworzyć spójne, kontrolowalne obrazy.
Co oznacza „autoregresywny” w kontekście generowania obrazu?
Modele autoregresyjne rozkładają obraz na czynniki na sekwencję, przewidując każdy token lub piksel na podstawie wszystkich elementów wygenerowanych przed nim.
W jaki sposób nowoczesne autoregresyjne modele obrazu, takie jak DALL-E 1, zazwyczaj reprezentują obraz przed jego przewidzeniem?
Nowoczesne systemy kompresują obraz w postaci dyskretnych tokenów (często za pomocą kodera w stylu VQ-VAE), a następnie przewidują sekwencję tokenów za pomocą transformatora.
Które wczesne modele generowały obrazy po jednym surowym pikselu na raz?
PixelRNN i PixelCNN były pionierami modeli autoregresyjnych, które skanowały i przewidywały obrazy piksel po pikselu.
Jaki mechanizm zapewnia, że Transformator obsługuje tylko wcześniejsze tokeny podczas generowania autoregresyjnego?
Maskowanie przyczynowe blokuje każdą pozycję przed zajmowaniem się przyszłymi tokenami, wymuszając faktoryzację od lewej do prawej.
Jaka jest główna praktyczna wada próbkowania obrazu autoregresyjnego?
Ponieważ każdy token zależy od poprzedniego, wnioskowanie musi być wykonywane żeton po tokenie, co powoduje, że generowanie jest stosunkowo powolne.