PRZEWODNIK Wizualnej AI

Generowanie obrazu autoregresyjnego

Autoregresyjne generowanie obrazów buduje obrazy pojedynczo, przewidując każdy token na podstawie wszystkiego, co zostało wcześniej wygenerowane.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because the same next-token machinery powering language models can produce coherent, controllable images.

Głębokie nurkowanie

Autoregresyjne generowanie obrazu traktuje obraz jako sekwencję i przewiduje go element po elemencie, przy czym każdy nowy element jest warunkowany wszystkimi poprzednimi. Wczesne prace, takie jak PixelRNN i PixelCNN, przewidywały obrazy jeden surowy piksel na raz, skanowanie rząd po rzędzie, co było powolne, ale teoretycznie czyste. Zamiast tego nowoczesne systemy najpierw kompresują obraz w siatkę dyskretnych tokenów za pomocą kodera w stylu VQ-VAE, a następnie Transformer przewiduje te tokeny od lewej do prawej. DALL-E 1 firmy OpenAI i Parti firmy Google postępowały zgodnie z tym przepisem, generując tokeny obrazu uwarunkowane komunikatem tekstowym przed dekodowaniem ich z powrotem do pikseli. Dużą zaletą jest dokładne modelowanie wiarygodności i ujednolicona architektura współdzielona z językiem. Kosztem jest sekwencyjne, powolne pobieranie próbek.

Wgląd techniczny

Model rozkłada łączne prawdopodobieństwo wszystkich żetonów na iloczyn warunków warunkowych: p(x) = iloczyn p(x_i przy danym x_1...x_{i-1}). Transformator z uwagą przyczynową (zamaskowaną) wymusza, aby każda pozycja widziała tylko wcześniejsze żetony. Podczas uczenia przewiduje każdy token równolegle, używając wymuszania przez nauczyciela, ale podczas wnioskowania musi próbkować jeden token na raz, podając każdy z powrotem. Wyuczony słownik odwzorowuje tokeny z powrotem na fragmenty obrazu, które dekoder przetwarza w końcowe piksele.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość generowania obrazu autoregresyjnego

Prędkość jest głównym polem bitwy. Techniki takie jak dekodowanie równoległe i dekodowanie tokenów maskowanych (MaskGIT, Muse) generują wiele tokenów jednocześnie, a dekodowanie spekulatywne zapożyczone z modeli językowych jest dostosowywane do obrazów. Badacze łączą także tokeny tekstowe i graficzne w jednym szkielecie autoregresyjnym, aby jeden model mógł czytać i rysować, jak ma to miejsce w systemach multimodalnych. Oczekuj, że pomysły autoregresyjne i dyfuzyjne będą się nadal mieszać, a modele hybrydowe przechwytują kontrolę tokenów i jakość rozpowszechniania.

Implementacja w świecie rzeczywistym

DALL-E 1 wygenerował obrazy poprzez autoregresyjne przewidywanie siatki odrębnych tokenów obrazów na podstawie podpisu tekstowego.

Parti firmy Google przeskalował autoregresyjny transformator przekształcający tekst na obraz do 20 miliardów parametrów, aby uzyskać szczegółowe i natychmiastowo wierne sceny.

PixelCNN i PixelRNN zademonstrowały generowanie surowego piksela po pikselu i nadal są wykorzystywane jako podstawy nauczania dla modeli opartych na prawdopodobieństwie.

MaskGIT i Muse wykorzystują równoległe dekodowanie tokenów maskowanych, aby przyspieszyć syntezę obrazów opartą na tokenach, zachowując jednocześnie szkolenie w stylu autoregresyjnym.

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Autoregressive Image Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

What is Autoregressive Image Generation?

Autoregresyjne generowanie obrazów buduje obrazy pojedynczo, przewidując każdy token na podstawie wszystkiego, co zostało wcześniej wygenerowane. Ma to znaczenie, ponieważ ta sama maszyna, która napędza modele językowe, może tworzyć spójne, kontrolowalne obrazy.

Co oznacza „autoregresywny” w kontekście generowania obrazu?

Modele autoregresyjne rozkładają obraz na czynniki na sekwencję, przewidując każdy token lub piksel na podstawie wszystkich elementów wygenerowanych przed nim.

W jaki sposób nowoczesne autoregresyjne modele obrazu, takie jak DALL-E 1, zazwyczaj reprezentują obraz przed jego przewidzeniem?

Nowoczesne systemy kompresują obraz w postaci dyskretnych tokenów (często za pomocą kodera w stylu VQ-VAE), a następnie przewidują sekwencję tokenów za pomocą transformatora.

Które wczesne modele generowały obrazy po jednym surowym pikselu na raz?

PixelRNN i PixelCNN były pionierami modeli autoregresyjnych, które skanowały i przewidywały obrazy piksel po pikselu.

Jaki mechanizm zapewnia, że Transformator obsługuje tylko wcześniejsze tokeny podczas generowania autoregresyjnego?

Maskowanie przyczynowe blokuje każdą pozycję przed zajmowaniem się przyszłymi tokenami, wymuszając faktoryzację od lewej do prawej.

Jaka jest główna praktyczna wada próbkowania obrazu autoregresyjnego?

Ponieważ każdy token zależy od poprzedniego, wnioskowanie musi być wykonywane żeton po tokenie, co powoduje, że generowanie jest stosunkowo powolne.