PRZEWODNIK Wizualnej AI

Synteza obrazu VQGAN i książki kodowej

VQGAN kompresuje obrazy w siatkę dyskretnych znaczników zaczerpniętych z wyuczonego słownika, umożliwiając transformatorowi generowanie obrazów w taki sam sposób, w jaki modele językowe generują tekst.

2 minuty czytaniaOstatnia aktualizacja

Głębokie nurkowanie

VQGAN, wprowadzony w artykule z 2021 r. „Taming Transformers for High-Resolution Image Synthesis”, łączy wektorowo kwantowany autoenkoder (VQVAE) z treningiem kontradyktoryjnym i percepcyjnym. Koder odwzorowuje obraz na małą siatkę wektorów cech; każdy wektor jest przyciągany do najbliższego wpisu w wyuczonym słowniku zawierającym, powiedzmy, 1024 dyskretnych kodów, zamieniając obraz w sekwencję znaczników liczb całkowitych. Dekoder rekonstruuje obraz z tych tokenów, wyszkolony za pomocą dyskryminatora GAN i utraty percepcji, dzięki czemu rekonstrukcje wyglądają ostro, a nie rozmazane. Ponieważ obrazy są teraz dyskretnymi sekwencjami tokenów, transformator autoregresyjny może modelować je jak język, przewidując tokeny jeden po drugim. VQGAN słynął z wczesnych narzędzi do konwersji tekstu na obraz w połączeniu ze wskazówkami CLIP.

Wgląd techniczny

Podstawową operacją jest kwantyzacja wektorowa: ciągłe wyjścia kodera są zastępowane najbliższymi wektorami ze słownika, z „prostym” estymatorem gradientu, dzięki czemu koder może nadal się uczyć pomimo wyszukiwania niezróżnicowanego. Dodanie opartego na poprawkach dyskryminatora GAN na autoenkoderze pozwala VQGAN używać znacznie mniejszej siatki tokenów (np. 16x16) niż VQVAE, zachowując przy tym ostrość tekstur, dzięki czemu modelowanie transformatora jest łatwiejsze.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość VQGAN i syntezy obrazów książki kodowej

Przepis na dyskretny token VQGAN stał się podstawą modeli obrazów i wideo opartych na tokenach, od MaskGIT po systemy multimodalne, które łączą tokeny obrazu i tekstu w jednym transformatorze. Badania zmierzają obecnie w kierunku większych, skończonych skalarnych lub niewymagających wyszukiwania słowników, które pozwalają uniknąć zapadania się książki kodowej, oraz w kierunku ujednoliconych modeli, w których to samo słownictwo obejmuje obrazy, dźwięk i język, umożliwiając generowanie każdego z dowolnego.

Implementacja w świecie rzeczywistym

Kodowanie zdjęcia w siatce 16x16 tokenów książki kodowej, aby transformator mógł je modelować i regenerować

Połączenie VQGAN ze wskazówkami CLIP w celu stworzenia surrealistycznej grafiki AI „VQGAN + CLIP”, która stała się popularna w 2021 r.

Kompresja obrazów do kompaktowych, dyskretnych kodów w celu wydajnego przechowywania lub dalszego szkolenia generatywnego

Służy jako tokenizator obrazu w większych generatorach opartych na tokenach, takich jak MaskGIT i transformatory multimodalne

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQGAN and Codebook Image Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Synteza obrazu semantycznego SPADE

Często zadawane pytania

Czym jest VQGAN i synteza obrazów w Codebooku?

VQGAN kompresuje obrazy w siatkę dyskretnych znaczników zaczerpniętych z wyuczonego słownika, umożliwiając transformatorowi generowanie obrazów w taki sam sposób, w jaki modele językowe generują tekst.

Czego używa VQGAN do reprezentowania obrazu w postaci dyskretnych tokenów?

VQGAN kwantyzuje funkcje kodera do najbliższych wpisów w wyuczonym słowniku, zamieniając obraz w sekwencję dyskretnych indeksów kodu.

Dlaczego VQGAN dodaje dyskryminator GAN do VQVAE?

Straty kontradyktoryjne i percepcyjne pozwoliły VQGAN zrekonstruować wyraźne obrazy z kompaktowej siatki żetonów, która sama VQVAE ma tendencję do rozmycia.

Kiedy obraz jest sekwencją tokenów, jaki model generuje nowe obrazy?

Ponieważ obrazy stają się dyskretnymi sekwencjami tokenów, transformator może je modelować autoregresywnie, podobnie jak generowanie tekstu.

Jaka technika umożliwia przepływ gradientów przez etap niezróżnicowanej kwantyzacji?

Kwantyzacja wektorowa nie jest różniczkowalna, dlatego VQGAN wykorzystuje prosty estymator gradientu do uczenia kodera.

Jaki słynny trend w sztuce AI VQGAN pomógł stworzyć w 2021 roku?

Połączenie VQGAN ze wskazówkami CLIP doprowadziło do powstania szeroko rozpowszechnionej grafiki „VQGAN+CLIP”, która spopularyzowała generowanie obrazów na podstawie tekstu.