VQ-VAE i dyskretne utajenia
VQ-VAE kompresuje obrazy, dźwięk lub wideo do małej siatki dyskretnych kodów zaczerpniętych z wyuczonego słownika, zamiast liczb ciągłych.
Przegląd
This discrete bottleneck lets powerful sequence models like Transformers treat media as 'tokens', much like words.
Głębokie nurkowanie
VQ-VAE (Vector Quantized Variational Autoencoder), wprowadzony przez van den Oorda i współpracowników z DeepMind w 2017 roku, to autoenkoder, którego ukryta przestrzeń jest dyskretna. Koder zamienia obraz w siatkę ciągłych wektorów; każdy wektor jest następnie przyciągany do najbliższego wpisu w wyuczonym słowniku osadzania (kwantyzacja wektorów). Dekoder rekonstruuje obraz na podstawie skwantowanych kodów. Ponieważ ukryte elementy stanowią obecnie skończony słownik indeksów, odrębny model może uczyć się ich rozkładu i generować nową treść. Ta dwustopniowa receptura zasila DALL-E 1, Jukebox do muzyki i VQGAN, który dodaje utratę percepcji i kontradyktoryjności w celu ostrzejszych rekonstrukcji. VQ-VAE-2 stosował wiele rozdzielczości, aby uzyskać obrazy o wysokiej jakości.
Wgląd techniczny
Krok kwantyzacji (wyszukiwanie najbliższego sąsiada argmin) jest niezróżnicowalny, więc VQ-VAE wykorzystuje prosty estymator: gradienty są kopiowane bezpośrednio z wejścia dekodera z powrotem na wyjście kodera, tak jakby kwantyzacja była tożsamością. Uczenie łączy w sobie utratę rekonstrukcji, utratę książki kodowej ciągnącą osadzania w stronę wyjść kodera oraz utratę zaangażowania, utrzymującą koder przywiązany do wybranych kodów. Częstą awarią jest załamanie się książki kodów, w wyniku czego wykorzystywanych jest tylko kilka kodów.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość VQ-VAE i dyskretnych utajeń
Dyskretne ukryte elementy mają kluczowe znaczenie w dążeniu do ujednoliconych modeli multimodalnych, które tokenizują obrazy, dźwięk i wideo w tym samym słownictwie co tekst. Ulepszenia, takie jak kwantyzacja resztkowa i skończona, większe słowniki i lepsze równoważenie użycia, redukują zapadanie się i zwiększają wierność. Ponieważ modele mają na celu zarówno zrozumienie, jak i generowanie różnych modalności, solidne tokenizatory zbudowane na pomysłach VQ-VAE pozostaną podstawowym składnikiem, coraz bardziej konkurując i łącząc się z podejściami do ciągłej ukrytej dyfuzji.
Implementacja w świecie rzeczywistym
DALL-E 1 wykorzystywał dyskretny tokenizator VQ-VAE, dzięki czemu transformator mógł generować obrazy jako sekwencje indeksów książki kodowej.
VQGAN połączył VQ-VAE ze stratami kontradyktoryjnymi i percepcyjnymi, aby stworzyć wyraźne tokeny obrazowe o wysokiej rozdzielczości na potrzeby generowania dzieł sztuki.
OpenAI Jukebox zastosował VQ-VAE do surowego dźwięku, kompresując muzykę do dyskretnych kodów na potrzeby modelowania generatywnego.
VQ-VAE-2 ułożył hierarchicznie dyskretne ukryte elementy, aby zsyntetyzować różnorodne obrazy o wysokiej jakości, mogące konkurować z sieciami GAN swojej epoki.
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VQ-VAE and Discrete Latents quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Mieszanie utajone i interpolacja obrazu
Często zadawane pytania
What is VQ-VAE and Discrete Latents?
VQ-VAE kompresuje obrazy, dźwięk lub wideo do małej siatki dyskretnych kodów zaczerpniętych z wyuczonego słownika, zamiast liczb ciągłych. To dyskretne wąskie gardło pozwala potężnym modelom sekwencji, takim jak Transformers, traktować media jako „żetony”, podobnie jak słowa.
Czym przestrzeń ukryta VQ-VAE różni się od standardowej przestrzeni VAE?
VQ-VAE zastępuje ciągłe kody ukryte dyskretnymi kodami pobieranymi z wyuczonego słownika poprzez kwantyzację wektorową.
W jaki sposób VQ-VAE przepuszcza gradienty przez etap niezróżnicowanej kwantyzacji?
Estymator prosty kopiuje gradient wejściowy dekodera bezpośrednio na wyjście kodera, traktując kwantyzację jako tożsamość przejścia wstecz.
Co to jest „załamanie książki kodowej”?
Załamanie się książki kodowej ma miejsce, gdy model opiera się na zaledwie kilku kodach, marnując większość książki kodowej i szkodząc różnorodności.
Dlaczego dyskretne utajenia są przydatne w modelowaniu generatywnym za pomocą transformatorów?
Dyskretne indeksy tworzą skończony słownik, więc modele sekwencji, takie jak Transformers, mogą uczyć się i próbkować ich rozkładu, podobnie jak słowa.
Co VQGAN dodał do podstawowej receptury VQ-VAE?
VQGAN wzmacnia VQ-VAE o dyskryminator i utratę percepcji, dając wyraźniejsze i bardziej szczegółowe zrekonstruowane tokeny.