VQGAN e sintesi di immagini del codebook
VQGAN comprime le immagini in una griglia di token discreti estratti da un codice appreso, consentendo a un trasformatore di generare immagini nello stesso modo in cui i modelli linguistici generano il testo.
Immersione profonda
VQGAN, introdotto nel documento del 2021 "Taming Transformers for High-Resolution Image Synthesis", combina un codificatore automatico quantizzato vettoriale (VQVAE) con un addestramento contraddittorio e percettivo. Un codificatore mappa un'immagine su una piccola griglia di vettori di caratteristiche; ogni vettore viene agganciato alla voce più vicina in un codice appreso di, diciamo, 1024 codici discreti, trasformando l'immagine in una sequenza di token interi. Un decodificatore ricostruisce l'immagine da quei token, addestrati con un discriminatore GAN e una perdita percettiva in modo che le ricostruzioni appaiano nitide anziché sfocate. Poiché le immagini sono ora sequenze di token discrete, un trasformatore autoregressivo può modellarle come il linguaggio, prevedendo i token uno per uno. VQGAN notoriamente alimentava i primi strumenti artistici da testo a immagine se abbinato alla guida CLIP.
Approfondimento tecnico
L'operazione principale è la quantizzazione vettoriale: le uscite continue del codificatore vengono sostituite dai vettori del libro di codici più vicini, con uno stimatore del gradiente "diretto" in modo che il codificatore possa ancora apprendere nonostante la ricerca non differenziabile. L'aggiunta di un discriminatore GAN basato su patch sopra l'autocodificatore è ciò che consente a VQGAN di utilizzare una griglia di token molto più piccola (ad esempio 16x16) rispetto a VQVAE mantenendo le trame nitide, rendendo trattabile la modellazione del trasformatore.
Impatto strategico
Velocità e scala
L’intelligenza artificiale visiva può automatizzare le attività di ispezione, rilevamento ed etichettatura su larga scala.
Scelte di build
I team creativi possono prototipare i concetti più velocemente con meno revisioni manuali.
Team e flusso di lavoro
Le operazioni possono utilizzare segnali immagine e video che in precedenza erano difficili da elaborare.
Il futuro di VQGAN e della sintesi di immagini del codebook
La ricetta dei token discreti di VQGAN è diventata la base per modelli di immagini e video basati su token, da MaskGIT ai sistemi multimodali che mescolano token di immagini e testo in un unico trasformatore. La ricerca ora si spinge verso codici più grandi, scalari finiti o senza ricerca che evitino il collasso dei codici e verso modelli unificati in cui lo stesso vocabolario abbraccia immagini, audio e linguaggio, consentendo la generazione any-to-any.
Implementazione nel mondo reale
Codifica di una foto in una griglia 16x16 di token di codici in modo che un trasformatore possa modellarla e rigenerarla
Abbinare VQGAN alla guida CLIP per creare la surreale arte AI "VQGAN+CLIP" diventata virale nel 2021
Compressione delle immagini in codici discreti compatti per un'archiviazione efficiente o un training generativo downstream
Funge da tokenizzatore di immagini all'interno di generatori basati su token più grandi come MaskGIT e trasformatori multimodali
Rischi e guardrail
I diritti di immagine e il consenso possono diventare rischi legali se la provenienza non è chiara.
Le prestazioni del modello possono variare in base all'illuminazione, ai dati demografici e agli ambienti.
I falsi positivi possono passare inosservati a meno che non vengano monitorate le soglie di confidenza.
Tabella di marcia per l'implementazione
Definire i criteri di accettazione per i costi di precisione, richiamo ed errore.
Testare con dati che corrispondono alle reali condizioni di produzione.
Aggiungi la revisione umana per previsioni poco attendibili o ad alto impatto.
Tieni traccia della deriva del modello e riconvalida dopo le modifiche alla fotocamera o al set di dati.
Continua a esplorare
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VQGAN and Codebook Image Synthesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Prossima guida
Sintesi semantica dell'immagine SPADE
Domande frequenti
What is VQGAN and Codebook Image Synthesis?
VQGAN comprime le immagini in una griglia di token discreti estratti da un codice appreso, consentendo a un trasformatore di generare immagini nello stesso modo in cui i modelli linguistici generano il testo.
Cosa utilizza VQGAN per rappresentare un'immagine come token discreti?
VQGAN quantizza le caratteristiche del codificatore alle voci più vicine in un codice appreso, trasformando l'immagine in una sequenza di indici di codice discreti.
Perché VQGAN aggiunge un discriminatore GAN sopra un VQVAE?
Le perdite contraddittorie e percettive consentono a VQGAN di ricostruire immagini nitide da una griglia di token compatta, che VQVAE da sola tende a sfocare.
Una volta che un'immagine è una sequenza di token, quale modello genera nuove immagini?
Poiché le immagini diventano sequenze di token discrete, un trasformatore può modellarle in modo autoregressivo, proprio come quando si genera un testo.
Quale tecnica consente ai gradienti di fluire attraverso la fase di quantizzazione non differenziabile?
La quantizzazione vettoriale non è differenziabile, quindi VQGAN utilizza uno stimatore del gradiente diretto per addestrare il codificatore.
Quale famosa tendenza artistica basata sull'intelligenza artificiale ha contribuito a creare VQGAN nel 2021?
L'abbinamento di VQGAN con la guida CLIP ha prodotto l'arte ampiamente condivisa "VQGAN+CLIP" che ha reso popolare la generazione di immagini basata su testo.