GUIDA AI visiva

VQ-VAE e latenti discreti

VQ-VAE comprime immagini, audio o video in una piccola griglia di codici discreti estratti da un codice appreso, invece di numeri continui.

2 minuti di letturaUltimo aggiornamento

Panoramica

This discrete bottleneck lets powerful sequence models like Transformers treat media as 'tokens', much like words.

Immersione profonda

VQ-VAE (Vector Quantized Variational Autoencoder), introdotto da van den Oord e colleghi di DeepMind nel 2017, è un autoencoder il cui spazio latente è discreto. Un codificatore trasforma un'immagine in una griglia di vettori continui; ciascun vettore viene quindi agganciato alla voce più vicina in un codice appreso di incorporamenti (quantizzazione del vettore). Il decodificatore ricostruisce l'immagine da quei codici quantizzati. Poiché i latenti sono ora un vocabolario finito di indici, un modello separato può apprenderne la distribuzione e generare nuovo contenuto. Questa ricetta a due fasi alimenta DALL-E 1, Jukebox per la musica e VQGAN, che aggiunge una perdita percettiva e contraddittoria per ricostruzioni più nitide. VQ-VAE-2 ha sovrapposto più risoluzioni per produrre immagini ad alta fedeltà.

Approfondimento tecnico

Il passo di quantizzazione (ricerca del vicino più vicino argmin) non è differenziabile, quindi VQ-VAE utilizza uno stimatore diretto: i gradienti vengono copiati direttamente dall'ingresso del decodificatore all'uscita del codificatore come se la quantizzazione fosse l'identità. L'addestramento combina una perdita di ricostruzione, una perdita di codice che attira gli incorporamenti verso gli output del codificatore e una perdita di impegno che mantiene il codificatore impegnato sui codici scelti. Un errore comune è il collasso del codebook, in cui vengono utilizzati solo pochi codici.

Impatto strategico

Velocità e scala

L’intelligenza artificiale visiva può automatizzare le attività di ispezione, rilevamento ed etichettatura su larga scala.

Scelte di build

I team creativi possono prototipare i concetti più velocemente con meno revisioni manuali.

Team e flusso di lavoro

Le operazioni possono utilizzare segnali immagine e video che in precedenza erano difficili da elaborare.

Il futuro di VQ-VAE e dei latenti discreti

I latenti discreti sono centrali nella spinta verso modelli multimodali unificati che tokenizzano immagini, audio e video nello stesso vocabolario del testo. Miglioramenti come la quantizzazione scalare residua e finita, codici più grandi e un migliore bilanciamento dell'utilizzo stanno riducendo il collasso e aumentando la fedeltà. Poiché i modelli mirano sia a comprendere che a generare attraverso modalità, i tokenizzatori robusti basati sulle idee VQ-VAE rimarranno un ingrediente fondamentale, sempre più in competizione e combinandosi con approcci di diffusione latente continua.

Implementazione nel mondo reale

DALL-E 1 utilizzava un tokenizzatore VQ-VAE discreto in modo che un trasformatore potesse generare immagini come sequenze di indici di codici.

VQGAN ha combinato VQ-VAE con perdite contraddittorie e percettive per produrre token di immagini nitide e ad alta risoluzione per la generazione artistica.

Jukebox di OpenAI ha applicato VQ-VAE all'audio non elaborato, comprimendo la musica in codici discreti per la modellazione generativa.

VQ-VAE-2 ha impilato latenti discreti gerarchici per sintetizzare immagini diverse e ad alta fedeltà che rivaleggiavano con i GAN della sua epoca.

Rischi e guardrail

I diritti di immagine e il consenso possono diventare rischi legali se la provenienza non è chiara.

Le prestazioni del modello possono variare in base all'illuminazione, ai dati demografici e agli ambienti.

I falsi positivi possono passare inosservati a meno che non vengano monitorate le soglie di confidenza.

Tabella di marcia per l'implementazione

1

Definire i criteri di accettazione per i costi di precisione, richiamo ed errore.

2

Testare con dati che corrispondono alle reali condizioni di produzione.

3

Aggiungi la revisione umana per previsioni poco attendibili o ad alto impatto.

4

Tieni traccia della deriva del modello e riconvalida dopo le modifiche alla fotocamera o al set di dati.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQ-VAE and Discrete Latents quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Miscelazione latente e interpolazione delle immagini

Domande frequenti

What is VQ-VAE and Discrete Latents?

VQ-VAE comprime immagini, audio o video in una piccola griglia di codici discreti estratti da un codice appreso, invece di numeri continui. Questo collo di bottiglia discreto consente a potenti modelli di sequenza come Transformers di trattare i media come "gettoni", proprio come le parole.

Cosa rende lo spazio latente di VQ-VAE diverso da quello di VAE standard?

VQ-VAE sostituisce i latenti continui con codici discreti estratti da un libro di codici appreso tramite quantizzazione vettoriale.

In che modo VQ-VAE fa passare i gradienti attraverso la fase di quantizzazione non differenziabile?

Lo stimatore diretto copia il gradiente di ingresso del decodificatore direttamente sull'uscita del codificatore, trattando la quantizzazione come identità per il passaggio all'indietro.

Cos'è il "crollo del codice"?

Il collasso del codice si verifica quando il modello si basa solo su pochi codici, sprecando la maggior parte del codice e danneggiando la diversità.

Perché i latenti discreti sono utili per la modellazione generativa con Transformers?

Gli indici discreti formano un vocabolario finito, quindi i modelli di sequenza come Transformers possono apprendere e campionare la loro distribuzione proprio come le parole.

Cosa ha aggiunto VQGAN alla ricetta base VQ-VAE?

VQGAN aumenta VQ-VAE con un discriminatore e una perdita percettiva, producendo token ricostruiti più nitidi e dettagliati.