GUIA visual de IA

Síntese de imagens VQGAN e Codebook

O VQGAN compacta imagens em uma grade de tokens discretos extraídos de um livro de códigos aprendido, permitindo que um transformador gere imagens da mesma forma que os modelos de linguagem geram texto.

2 minutos de leituraÚltima atualização

Mergulho profundo

VQGAN, apresentado no artigo de 2021 'Taming Transformers for High-Resolution Image Synthesis', combina um autoencoder quantizado vetorial (VQVAE) com treinamento adversário e perceptivo. Um codificador mapeia uma imagem para uma pequena grade de vetores de recursos; cada vetor é ajustado à entrada mais próxima em um livro de códigos aprendido de, digamos, 1.024 códigos discretos, transformando a imagem em uma sequência de tokens inteiros. Um decodificador reconstrói a imagem desses tokens, treinados com um discriminador GAN e perda de percepção para que as reconstruções pareçam nítidas em vez de borradas. Como as imagens agora são sequências de tokens discretas, um transformador autorregressivo pode modelá-las como uma linguagem, prevendo os tokens um por um. O VQGAN é famoso por fornecer ferramentas de arte de texto para imagem quando combinadas com orientação CLIP.

Visão Técnica

A operação principal é a quantização vetorial: as saídas contínuas do codificador são substituídas pelos vetores do livro de código mais próximos, com um estimador de gradiente 'direto' para que o codificador ainda possa aprender, apesar da pesquisa não diferenciável. Adicionar um discriminador GAN baseado em patch no topo do autoencoder é o que permite ao VQGAN usar uma grade de token muito menor (por exemplo, 16x16) do que o VQVAE, mantendo as texturas nítidas, tornando a modelagem do transformador tratável.

Impacto Estratégico

Velocidade e escala

A IA visual pode automatizar tarefas de inspeção, detecção e marcação em grande escala.

Escolhas de construção

As equipes criativas podem criar protótipos de conceitos mais rapidamente e com menos revisões manuais.

Equipe e fluxo de trabalho

As operações podem usar sinais de imagem e vídeo que antes eram difíceis de processar.

O futuro do VQGAN e da síntese de imagens do livro de códigos

A receita de token discreto da VQGAN tornou-se a base para modelos de imagem e vídeo baseados em token, desde MaskGIT até sistemas multimodais que misturam tokens de imagem e texto em um transformador. A pesquisa agora avança em direção a livros de códigos maiores, com escalar finita ou sem pesquisa, que evitam o colapso do livro de códigos e em direção a modelos unificados onde o mesmo vocabulário abrange imagens, áudio e linguagem, permitindo qualquer geração.

Implementação no mundo real

Codificar uma foto em uma grade 16x16 de tokens de livro de códigos para que um transformador possa modelá-la e regenerá-la

Emparelhando VQGAN com orientação CLIP para criar a arte surreal de IA ‘VQGAN+CLIP’ que se tornou viral em 2021

Compactação de imagens em códigos discretos compactos para armazenamento eficiente ou treinamento generativo downstream

Servindo como tokenizador de imagem dentro de geradores maiores baseados em tokens, como MaskGIT e transformadores multimodais

Riscos e guarda-corpos

Os direitos de imagem e o consentimento podem tornar-se riscos legais se a proveniência não for clara.

O desempenho do modelo pode variar dependendo da iluminação, dados demográficos e ambientes.

Os falsos positivos podem passar despercebidos, a menos que os limites de confiança sejam monitorados.

Roteiro de implementação

1

Defina critérios de aceitação para precisão, recall e custos de erro.

2

Teste com dados que correspondam às condições reais de produção.

3

Adicione revisão humana para previsões de baixa confiança ou de alto impacto.

4

Rastreie o desvio do modelo e revalide após alterações na câmera ou no conjunto de dados.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQGAN and Codebook Image Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Síntese Semântica de Imagens SPADE

Perguntas frequentes

What is VQGAN and Codebook Image Synthesis?

O VQGAN compacta imagens em uma grade de tokens discretos extraídos de um livro de códigos aprendido, permitindo que um transformador gere imagens da mesma forma que os modelos de linguagem geram texto.

O que o VQGAN usa para representar uma imagem como tokens discretos?

O VQGAN quantiza os recursos do codificador para as entradas mais próximas em um livro de códigos aprendido, transformando a imagem em uma sequência de índices de código discretos.

Por que o VQGAN adiciona um discriminador GAN em cima de um VQVAE?

As perdas adversárias e perceptivas permitem que o VQGAN reconstrua imagens nítidas a partir de uma grade de token compacta, que por si só o VQVAE tende a desfocar.

Uma vez que uma imagem é uma sequência de tokens, qual modelo gera novas imagens?

Como as imagens se tornam sequências de tokens discretas, um transformador pode modelá-las de forma autorregressiva, assim como gerar texto.

Que técnica permite que os gradientes fluam através da etapa de quantização não diferenciável?

A quantização vetorial não é diferenciável, portanto o VQGAN usa um estimador de gradiente direto para treinar o codificador.

Que famosa tendência artística de IA o VQGAN ajudou a criar em 2021?

O emparelhamento do VQGAN com a orientação CLIP produziu a arte 'VQGAN + CLIP' amplamente compartilhada que popularizou a geração de imagens baseada em texto.