GUIA visual de IA

Decodificação de token paralelo MaskGIT

MaskGIT gera imagens prevendo muitos tokens de uma vez e preenchendo primeiro os mais confiáveis, substituindo a geração lenta da esquerda para a direita por um punhado de etapas paralelas rápidas.

2 minutos de leituraÚltima atualização

Mergulho profundo

MaskGIT (Masked Generative Image Transformer), de Google em 2022, repensa como os modelos de imagem baseados em token são decodificados. Transformadores anteriores, como o VQGAN, geravam tokens autoregressivamente, um de cada vez em ordem raster, o que é lento e não natural para imagens 2D. Em vez disso, o MaskGIT treina com um objetivo de modelagem mascarado como o BERT: subconjuntos aleatórios de tokens de imagem são ocultos e o modelo aprende a predizê-los todos simultaneamente usando atenção bidirecional. No momento da geração, ele começa a partir de uma grade totalmente mascarada e é decodificado em um número fixo de iterações (geralmente de 8 a 12). Cada etapa prevê todos os tokens mascarados, mantém as previsões de maior confiança e mascara novamente o restante para a próxima rodada. Isso produz imagens de alta qualidade em aproximadamente uma ordem de magnitude menos etapas do que a decodificação autorregressiva.

Visão Técnica

O componente crucial é o cronograma de mascaramento baseado na confiança. Uma programação de cosseno decide quantos tokens revelar cada iteração, começando devagar e acelerando. Como a atenção é bidirecional, cada token vê a imagem parcial inteira, portanto, comprometer primeiro as previsões mais confiáveis ​​permite que as etapas posteriores se condicionem em um contexto sólido, da mesma forma que resolver as partes fáceis de um quebra-cabeça antes das ambíguas.

Impacto Estratégico

Velocidade e escala

A IA visual pode automatizar tarefas de inspeção, detecção e marcação em grande escala.

Escolhas de construção

As equipes criativas podem criar protótipos de conceitos mais rapidamente e com menos revisões manuais.

Equipe e fluxo de trabalho

As operações podem usar sinais de imagem e vídeo que antes eram difíceis de processar.

O futuro da decodificação de token paralelo MaskGIT

A decodificação iterativa paralela do MaskGIT inspirou uma onda de geradores não autorregressivos, incluindo MUSE para texto para imagem e abordagens mascaradas para vídeo. O padrão, prevendo tokens em paralelo e refinando em algumas etapas, fica entre GANs únicos e difusão em muitas etapas, oferecendo uma compensação ajustável entre qualidade e velocidade. Espere que a decodificação de token mascarado continue aparecendo em geradores multimodais rápidos e sistemas de edição onde pintura interna e preenchimentos condicionais são ajustes naturais.

Implementação no mundo real

Gerando uma imagem completa em cerca de 8 a 12 etapas paralelas, em vez de centenas de previsões de token autorregressivas

Pintar uma região mascarada de uma foto prevendo novamente apenas os tokens ocultos com o contexto circundante

Síntese de imagem condicional de classe no ImageNet com qualidade competitiva com modelos muito mais lentos

Servindo como espinha dorsal de decodificação para sistemas de texto para imagem como o MUSE de Google que precisam de geração rápida

Riscos e guarda-corpos

Os direitos de imagem e o consentimento podem tornar-se riscos legais se a proveniência não for clara.

O desempenho do modelo pode variar dependendo da iluminação, dados demográficos e ambientes.

Os falsos positivos podem passar despercebidos, a menos que os limites de confiança sejam monitorados.

Roteiro de implementação

1

Defina critérios de aceitação para precisão, recall e custos de erro.

2

Teste com dados que correspondam às condições reais de produção.

3

Adicione revisão humana para previsões de baixa confiança ou de alto impacto.

4

Rastreie o desvio do modelo e revalide após alterações na câmera ou no conjunto de dados.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MaskGIT Parallel Token Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Decodificação paralela do esqueleto do pensamento

Perguntas frequentes

What is MaskGIT Parallel Token Decoding?

MaskGIT gera imagens prevendo muitos tokens de uma vez e preenchendo primeiro os mais confiáveis, substituindo a geração lenta da esquerda para a direita por um punhado de etapas paralelas rápidas.

Como o MaskGIT decodifica tokens de imagem de maneira diferente do transformador do VQGAN?

MaskGIT prevê todos os tokens mascarados simultaneamente com atenção bidirecional, ao contrário da lenta decodificação autorregressiva da esquerda para a direita do VQGAN.

Qual objetivo de treinamento o MaskGIT empresta dos modelos de linguagem?

MaskGIT esconde subconjuntos aleatórios de tokens e aprende a predizê-los, um objetivo de modelagem mascarado semelhante ao BERT.

Durante a geração, quais tokens o MaskGIT compromete em cada iteração?

Cada etapa mantém as previsões mais confiáveis ​​e mascara novamente o restante, de modo que as etapas posteriores condicionam um contexto confiável.

Aproximadamente quantas iterações o MaskGIT normalmente precisa para gerar uma imagem?

O MaskGIT decodifica em um pequeno número fixo de etapas, geralmente de 8 a 12, muito menos do que as abordagens autorregressivas ou de difusão.

Qual cronograma controla quantos tokens o MaskGIT revela em cada etapa?

Uma programação de cosseno revela poucos tokens no início e mais tarde, equilibrando qualidade e velocidade nas iterações.