Imagem generativa mascarada do Muse
Muse é um modelo de texto para imagem de Google que gera imagens preenchendo tokens de imagem mascarados de uma só vez, tornando-o muito mais rápido do que a difusão passo a passo.
Visão geral
It matters because it showed you can get high-quality, well-aligned images without the slow iterative denoising that most generators rely on.
Mergulho profundo
O Muse funciona no espaço simbólico discreto de uma imagem. Um VQGAN pré-treinado transforma uma imagem em uma grade de tokens inteiros, como um vocabulário de blocos de construção visuais. Durante o treinamento, uma grande fração desses tokens é mascarada e um Transformer aprende a predizê-los, condicionado à incorporação de texto de um modelo de linguagem grande congelado (T5-XXL). No momento da geração, o Muse começa a partir de uma grade totalmente mascarada e decodifica em rodadas paralelas, prevendo muitos tokens por etapa e mascarando novamente os menos confiantes. Um projeto de dois estágios produz primeiro uma grade de token de baixa resolução e, em seguida, um modelo de super-resolução preenche uma grade de resolução mais alta. Como dezenas de tokens são resolvidos simultaneamente, os modelos de parâmetros 900M e 3B produzem uma imagem de 256 ou 512 pixels em apenas algumas passagens diretas.
Visão Técnica
O truque principal é a decodificação paralela com remascaramento baseado em confiança, geralmente chamado de amostragem no estilo MaskGIT. Em vez de prever um token por vez (autoregressivo) ou eliminar o ruído centenas de vezes (difusão), o Muse prevê todos os tokens mascarados, mantém os mais confiantes e mascara novamente o restante para a próxima rodada. O uso de um codificador de texto T5-XXL congelado fornece um forte entendimento da linguagem gratuitamente, e a operação em tokens discretos permite que o modelo raciocine sobre imagens mais como palavras.
Impacto Estratégico
Velocidade e escala
A IA visual pode automatizar tarefas de inspeção, detecção e marcação em grande escala.
Escolhas de construção
As equipes criativas podem criar protótipos de conceitos mais rapidamente e com menos revisões manuais.
Equipe e fluxo de trabalho
As operações podem usar sinais de imagem e vídeo que antes eram difíceis de processar.
O futuro da imagem generativa mascarada do Muse
A decodificação paralela mascarada aponta para geradores que são de alta qualidade e genuinamente rápidos, o que é essencial para edição interativa e uso no dispositivo. Espere que a ideia de previsão de token se funda com os métodos de difusão e vídeo autorregressivo e potencialize a pintura instantânea, a pintura externa e a edição sem máscara. À medida que os tokenizadores discretos melhoram, a imagem mascarada pode se estender de forma limpa para vídeo e 3D, onde a decodificação paralela pode reduzir drasticamente o custo de geração de muitos quadros ou visualizações.
Implementação no mundo real
Arte conceitual rápida e painéis de humor onde um artista precisa de muitas variações de imagem em segundos, em vez de minutos.
Pintura interna de disparo zero, como remover um objeto e fazer com que o modelo preencha a região mascarada de forma consistente com o ambiente.
Outpainting para estender uma foto além de suas bordas originais para banners ou proporções diferentes.
Edição sem máscara, como alterar a cor de um cachorro ou o pôr do sol do céu, editando o prompt de texto e recodificando os tokens afetados.
Riscos e guarda-corpos
Os direitos de imagem e o consentimento podem tornar-se riscos legais se a proveniência não for clara.
O desempenho do modelo pode variar dependendo da iluminação, dados demográficos e ambientes.
Os falsos positivos podem passar despercebidos, a menos que os limites de confiança sejam monitorados.
Roteiro de implementação
Defina critérios de aceitação para precisão, recall e custos de erro.
Teste com dados que correspondam às condições reais de produção.
Adicione revisão humana para previsões de baixa confiança ou de alto impacto.
Rastreie o desvio do modelo e revalide após alterações na câmera ou no conjunto de dados.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Muse Masked Generative Imaging quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Autoencoders mascarados
Perguntas frequentes
What is Muse Masked Generative Imaging?
Muse é um modelo de texto para imagem de Google que gera imagens preenchendo tokens de imagem mascarados de uma só vez, tornando-o muito mais rápido do que a difusão passo a passo. É importante porque mostrou que você pode obter imagens bem alinhadas e de alta qualidade sem a lenta eliminação de ruído iterativa da qual a maioria dos geradores depende.
O que o Muse prevê durante a geração em vez de eliminar o ruído dos pixels?
O Muse opera em um espaço de token discreto, prevendo tokens de imagem mascarados produzidos por um tokenizer VQGAN em vez de trabalhar diretamente em pixels.
Por que o Muse é geralmente mais rápido que os modelos de difusão padrão?
O Muse preenche muitos tokens mascarados simultaneamente e precisa apenas de algumas rodadas de decodificação, ao contrário das muitas etapas sequenciais de eliminação de ruído da difusão.
Onde o Muse consegue entender o prompt de texto?
O Muse condiciona a geração de incorporações de texto a partir de um modelo de linguagem T5-XXL pré-treinado e congelado, proporcionando forte compreensão da linguagem.
Qual é o papel do remascaramento baseado em confiança no Muse?
Após cada previsão paralela, o Muse retém os tokens mais confiantes e mascara novamente os menos confiantes para refinar em rodadas sucessivas.
Como o Muse lida com a produção de imagens de alta resolução?
O Muse primeiro gera uma grade de tokens de baixa resolução e, em seguida, um segundo modelo de super-resolução produz uma grade de tokens de alta resolução.