Modelos de Difusão Latente
Os modelos de difusão latente geram imagens executando o processo de difusão em um espaço latente compactado em vez de pixels brutos, reduzindo os custos de computação.
Visão geral
They are the engine behind Stable Diffusion and most modern open-source image generators.
Mergulho profundo
Um modelo de difusão padrão aprende a reverter um processo de ruído: ele começa com ruído puro e gradualmente reduz o ruído em uma imagem. Fazer isso diretamente nos pixels é caro porque uma imagem de 512x512 possui centenas de milhares de valores. A difusão latente, introduzida por Rombach e colegas em 2022, usa pela primeira vez um autoencoder variacional (VAE) pré-treinado para compactar uma imagem em uma pequena grade latente (geralmente 64x64x4, aproximadamente 48x menor). A difusão U-Net aprende então a eliminar o ruído dentro desse espaço latente compacto, guiada pelo texto por meio de atenção cruzada. Finalmente, o decodificador VAE reconstrói pixels de resolução total. Essa compressão perceptual mantém as informações semanticamente significativas enquanto descarta detalhes imperceptíveis, tornando viável a geração de alta qualidade em GPUs de consumo.
Visão Técnica
O truque principal é separar a compressão perceptual da modelagem generativa. O VAE lida com os detalhes dos pixels de alta frequência uma vez, e o U-Net modela apenas a distribuição latente de dimensão inferior. O condicionamento de texto é injetado por meio de camadas de atenção cruzada, onde os recursos espaciais da U-Net atendem à incorporação de tokens de um codificador de texto como o CLIP. Como as latentes são aproximadamente 48 vezes menores que os pixels, cada etapa de eliminação de ruído é dramaticamente mais barata tanto em memória quanto em FLOPs.
Impacto Estratégico
Velocidade e escala
A IA visual pode automatizar tarefas de inspeção, detecção e marcação em grande escala.
Escolhas de construção
As equipes criativas podem criar protótipos de conceitos mais rapidamente e com menos revisões manuais.
Equipe e fluxo de trabalho
As operações podem usar sinais de imagem e vídeo que antes eram difíceis de processar.
O futuro dos modelos de difusão latente
A difusão latente está se expandindo além das imagens para vídeo (Stable Video Diffusion), ativos 3D e espectrogramas de áudio, todos usando a mesma receita de compactação e remoção de ruído. A pesquisa está avançando em direção a menos etapas de amostragem por meio de modelos de destilação e consistência, melhores VAEs que preservam texto e faces finas e formulações de fluxo retificado como aquelas em Difusão Estável 3 que endireitam a trajetória de geração para resultados mais rápidos e nítidos.
Implementação no mundo real
Difusão estável gerando arte e designs conceituais a partir de prompts de texto em uma única GPU de consumidor
Adobe e Canva potencializam recursos de texto para imagem e preenchimento generativo baseados em backbones de difusão latente
Estúdios de jogos produzindo mapas de textura, sprites e arte conceitual de ambiente para acelerar a pré-produção
Equipes de banco de imagens e marketing criando modelos de produtos de marca e visuais de anúncios sem uma sessão de fotos
Riscos e guarda-corpos
Os direitos de imagem e o consentimento podem tornar-se riscos legais se a proveniência não for clara.
O desempenho do modelo pode variar dependendo da iluminação, dados demográficos e ambientes.
Os falsos positivos podem passar despercebidos, a menos que os limites de confiança sejam monitorados.
Roteiro de implementação
Defina critérios de aceitação para precisão, recall e custos de erro.
Teste com dados que correspondam às condições reais de produção.
Adicione revisão humana para previsões de baixa confiança ou de alto impacto.
Rastreie o desvio do modelo e revalide após alterações na câmera ou no conjunto de dados.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Latent Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Modelos de difusão de vídeo
Perguntas frequentes
What is Latent Diffusion Models?
Os modelos de difusão latente geram imagens executando o processo de difusão em um espaço latente compactado em vez de pixels brutos, reduzindo os custos de computação. Eles são o motor por trás do Stable Diffusion e dos mais modernos geradores de imagens de código aberto.
Qual é a principal inovação dos modelos de difusão latente em comparação com a difusão no espaço de pixels?
A difusão latente comprime imagens em um espaço latente menor usando um VAE, de modo que a dispendiosa eliminação de ruído ocorre em muito menos valores do que em pixels completos.
Qual componente comprime uma imagem no espaço latente e depois a reconstrói?
Um VAE pré-treinado codifica a imagem em uma grade latente compacta e seu decodificador reconstrói pixels de resolução total no final.
Como o texto é normalmente injetado na U-Net com eliminação de ruído em difusão latente?
Incorporações de token de um codificador de texto são alimentadas em camadas de atenção cruzada, permitindo que recursos espaciais atendam ao prompt.
Por que operar no espaço latente reduz o custo computacional?
Espere – o motivo correto é que a grade latente é muito menor (geralmente ~48x) do que a imagem de pixel, então cada etapa de remoção de ruído precisa de muito menos FLOPs e memória.
Qual modelo de código aberto amplamente utilizado popularizou a difusão latente?
Stable Diffusion, lançado em 2022, trouxe difusão latente para hardware de consumo e adoção em massa.