GUIA visual de IA

Modelos de Difusão Latente

Os modelos de difusão latente geram imagens executando o processo de difusão em um espaço latente compactado em vez de pixels brutos, reduzindo os custos de computação.

2 minutos de leituraÚltima atualização

Visão geral

They are the engine behind Stable Diffusion and most modern open-source image generators.

Mergulho profundo

Um modelo de difusão padrão aprende a reverter um processo de ruído: ele começa com ruído puro e gradualmente reduz o ruído em uma imagem. Fazer isso diretamente nos pixels é caro porque uma imagem de 512x512 possui centenas de milhares de valores. A difusão latente, introduzida por Rombach e colegas em 2022, usa pela primeira vez um autoencoder variacional (VAE) pré-treinado para compactar uma imagem em uma pequena grade latente (geralmente 64x64x4, aproximadamente 48x menor). A difusão U-Net aprende então a eliminar o ruído dentro desse espaço latente compacto, guiada pelo texto por meio de atenção cruzada. Finalmente, o decodificador VAE reconstrói pixels de resolução total. Essa compressão perceptual mantém as informações semanticamente significativas enquanto descarta detalhes imperceptíveis, tornando viável a geração de alta qualidade em GPUs de consumo.

Visão Técnica

O truque principal é separar a compressão perceptual da modelagem generativa. O VAE lida com os detalhes dos pixels de alta frequência uma vez, e o U-Net modela apenas a distribuição latente de dimensão inferior. O condicionamento de texto é injetado por meio de camadas de atenção cruzada, onde os recursos espaciais da U-Net atendem à incorporação de tokens de um codificador de texto como o CLIP. Como as latentes são aproximadamente 48 vezes menores que os pixels, cada etapa de eliminação de ruído é dramaticamente mais barata tanto em memória quanto em FLOPs.

Impacto Estratégico

Velocidade e escala

A IA visual pode automatizar tarefas de inspeção, detecção e marcação em grande escala.

Escolhas de construção

As equipes criativas podem criar protótipos de conceitos mais rapidamente e com menos revisões manuais.

Equipe e fluxo de trabalho

As operações podem usar sinais de imagem e vídeo que antes eram difíceis de processar.

O futuro dos modelos de difusão latente

A difusão latente está se expandindo além das imagens para vídeo (Stable Video Diffusion), ativos 3D e espectrogramas de áudio, todos usando a mesma receita de compactação e remoção de ruído. A pesquisa está avançando em direção a menos etapas de amostragem por meio de modelos de destilação e consistência, melhores VAEs que preservam texto e faces finas e formulações de fluxo retificado como aquelas em Difusão Estável 3 que endireitam a trajetória de geração para resultados mais rápidos e nítidos.

Implementação no mundo real

Difusão estável gerando arte e designs conceituais a partir de prompts de texto em uma única GPU de consumidor

Adobe e Canva potencializam recursos de texto para imagem e preenchimento generativo baseados em backbones de difusão latente

Estúdios de jogos produzindo mapas de textura, sprites e arte conceitual de ambiente para acelerar a pré-produção

Equipes de banco de imagens e marketing criando modelos de produtos de marca e visuais de anúncios sem uma sessão de fotos

Riscos e guarda-corpos

Os direitos de imagem e o consentimento podem tornar-se riscos legais se a proveniência não for clara.

O desempenho do modelo pode variar dependendo da iluminação, dados demográficos e ambientes.

Os falsos positivos podem passar despercebidos, a menos que os limites de confiança sejam monitorados.

Roteiro de implementação

1

Defina critérios de aceitação para precisão, recall e custos de erro.

2

Teste com dados que correspondam às condições reais de produção.

3

Adicione revisão humana para previsões de baixa confiança ou de alto impacto.

4

Rastreie o desvio do modelo e revalide após alterações na câmera ou no conjunto de dados.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Latent Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Modelos de difusão de vídeo

Perguntas frequentes

What is Latent Diffusion Models?

Os modelos de difusão latente geram imagens executando o processo de difusão em um espaço latente compactado em vez de pixels brutos, reduzindo os custos de computação. Eles são o motor por trás do Stable Diffusion e dos mais modernos geradores de imagens de código aberto.

Qual é a principal inovação dos modelos de difusão latente em comparação com a difusão no espaço de pixels?

A difusão latente comprime imagens em um espaço latente menor usando um VAE, de modo que a dispendiosa eliminação de ruído ocorre em muito menos valores do que em pixels completos.

Qual componente comprime uma imagem no espaço latente e depois a reconstrói?

Um VAE pré-treinado codifica a imagem em uma grade latente compacta e seu decodificador reconstrói pixels de resolução total no final.

Como o texto é normalmente injetado na U-Net com eliminação de ruído em difusão latente?

Incorporações de token de um codificador de texto são alimentadas em camadas de atenção cruzada, permitindo que recursos espaciais atendam ao prompt.

Por que operar no espaço latente reduz o custo computacional?

Espere – o motivo correto é que a grade latente é muito menor (geralmente ~48x) do que a imagem de pixel, então cada etapa de remoção de ruído precisa de muito menos FLOPs e memória.

Qual modelo de código aberto amplamente utilizado popularizou a difusão latente?

Stable Diffusion, lançado em 2022, trouxe difusão latente para hardware de consumo e adoção em massa.