GUIA de fundamentos

Modelos de Difusão

Os modelos de difusão geram imagens aprendendo a reverter um processo de ruído, transformando a estática aleatória em imagens detalhadas, passo a passo.

2 minutos de leituraÚltima atualização

Visão geral

They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.

Mergulho profundo

Um modelo de difusão é treinado em duas direções. No processo de encaminhamento, uma imagem limpa é gradualmente corrompida pela adição de pequenas quantidades de ruído aleatório até se tornar pura estática. O modelo aprende então o inverso: partindo do ruído, ele prevê e remove um pouco de ruído a cada passo, repetindo dezenas ou centenas de vezes até surgir uma imagem nítida. Para tornar isso controlável, um prompt de texto orienta cada etapa de remoção de ruído, de modo que “um astronauta andando a cavalo” direciona a estática em direção a essa imagem. Sistemas modernos como o Stable Diffusion executam esse processo em um espaço latente compactado, em vez de pixels brutos, tornando-o muito mais rápido. Em comparação com os GANs, os modelos de difusão treinam de forma mais estável e produzem maior diversidade, razão pela qual ultrapassaram os GANs como a abordagem dominante para a geração de imagens de alta qualidade por volta de 2022.

Visão Técnica

O principal truque é que a rede nunca precisa gerar uma imagem de uma só vez; ele apenas aprende a prever o ruído adicionado em uma determinada etapa. Durante o treinamento, uma quantidade conhecida de ruído é adicionada a uma imagem real e o modelo é solicitado a estimar esse ruído; a diferença é o erro de treinamento. No momento da geração, o modelo subtrai repetidamente o ruído previsto, revelando gradualmente a estrutura. O condicionamento de texto é injetado por meio de atenção cruzada e a orientação sem classificador amplifica a intensidade com que o prompt orienta a saída.

Impacto Estratégico

Decisões mais claras

Ajuda a separar afirmações técnicas claras da linguagem de marketing.

Custo e orçamento

Você pode fazer perguntas melhores sobre implementação antes de gastar dinheiro ou tempo.

Equipe e fluxo de trabalho

Equipes com entendimento compartilhado tomam melhores decisões sobre produtos, políticas e aprendizado.

O futuro dos modelos de difusão

A difusão é o estado da arte atual para geração de imagens e, cada vez mais, de vídeo e áudio, com ferramentas como Sora estendendo-a ao movimento. O grande impulso é a velocidade: técnicas como modelos de destilação e consistência visam reduzir centenas de etapas de remoção de ruído para um punhado ou mesmo um, permitindo a geração em tempo real. Espere que a difusão se expanda para ativos 3D, design científico, como moléculas e proteínas, e edição rigidamente controlável, ao mesmo tempo que se torna barata o suficiente para ser executada em telefones.

Implementação no mundo real

Criação de arte e imagens originais a partir de prompts de texto em Stable Diffusion, DALL-E e Midjourney

Pintar e pintar, preenchendo ou estendendo partes de uma foto perfeitamente

Gerando vídeo a partir de texto em ferramentas como OpenAI de Sora

Projetando novas moléculas e estruturas proteicas para pesquisa de descoberta de medicamentos

Riscos e guarda-corpos

Equipes diferentes podem usar o mesmo termo de maneira diferente, portanto, defina o escopo com antecedência.

Os benchmarks podem parecer fortes, enquanto o desempenho no mundo real é irregular.

Ignorar a qualidade dos dados e os planos de avaliação cria frequentemente resultados frágeis.

Roteiro de implementação

1

Comece com uma definição em linguagem simples do resultado que você precisa.

2

Escolha uma métrica de sucesso e uma condição de falha antes de testar.

3

Execute um pequeno piloto com dados representativos, não um conjunto de demonstração sofisticado.

4

Documente onde os modelos de difusão ajudam e onde os métodos mais simples são melhores.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

What is Diffusion Models?

Os modelos de difusão geram imagens aprendendo a reverter um processo de ruído, transformando a estática aleatória em imagens detalhadas, passo a passo. Eles potencializam as principais ferramentas de conversão de texto em imagem da atualidade, como Stable Diffusion, DALL-E e Midjourney.

Qual é a ideia central por trás de como um modelo de difusão gera uma imagem?

Um modelo de difusão aprende a reverter um processo de ruído, começando com o ruído puro e eliminando o ruído passo a passo até que uma imagem nítida apareça.

Durante o treinamento, o que o modelo realmente aprende a prever em cada etapa?

O modelo recebe uma imagem com ruído e aprende a estimar o ruído que foi adicionado, para posteriormente subtrair o ruído durante a geração.

Como um prompt de texto influencia a imagem gerada?

O condicionamento de texto (por meio de atenção cruzada e orientação) estimula cada etapa de eliminação de ruído para que a imagem emergente corresponda ao prompt.

Por que o Stable Diffusion executa o processo em um 'espaço latente'?

Operar em um espaço latente compactado em vez de pixels de resolução total reduz drasticamente a computação, preservando a qualidade.

Qual é uma das principais vantagens dos modelos de difusão sobre GANs?

Os modelos de difusão evitam o jogo adversário instável e o colapso do modo dos GANs, proporcionando um treinamento mais confiável e maior variedade de resultados.