Stable Diffusion
Stable Diffusion é um modelo de texto para imagem de código aberto, lançado pela Stability AI em 2022, que gera imagens removendo gradualmente o ruído de um ponto inicial aleatório.
Visão geral
Being open and runnable on consumer GPUs, it sparked a massive community of tools, fine-tunes, and apps.
Mergulho profundo
Os modelos de difusão aprendem a reverter um processo de ruído. Durante o treinamento, as imagens reais recebem ruído aleatório adicionado passo a passo até se tornarem estáticas; o modelo aprende a prever e subtrair esse ruído. Para gerar, ele parte do ruído puro e diminui o ruído repetidamente até que uma imagem coerente apareça, guiada pelo seu prompt de texto. O principal truque de eficiência do Stable Diffusion é a parte 'latente': em vez de trabalhar em pixels de resolução total, ele compacta imagens em um espaço latente menor usando um autoencoder variacional, executa a remoção lenta de ruído ali e depois decodifica de volta em pixels. É por isso que ele pode ser executado em uma GPU de jogos típica, em vez de em um data center. Um codificador de texto (CLIP nas versões anteriores) converte seu prompt em orientação e um U-Net faz a remoção de ruído. Seus pesos abertos permitiram ajustes finos de ControlNet, LoRA e inúmeras ferramentas criativas.
Visão Técnica
A difusão estável é um modelo de difusão latente. Um autoencoder reduz uma imagem de 512x512 em uma grade latente compacta, reduzindo drasticamente a computação. Uma U-Net é treinada para prever o ruído adicionado em cada intervalo de tempo, condicionado à incorporação do texto por meio de atenção cruzada. A orientação sem classificador permite que você ajuste a intensidade com que a imagem segue o prompt, misturando previsões condicionadas e não condicionadas. Na inferência, um amostrador (como DDIM ou Euler) executa um número escolhido de etapas de eliminação de ruído; mais etapas geralmente significam resultados mais limpos em detrimento da velocidade.
Impacto Estratégico
Velocidade e escala
A IA visual pode automatizar tarefas de inspeção, detecção e marcação em grande escala.
Escolhas de construção
As equipes criativas podem criar protótipos de conceitos mais rapidamente e com menos revisões manuais.
Equipe e fluxo de trabalho
As operações podem usar sinais de imagem e vídeo que antes eram difíceis de processar.
O futuro da difusão estável
O ecossistema aberto continua acelerando: arquiteturas mais recentes (incluindo difusão baseada em transformadores e amostradores destilados ou de poucas etapas mais rápidos) reduzem a geração de dezenas de etapas para uma ou duas, permitindo a criação quase em tempo real. Espere uma renderização de texto mais forte, melhor adesão imediata e edição de imagem perfeita, além de extensões de vídeo e 3D. Os pesos abertos continuarão alimentando ajustes finos especializados, mas também intensificarão os debates sobre consentimento de dados de treinamento, deepfakes e marcas d'água, de modo que as ferramentas de detecção e proveniência crescerão junto com os modelos.
Implementação no mundo real
Artistas e amadores gerando arte conceitual e ilustrações localmente em sua própria GPU com ajustes LoRA personalizados
Usando ControlNet para restringir uma geração com um esqueleto de pose, mapa de profundidade ou esboço de aresta para uma composição precisa
Pintura interna e externa para editar fotos, remover objetos ou estender uma cena além de suas bordas originais
Estúdios e designers de jogos independentes que produzem texturas, painéis de humor e variações de ativos de forma rápida e barata
Riscos e guarda-corpos
Os direitos de imagem e o consentimento podem tornar-se riscos legais se a proveniência não for clara.
O desempenho do modelo pode variar dependendo da iluminação, dados demográficos e ambientes.
Os falsos positivos podem passar despercebidos, a menos que os limites de confiança sejam monitorados.
Roteiro de implementação
Defina critérios de aceitação para precisão, recall e custos de erro.
Teste com dados que correspondam às condições reais de produção.
Adicione revisão humana para previsões de baixa confiança ou de alto impacto.
Rastreie o desvio do modelo e revalide após alterações na câmera ou no conjunto de dados.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Stable Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Difusão de vídeo estável
Perguntas frequentes
What is Stable Diffusion?
Stable Diffusion é um modelo de texto para imagem de código aberto, lançado pela Stability AI em 2022, que gera imagens removendo gradualmente o ruído de um ponto inicial aleatório. Sendo aberto e executável em GPUs de consumo, gerou uma enorme comunidade de ferramentas, ajustes e aplicativos.
Em alto nível, como um modelo de difusão gera uma imagem?
Os modelos de difusão aprendem a reverter um processo de ruído: a partir do ruído, eles eliminam o ruído iterativamente até que surja uma imagem coerente.
O que torna o Stable Diffusion eficiente o suficiente para ser executado em uma GPU de consumidor?
A difusão estável é um modelo de difusão latente: um autoencoder comprime imagens para que a remoção pesada de ruído seja executada em um espaço latente menor.
Como o seu prompt de texto influencia a imagem gerada?
Um codificador de texto converte o prompt em incorporações que condicionam a U-Net por meio de atenção cruzada, orientando o resultado.
O que a orientação sem classificador permite que você controle?
A orientação sem classificador combina previsões condicionadas e não condicionadas, permitindo aumentar ou diminuir a adesão imediata.
Por que o Stable Diffusion gerou um ecossistema tão grande de ferramentas como ControlNet e LoRA?
Os pesos abertos permitem que a comunidade ajuste e estenda o modelo, produzindo complementos como ControlNet e adaptadores LoRA leves.