GUIA visual de IA

Transformadores de Difusão

Os Transformadores de Difusão (DiTs) trocam a U-Net convolucional no centro dos geradores de imagem e vídeo por um backbone de Transformador.

2 minutos de leituraÚltima atualização

Visão geral

This architecture powers leading systems like Stable Diffusion 3 and OpenAI's Sora, and it scales remarkably well as you add compute.

Mergulho profundo

Os modelos de difusão geram imagens começando com ruído puro e eliminando-o iterativamente em uma imagem coerente. Durante anos, a rede que fazia essa eliminação de ruído era uma U-Net, uma arquitetura convolucional. O Diffusion Transformer, introduzido por Peebles e Xie em 2022, substitui o U-Net por um Transformer. A imagem é primeiro comprimida num espaço latente, dividida em pequenas manchas, e cada mancha torna-se um símbolo, tal como as palavras num modelo de linguagem. O Transformer então processa esses tokens com atenção própria em cada etapa de remoção de ruído. Uma descoberta importante foi que o desempenho do DiT melhora de forma previsível à medida que você aumenta o tamanho do modelo e reduz o tamanho do patch, seguindo leis de escala limpa. Essa escalabilidade é a razão pela qual os sistemas de texto para vídeo e de texto para imagem de última geração migraram em grande parte para os backbones do Transformer.

Visão Técnica

Uma inovação central é como os DiTs injetam condicionamento, como timestep e prompt de texto. Em vez de simples concatenação, eles usam normalização de camada adaptativa (adaLN), onde a rede prevê parâmetros de escala e mudança para camadas de normalização a partir do sinal de condicionamento. A variante adaLN-zero os inicializa para que cada bloco comece como uma função de identidade, estabilizando o treinamento. Os patches são achatados em tokens, processados ​​​​por blocos Transformer padrão com atenção própria e, em seguida, remontados e decodificados novamente em pixels.

Impacto Estratégico

Velocidade e escala

A IA visual pode automatizar tarefas de inspeção, detecção e marcação em grande escala.

Escolhas de construção

As equipes criativas podem criar protótipos de conceitos mais rapidamente e com menos revisões manuais.

Equipe e fluxo de trabalho

As operações podem usar sinais de imagem e vídeo que antes eram difíceis de processar.

O futuro dos transformadores de difusão

Os transformadores de difusão estão se tornando a espinha dorsal padrão para mídia generativa. Seu design baseado em token os torna naturais para unificar imagens, vídeos e até mesmo geração multimodal em uma arquitetura escalonável. A pesquisa está buscando vídeos mais longos, maior resolução e atenção mais eficiente para controlar o custo quadrático de muitos tokens. Espere uma convergência entre modelos de linguagem e visão, onde receitas e infraestruturas de escalabilidade semelhantes do Transformer sirvam a ambos, acelerando o progresso em modelos mundiais e vídeos interativos.

Implementação no mundo real

O Sora de OpenAI usa um backbone Transformer sobre patches de espaço-tempo para gerar vídeos de alta fidelidade com duração de um minuto a partir de prompts de texto.

O Stable Diffusion 3 adota um transformador de difusão multimodal (MMDiT) para alinhar melhor as imagens geradas com descrições de texto detalhadas.

Os pesquisadores dimensionam um DiT para bilhões de parâmetros e observam a qualidade da imagem melhorando de forma previsível, orientando as decisões de orçamento computacional.

Um estúdio usa um modelo baseado em DiT para estender clipes curtos, tratando quadros de vídeo extras como tokens de patch adicionais para eliminar ruído.

Riscos e guarda-corpos

Os direitos de imagem e o consentimento podem tornar-se riscos legais se a proveniência não for clara.

O desempenho do modelo pode variar dependendo da iluminação, dados demográficos e ambientes.

Os falsos positivos podem passar despercebidos, a menos que os limites de confiança sejam monitorados.

Roteiro de implementação

1

Defina critérios de aceitação para precisão, recall e custos de erro.

2

Teste com dados que correspondam às condições reais de produção.

3

Adicione revisão humana para previsões de baixa confiança ou de alto impacto.

4

Rastreie o desvio do modelo e revalide após alterações na câmera ou no conjunto de dados.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Redes de Transformadores Espaciais

Perguntas frequentes

What is Diffusion Transformers?

Os Transformadores de Difusão (DiTs) trocam a U-Net convolucional no centro dos geradores de imagem e vídeo por um backbone de Transformador. Essa arquitetura alimenta sistemas líderes como Stable Diffusion 3 e OpenAI's Sora, e é escalonável notavelmente bem à medida que você adiciona computação.

Qual componente um Transformador de Difusão substitui em comparação com os modelos de difusão tradicionais?

Os DiTs substituem a U-Net, a rede convolucional que realizava a remoção de ruído, por um backbone Transformer.

Como um DiT transforma uma imagem em algo que um Transformer pode processar?

A imagem latente é dividida em pequenas manchas, e cada mancha se torna um token, análogo às palavras de um modelo de linguagem.

O que o artigo original do DiT descobriu sobre o dimensionamento?

A qualidade do DiT melhora de maneira limpa e previsível à medida que você aumenta a computação do modelo e usa patches menores, seguindo as leis de dimensionamento.

Como os DiTs normalmente injetam condicionamento como timestep e prompt de texto?

DiTs usam normalização de camada adaptativa para prever parâmetros de escala e deslocamento para camadas de normalização a partir do sinal de condicionamento.

O que a inicialização 'adaLN-zero' realiza?

O adaLN-zero inicializa a modulação para que cada bloco atue inicialmente como identidade, o que estabiliza e melhora o treinamento.