GUIA visual de IA

Estimativa de profundidade de difusão de calêndula

Marigold reaproveita um modelo de difusão de geração de imagem pré-treinado (Stable Diffusion) para prever mapas de profundidade altamente detalhados.

2 minutos de leituraÚltima atualização

Visão geral

It shows you can turn a generator's rich visual knowledge into a precise perception tool with surprisingly little training data.

Mergulho profundo

Marigold (ETH Zurich, Menção Honrosa de Melhor Artigo CVPR 2024) reformula a estimativa de profundidade como um problema de geração condicional. Em vez de treinar uma rede de profundidade do zero, ele ajusta a Difusão Estável para 'gerar' um mapa de profundidade condicionado a uma imagem de entrada. A conclusão é que um modelo treinado para sintetizar imagens fotorrealistas já aprendeu geometria, iluminação e estrutura da cena nas profundezas de seu espaço latente, exatamente os anteriores úteis para profundidade. Notavelmente, Marigold foi ajustado apenas em conjuntos de dados sintéticos (como Hypersim e Virtual KITTI), mas generaliza bem para fotos reais de disparo zero. Ele produz profundidade relativa invariante afim com detalhes excepcionalmente finos, embora a eliminação de ruído iterativa o torne mais lento do que modelos de feed-forward como DepthAnything.

Visão Técnica

Marigold opera no espaço latente da Difusão Estável. Tanto a imagem quanto o mapa de profundidade são codificados pelo mesmo VAE; o U-Net é ajustado para eliminar o ruído de uma profundidade latente condicionada à imagem latente limpa. Na inferência, ele executa o loop de eliminação de ruído iterativo padrão e, em seguida, decodifica a profundidade latente. Como ele faz amostras, várias execuções podem ser agrupadas para estabilidade, trocando a computação por precisão. Mais tarde, o 'LCM' e as versões destiladas de uma etapa reduzem as dezenas de etapas para uma única passagem.

Impacto Estratégico

Velocidade e escala

A IA visual pode automatizar tarefas de inspeção, detecção e marcação em grande escala.

Escolhas de construção

As equipes criativas podem criar protótipos de conceitos mais rapidamente e com menos revisões manuais.

Equipe e fluxo de trabalho

As operações podem usar sinais de imagem e vídeo que antes eram difíceis de processar.

O futuro da estimativa da profundidade de difusão do calêndula

A receita do Marigold, ajustando os anteriores de difusão para uma previsão densa, está generalizando além da profundidade para normais de superfície, decomposição intrínseca de imagem e estimativa de material. Variantes mais rápidas destiladas e de modelo de consistência estão fechando a lacuna de velocidade com redes feed-forward, tornando viável a percepção baseada em difusão em ferramentas interativas. Espere uma tendência mais ampla onde um backbone generativo pré-treinado seja adaptado a muitas tarefas de geometria e percepção, reduzindo a necessidade de grandes conjuntos de dados rotulados para tarefas específicas.

Implementação no mundo real

Extração de profundidade refinada de fotos arquitetônicas e de produtos para reiluminação e maquetes 3D.

Geração de mapas de profundidade de alto detalhe usados ​​como condicionamento para geração controlável de imagens e vídeos.

Auxiliando equipes de filmes e efeitos visuais em trabalhos de fosco e paralaxe onde a precisão das bordas é importante.

Servindo como base de pesquisa mostrando como adaptar antecedentes generativos para tarefas densas de previsão.

Riscos e guarda-corpos

Os direitos de imagem e o consentimento podem tornar-se riscos legais se a proveniência não for clara.

O desempenho do modelo pode variar dependendo da iluminação, dados demográficos e ambientes.

Os falsos positivos podem passar despercebidos, a menos que os limites de confiança sejam monitorados.

Roteiro de implementação

1

Defina critérios de aceitação para precisão, recall e custos de erro.

2

Teste com dados que correspondam às condições reais de produção.

3

Adicione revisão humana para previsões de baixa confiança ou de alto impacto.

4

Rastreie o desvio do modelo e revalide após alterações na câmera ou no conjunto de dados.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Marigold Diffusion Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Estimativa de profundidade monocular

Perguntas frequentes

What is Marigold Diffusion Depth Estimation?

Marigold reaproveita um modelo de difusão de geração de imagem pré-treinado (Stable Diffusion) para prever mapas de profundidade altamente detalhados. Ele mostra que você pode transformar o rico conhecimento visual de um gerador em uma ferramenta de percepção precisa com surpreendentemente poucos dados de treinamento.

Em qual modelo pré-treinado o Marigold se baseia?

Marigold ajusta o modelo de difusão latente de difusão estável para produzir mapas de profundidade.

Como Marigold enquadra a tarefa de estimativa de profundidade?

Trata a profundidade como algo a ser “gerado” condicionado à imagem de entrada, reutilizando maquinaria de difusão.

O que foi surpreendente nos dados de treinamento de Marigold?

Marigold foi ajustado em dados sintéticos como Hypersim e Virtual KITTI, mas generaliza o tiro zero para fotos reais.

Por que o Marigold é normalmente mais lento que os modelos de profundidade feed-forward?

Os modelos de difusão eliminam o ruído em várias etapas, tornando a inferência mais lenta do que uma única passagem direta.

Em que espaço o Marigold realiza seu processo de difusão?

Tanto a imagem quanto a profundidade são codificadas no espaço latente VAE onde o U-Net elimina ruído.