GUÍA visual de IA

Estimación de la profundidad de difusión de la caléndula

Marigold reutiliza un modelo de difusión de generación de imágenes previamente entrenado (difusión estable) para predecir mapas de profundidad muy detallados.

2 minutos de lecturaÚltima actualización

Descripción general

It shows you can turn a generator's rich visual knowledge into a precise perception tool with surprisingly little training data.

Buceo profundo

Marigold (ETH Zurich, CVPR 2024 Best Paper Honorable Mention) reformula la estimación de profundidad como un problema de generación condicional. En lugar de entrenar una red de profundidad desde cero, ajusta Stable Diffusion para "generar" un mapa de profundidad condicionado a una imagen de entrada. La idea es que un modelo entrenado para sintetizar imágenes fotorrealistas ya ha aprendido la geometría de la escena, la iluminación y la estructura en lo profundo de su espacio latente, exactamente los aspectos previos útiles para la profundidad. Sorprendentemente, Marigold se ajustó solo en conjuntos de datos sintéticos (como Hypersim y Virtual KITTI), pero se generaliza bien a fotos reales sin tomas. Produce una profundidad relativa invariante afín con detalles excepcionalmente finos, aunque la eliminación iterativa de ruido lo hace más lento que los modelos de alimentación directa como DepthAnything.

Información técnica

Marigold opera en el espacio latente de Stable Diffusion. Tanto la imagen como el mapa de profundidad están codificados por el mismo VAE; U-Net está ajustado para eliminar el ruido de una profundidad latente condicionada a la imagen limpia latente. En la inferencia, ejecuta el bucle iterativo estándar de eliminación de ruido y luego decodifica la profundidad latente. Debido a que toma muestras, se pueden agrupar múltiples ejecuciones para lograr estabilidad, intercambiando cálculo por precisión. Más tarde, las versiones 'LCM' y destiladas de un solo paso redujeron las docenas de pasos a una sola pasada.

Impacto Estratégico

Speed and scale

La IA visual puede automatizar tareas de inspección, detección y etiquetado a escala.

Construir opciones

Los equipos creativos pueden crear prototipos de conceptos más rápido y con menos revisiones manuales.

Equipo y flujo de trabajo

Las operaciones pueden utilizar señales de imagen y vídeo que antes eran difíciles de procesar.

El futuro de la estimación de la profundidad de difusión de la caléndula

La receta Marigold, que afina los antecedentes de difusión para una predicción densa, se está generalizando más allá de la profundidad hasta las normales de superficie, la descomposición intrínseca de imágenes y la estimación de materiales. Variantes de modelos de consistencia y destilados más rápidos están cerrando la brecha de velocidad con las redes de retroalimentación, haciendo viable la percepción basada en difusión en herramientas interactivas. Espere una tendencia más amplia en la que una columna vertebral generativa previamente entrenada se adapte a muchas tareas de geometría y percepción, lo que reduce la necesidad de grandes conjuntos de datos etiquetados para tareas específicas.

Implementación en el mundo real

Extracción de profundidad detallada de fotografías arquitectónicas y de productos para reiluminación y maquetas 3D.

Generación de mapas de profundidad de alto detalle utilizados como acondicionamiento para la generación de imágenes y videos controlables.

Ayudar a los equipos de cine y VFX en trabajos de mate y paralaje donde la precisión de los bordes es importante.

Sirve como base de investigación para mostrar cómo adaptar los antecedentes generativos a tareas de predicción densas.

Riesgos y barandillas

Los derechos de imagen y el consentimiento pueden convertirse en riesgos legales si la procedencia no está clara.

El rendimiento del modelo puede variar según la iluminación, la demografía y los entornos.

Los falsos positivos pueden pasar desapercibidos a menos que se controlen los umbrales de confianza.

Hoja de ruta de implementación

1

Defina criterios de aceptación para costos de precisión, recuperación y error.

2

Pruebe con datos que coincidan con las condiciones reales de producción.

3

Agregue revisión humana para predicciones de baja confianza o de alto impacto.

4

Realice un seguimiento de la deriva del modelo y vuelva a validarlo después de cambios en la cámara o el conjunto de datos.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Marigold Diffusion Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Estimación de profundidad monocular

Preguntas frecuentes

What is Marigold Diffusion Depth Estimation?

Marigold reutiliza un modelo de difusión de generación de imágenes previamente entrenado (difusión estable) para predecir mapas de profundidad muy detallados. Muestra que se puede convertir el rico conocimiento visual de un generador en una herramienta de percepción precisa con sorprendentemente pocos datos de entrenamiento.

¿En qué modelo previamente entrenado se basa Marigold?

Marigold afina el modelo de difusión latente de Difusión Estable para producir mapas de profundidad.

¿Cómo encuadra Marigold la tarea de estimación de profundidad?

Trata la profundidad como algo que debe "generarse" condicionado a la imagen de entrada, reutilizando la maquinaria de difusión.

¿Qué fue lo sorprendente de los datos de entrenamiento de Marigold?

Marigold se ajustó a datos sintéticos como Hypersim y Virtual KITTI, pero generaliza el disparo cero a fotografías reales.

¿Por qué Marigold suele ser más lento que los modelos de profundidad de retroalimentación?

Los modelos de difusión eliminan el ruido en varios pasos, lo que hace que la inferencia sea más lenta que un solo paso hacia adelante.

¿En qué espacio realiza Marigold su proceso de difusión?

Tanto la imagen como la profundidad están codificadas en el espacio latente VAE donde U-Net elimina el ruido.