Estimación de la profundidad de difusión de la caléndula
Marigold reutiliza un modelo de difusión de generación de imágenes previamente entrenado (difusión estable) para predecir mapas de profundidad muy detallados.
Descripción general
It shows you can turn a generator's rich visual knowledge into a precise perception tool with surprisingly little training data.
Buceo profundo
Marigold (ETH Zurich, CVPR 2024 Best Paper Honorable Mention) reformula la estimación de profundidad como un problema de generación condicional. En lugar de entrenar una red de profundidad desde cero, ajusta Stable Diffusion para "generar" un mapa de profundidad condicionado a una imagen de entrada. La idea es que un modelo entrenado para sintetizar imágenes fotorrealistas ya ha aprendido la geometría de la escena, la iluminación y la estructura en lo profundo de su espacio latente, exactamente los aspectos previos útiles para la profundidad. Sorprendentemente, Marigold se ajustó solo en conjuntos de datos sintéticos (como Hypersim y Virtual KITTI), pero se generaliza bien a fotos reales sin tomas. Produce una profundidad relativa invariante afín con detalles excepcionalmente finos, aunque la eliminación iterativa de ruido lo hace más lento que los modelos de alimentación directa como DepthAnything.
Información técnica
Marigold opera en el espacio latente de Stable Diffusion. Tanto la imagen como el mapa de profundidad están codificados por el mismo VAE; U-Net está ajustado para eliminar el ruido de una profundidad latente condicionada a la imagen limpia latente. En la inferencia, ejecuta el bucle iterativo estándar de eliminación de ruido y luego decodifica la profundidad latente. Debido a que toma muestras, se pueden agrupar múltiples ejecuciones para lograr estabilidad, intercambiando cálculo por precisión. Más tarde, las versiones 'LCM' y destiladas de un solo paso redujeron las docenas de pasos a una sola pasada.
Impacto Estratégico
Speed and scale
La IA visual puede automatizar tareas de inspección, detección y etiquetado a escala.
Construir opciones
Los equipos creativos pueden crear prototipos de conceptos más rápido y con menos revisiones manuales.
Equipo y flujo de trabajo
Las operaciones pueden utilizar señales de imagen y vídeo que antes eran difíciles de procesar.
El futuro de la estimación de la profundidad de difusión de la caléndula
La receta Marigold, que afina los antecedentes de difusión para una predicción densa, se está generalizando más allá de la profundidad hasta las normales de superficie, la descomposición intrínseca de imágenes y la estimación de materiales. Variantes de modelos de consistencia y destilados más rápidos están cerrando la brecha de velocidad con las redes de retroalimentación, haciendo viable la percepción basada en difusión en herramientas interactivas. Espere una tendencia más amplia en la que una columna vertebral generativa previamente entrenada se adapte a muchas tareas de geometría y percepción, lo que reduce la necesidad de grandes conjuntos de datos etiquetados para tareas específicas.
Implementación en el mundo real
Extracción de profundidad detallada de fotografías arquitectónicas y de productos para reiluminación y maquetas 3D.
Generación de mapas de profundidad de alto detalle utilizados como acondicionamiento para la generación de imágenes y videos controlables.
Ayudar a los equipos de cine y VFX en trabajos de mate y paralaje donde la precisión de los bordes es importante.
Sirve como base de investigación para mostrar cómo adaptar los antecedentes generativos a tareas de predicción densas.
Riesgos y barandillas
Los derechos de imagen y el consentimiento pueden convertirse en riesgos legales si la procedencia no está clara.
El rendimiento del modelo puede variar según la iluminación, la demografía y los entornos.
Los falsos positivos pueden pasar desapercibidos a menos que se controlen los umbrales de confianza.
Hoja de ruta de implementación
Defina criterios de aceptación para costos de precisión, recuperación y error.
Pruebe con datos que coincidan con las condiciones reales de producción.
Agregue revisión humana para predicciones de baja confianza o de alto impacto.
Realice un seguimiento de la deriva del modelo y vuelva a validarlo después de cambios en la cámara o el conjunto de datos.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Marigold Diffusion Depth Estimation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Estimación de profundidad monocular
Preguntas frecuentes
What is Marigold Diffusion Depth Estimation?
Marigold reutiliza un modelo de difusión de generación de imágenes previamente entrenado (difusión estable) para predecir mapas de profundidad muy detallados. Muestra que se puede convertir el rico conocimiento visual de un generador en una herramienta de percepción precisa con sorprendentemente pocos datos de entrenamiento.
¿En qué modelo previamente entrenado se basa Marigold?
Marigold afina el modelo de difusión latente de Difusión Estable para producir mapas de profundidad.
¿Cómo encuadra Marigold la tarea de estimación de profundidad?
Trata la profundidad como algo que debe "generarse" condicionado a la imagen de entrada, reutilizando la maquinaria de difusión.
¿Qué fue lo sorprendente de los datos de entrenamiento de Marigold?
Marigold se ajustó a datos sintéticos como Hypersim y Virtual KITTI, pero generaliza el disparo cero a fotografías reales.
¿Por qué Marigold suele ser más lento que los modelos de profundidad de retroalimentación?
Los modelos de difusión eliminan el ruido en varios pasos, lo que hace que la inferencia sea más lenta que un solo paso hacia adelante.
¿En qué espacio realiza Marigold su proceso de difusión?
Tanto la imagen como la profundidad están codificadas en el espacio latente VAE donde U-Net elimina el ruido.