视觉人工智能指南

万寿菊扩散深度估计

Marigold 重新利用预训练的图像生成扩散模型(稳定扩散)来预测高度详细的深度图。

阅读时间:2分钟最后更新

概述

它表明您可以将生成器丰富的视觉知识转变为精确的感知工具,而训练数据却少得惊人。

深入探讨

Marigold(苏黎世联邦理工学院,CVPR 2024 最佳论文荣誉奖)将深度估计重新定义为条件生成问题。它不是从头开始训练深度网络,而是微调稳定扩散以“生成”以输入图像为条件的深度图。我们的见解是,经过训练来合成真实感图像的模型已经在其潜在空间深处学习了场景几何、光照和结构,这正是对深度有用的先验知识。值得注意的是,Marigold 仅在合成数据集(如 Hypersim 和 Virtual KITTI)上进行了微调,但可以很好地推广到零拍摄的真实照片。它产生具有极其精细细节的仿射不变相对深度,尽管迭代去噪使其比 DepthAnything 等前馈模型慢。

技术洞察

万寿菊在稳定扩散的潜在空间中运作。图像和深度图都由同一个VAE编码; U-Net 经过微调,可以根据干净的潜在图像对潜在深度进行去噪。在推理时,它运行标准迭代去噪循环,然后解码潜在深度。因为它是采样的,所以可以集成多个运行来提高稳定性,用计算来换取准确性。后来的“LCM”和一步蒸馏版本将数十个步骤缩减为一次。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

万寿菊扩散深度估计的未来

万寿菊配方,微调扩散先验以进行密集预测,正在超越深度推广到表面法线、内在图像分解和材料估计。更快的蒸馏和一致性模型变体正在缩小与前馈网络的速度差距,使得基于扩散的感知在交互工具中可行。预计会有一种更广泛的趋势,即一个预训练的生成主干适用于许多几何和感知任务,从而减少对大型特定任务标记数据集的需求。

现实世界的实施

从建筑和产品照片中提取细粒度的深度,用于重新照明和 3D 模型。

生成高细节深度图,用作可控图像和视频生成的条件。

帮助电影和视觉特效团队进行边缘精度至关重要的哑光和视差工作。

作为研究基线,展示如何使生成先验适应密集的预测任务。

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Marigold Diffusion Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

单目深度估计

常见问题

什么是 Marigold 扩散深度估计?

Marigold 重新利用预训练的图像生成扩散模型(稳定扩散)来预测高度详细的深度图。它表明您可以将生成器丰富的视觉知识转变为精确的感知工具,而训练数据却少得惊人。

Marigold 建立在什么预训练模型之上?

Marigold 微调稳定扩散潜在扩散模型以生成深度图。

Marigold 如何构建深度估计任务?

它将深度视为根据输入图像“生成”的东西,重用扩散机制。

Marigold 的训练数据有什么令人惊讶的地方?

Marigold 在 Hypersim 和 Virtual KITTI 等合成数据上进行了微调,但将零镜头推广到真实照片。

为什么 Marigold 通常比前馈深度模型慢?

扩散模型会通过多个步骤进行降噪,从而使推理速度比单个前向传播慢。

万寿菊在什么空间进行扩散过程?

图像和深度都被编码到 U-Net 去噪的 VAE 潜在空间中。