視覺人工智慧指南

萬壽菊擴散深度估計

Marigold 重新利用預先訓練的影像產生擴散模型(穩定擴散)來預測高度詳細的深度圖。

閱讀時間約2分鐘最後更新

概述

它展示了你可以用出乎意料地少的訓練資料,將生成器豐富的視覺知識轉化為精確的感知工具。

深入探討

Marigold(蘇黎世聯邦理工學院,CVPR 2024 最佳論文榮譽獎)將深度估計重新定義為條件生成問題。它不是從頭開始訓練深度網絡,而是微調穩定擴散以“生成”以輸入圖像為條件的深度圖。我們的見解是,經過訓練來合成真實感影像的模型已經在其潛在空間深處學習了場景幾何、光照和結構,這正是對深度有用的先驗知識。值得注意的是,Marigold 僅在合成資料集(如 Hypersim 和 Virtual KITTI)上進行了微調,但可以很好地推廣到零拍攝的真實照片。它產生具有極其精細細節的仿射不變相對深度,儘管迭代去噪使其比 DepthAnything 等前饋模型慢。

技術洞察

萬壽菊在穩定擴散的潛在空間中運作。影像和深度圖都由同一個VAE編碼; U-Net 經過微調,可以根據乾淨的潛在影像對潛在深度進行去雜訊。在推理時,它運行標準迭代去噪循環,然後解碼潛在深度。因為它是採樣的,所以可以整合多個運行來提高穩定性,用計算來換取準確性。後來的“LCM”和一步蒸餾版本將數十個步驟縮減為一次。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

萬壽菊擴散深度估計的未來

萬壽菊配方,微調擴散先驗以進行密集預測,正在超越深度推廣到表面法線、內在圖像分解和材料估計。更快的蒸餾和一致性模型變體正在縮小與前饋網路的速度差距,使得基於擴散的感知在互動工具中可行。預計會有更廣泛的趨勢,即一個預先訓練的生成主幹適用於許多幾何和感知任務,從而減少對大型特定任務標記資料集的需求。

現實世界的實施

從建築和產品照片中提取細粒度的深度,用於重新照明和 3D 模型。

產生高細節深度圖,用作可控影像和視訊生成的條件。

幫助電影和視覺特效團隊進行邊緣精準度至關重要的霧面和視差工作。

作為研究基線,展示如何使產生先驗適應密集的預測任務。

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Marigold Diffusion Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

單目深度估計

常見問題

什麼是萬壽菊擴散深度估計?

Marigold 重新利用預先訓練的影像產生擴散模型(穩定擴散)來預測高度詳細的深度圖。它表明您可以將生成器豐富的視覺知識轉變為精確的感知工具,而訓練資料卻少得驚人。

Marigold 建立在什麼預訓練模型之上?

Marigold 微調穩定擴散潛在擴散模型以產生深度圖。

Marigold 如何建立深度估計任務?

它將深度視為根據輸入圖像“生成”的東西,重用擴散機制。

Marigold 的訓練資料有什麼令人驚訝的地方?

Marigold 在 Hypersim 和 Virtual KITTI 等合成數據上進行了微調,但將零鏡頭推廣到真實照片。

為什麼 Marigold 通常比前饋深度模型慢?

擴散模型會透過多個步驟進行降噪,使推理速度比單一前向傳播慢。

萬壽菊在什麼空間進行擴散過程?

影像和深度都被編碼到 U-Net 去噪的 VAE 潛在空間。