視覺人工智慧指南

零一到三新奇觀擴散

零一到三使用以您要求的相機旋轉為條件的擴散模型,將一個物體的單張照片轉換為從任何新角度看到的同一物體的圖像。

閱讀時間約2分鐘最後更新

概述

It matters because it lets you reconstruct 3D-consistent views without ever scanning the object from multiple sides.

深入探討

Zero-1-to-3(來自哥倫比亞,2023)對穩定擴散進行了微調,因此它可以從一張輸入影像執行零樣本新穎的視圖合成。你向它提供一張圖片加上相對相機變換(旋轉和小的平移),模型就會產生從新視點看物件的樣子。關鍵想法是,在巨大的網路影像集合上訓練的大型 2D 擴散模型已經隱含地吸收了有關物體在 3D 中的外觀的幾何和物理先驗。透過對從多個受控攝影機角度(使用 Objaverse)渲染的物件的合成資料集進行微調,模型學會將這些先驗映射到明確攝影機控制。然後產生的視圖可以提供給下游 3D 重建。

技術洞察

來源影像上的模型條件有兩種方式:CLIP 嵌入與相對相機姿態(方位角、仰角、半徑)連接以引導交叉注意力,而原始影像與雜訊潛在影像通道連接,因此保留了精細的細節和身份。訓練使用從 CAD 物件渲染的圖像-姿態-圖像三元組,因此網路可以學習視點變化和由此產生的像素變化之間的可控映射。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

零一到三小說觀擴散的未來

從零到 3 催生了影像到 3D 管道的浪潮。 Zero123-XL、SyncDreamer 和 One-2-3-45 等後繼產品致力於實現多視圖一致性和更快、更可靠的 3D 網格輸出,同時與高斯潑濺和大型重建模型的整合將生成時間從幾分鐘縮短到幾秒。隨著這些視點可控的擴散模型成熟為內容創建的標準工具,預計會出現更嚴格的視圖一致性、更高解析度和現實世界(不僅僅是合成物件)泛化。

現實世界的實施

產生單一產品照片的轉盤視圖,以便電子商務清單可以從各個方面顯示該商品

從一張隨意的手機快照中引導物件的紋理 3D 網格以進行 AR 預覽

為遊戲和電影概念藝術家創造一致的多角度角色或道具參考藝術

將合成的新穎視圖輸入 NeRF 或高斯潑濺重建中以填滿看不見的幾何形狀

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Zero-1-to-3 Novel View Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

新穎的視圖合成

常見問題

What is Zero-1-to-3 Novel View Diffusion?

零一到三使用以您要求的相機旋轉為條件的擴散模型,將一個物體的單張照片轉換為從任何新角度看到的同一物體的圖像。這很重要,因為它可以讓您重建 3D 一致的視圖,而無需從多個側面掃描物件。

除了單張影像之外,零一到三還需要什麼核心輸入才能產生新視圖?

0-1-to-3 以單一影像加上相對相機姿勢為條件,因此您可以指定所需視點的旋轉和平移。

零一到三是透過微調哪一種模型來建構的?

它對大型預訓練二維擴散模型進行微調,以便可以利用這些模型從網路影像中隱式學習的幾何先驗。

為什麼 2D 擴散模型能夠執行零樣本新穎視圖合成?

大規模 2D 訓練傳授有關物件如何在 3D 中顯示的隱式知識,透過微調可以透過相機姿勢進行控制。

哪些 3D 物件資料集對於零一到三的訓練至關重要?

它接受了從 Objaverse 等大型合成 3D 物件集合中渲染的圖像-姿勢-圖像三元組的訓練。

來源影像的精細細節如何在生成過程中保留?

原始影像與雜訊潛在影像進行通道級聯(以及用於語義的 CLIP 嵌入),因此身分和細節得以延續。