DreamFusion 和分數蒸餾採樣
DreamFusion 使用 2D 影像擴散模型作為批評者,從文字產生 3D 對象,從不訓練任何 3D 資料。
概述
Its core invention, Score Distillation Sampling, became the foundational recipe for the entire text-to-3D field.
深入探討
來自 2022 年 Google 的 DreamFusion 問:2D 文本到圖像模型能否教導 3D 場景從各個角度看都是正確的?它優化了 NeRF(神經輻射場),以便來自隨機攝影機視點的渲染在加噪並顯示到凍結擴散模型 (Imagen) 時,可以為文字提示評分為合理的影像。至關重要的是,它不使用 3D 訓練資料。突破在於分數蒸餾取樣(SDS):SDS 不會透過擴散模型昂貴的 U-Net 進行反向傳播,而是使用模型的預測雜訊作為直接在渲染像素上的梯度訊號。透過數千個視點進行迭代,可以透過單一句子雕刻出連貫的 3D 資產,包括幾何圖形和依賴視圖的外觀。
技術洞察
SDS 將擴散模型視為凍結的評分函數。它渲染 NeRF,添加噪聲,要求擴散 U-Net 預測該噪聲,併計算推回到渲染圖像上的梯度(預測噪聲減去添加的噪聲),從而計算 NeRF 權重。跳過 U-Net 雅可比行列式使其易於處理。需要高的無分類器指導(大約 100)才能獲得清晰的結果,這會導致特徵過度飽和,有時模糊的「DreamFusion 外觀」。
戰略影響
速度與規模
視覺人工智慧可以大規模自動化檢查、檢測和標記任務。
配裝選擇
創意團隊可以透過更少的手動修改來更快地建立概念原型。
團隊與工作流程
操作可以使用以前難以處理的影像和視訊訊號。
DreamFusion 和分數蒸餾採樣的未來
SDS 催生了一系列豐富的工作來解決其弱點:Magic3D 提供分辨率和速度,ProlificDreamer 的變分蒸餾提供更清晰、更多樣化的輸出,以及攻擊「Janus」多面工件的方法。該領域越來越多地將 SDS 與多視圖擴散先驗和快速 3D 表示(例如高斯濺射)結合。預計文字轉 3D 會發展得更快、幾何形狀更忠實,從而縮小與手工建模資產的差距。
現實世界的實施
僅根據文字產生「戴著小帽子的松鼠的 DSLR 照片」的 3D 模型
創建草稿遊戲和 AR 資源,無需手動 3D 雕刻
產生可供藝術家改進的可匯出網格,而不是從頭開始構建
根據 SDS 評估較新的文本轉 3D 方法的研究基線
風險與防護欄
如果出處不明,肖像權和同意可能會成為法律風險。
模型表現可能因光照、人口統計和環境的不同而有所不同。
除非監控置信閾值,否則誤報可能會被忽略。
實施路線圖
定義精確度、召回率和錯誤成本的接受標準。
使用符合實際生產條件的數據進行測試。
為低置信度或高影響力的預測添加人工審核。
追蹤模型漂移並在相機或資料集變更後重新驗證。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DreamFusion and Score Distillation Sampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is DreamFusion and Score Distillation Sampling?
DreamFusion 使用 2D 影像擴散模型作為批評者,從文字產生 3D 對象,從不訓練任何 3D 資料。其核心發明「分數蒸餾採樣」成為整個文本轉 3D 領域的基礎配方。
DreamFusion 優化了哪些 3D 表示?
DreamFusion 優化了 NeRF,使其渲染視圖滿足 2D 擴散模型對文字提示的判斷。
DreamFusion 需要多少 3D 訓練資料?
DreamFusion 使用凍結的 2D 文字到影像擴散模型作為唯一的監督,不需要 3D 訓練資料。
分數蒸餾採樣中的關鍵計算捷徑是什麼?
SDS 使用預測減去添加的雜訊作為渲染像素上的直接梯度,避免了昂貴的 U-Net 雅可比行列式。
為什麼 DreamFusion 使用非常高的無分類器指導(~100)?
SDS 梯度雜訊較大且較弱,因此需要異常高的指導才能獲得清晰、即時的幾何形狀,儘管它會導致過飽和。
最初的 DreamFusion 使用哪個 2D 模型作為其凍結先驗?
DreamFusion 建立在 Google 的 Imagen 文字到影像擴散模型上,作為凍結評分函數。