視覺人工智慧指南

Plenoxels 和體素輻射場

Plenoxels 表明,您可以重建具有 NeRF 品質結果的 3D 場景,而無需任何神經網路——只需儲存顏色和密度的體素網格。

閱讀時間約2分鐘最後更新

概述

The result trains roughly 100x faster than the original NeRF while matching its visual quality.

深入探討

NeRF 實現了照片級真實感,但速度很慢,因為每個樣本都需要透過深度神經網路進行前向傳播,而訓練可能需要數小時或數天。 Plenoxels(Sara Fridovich-Keil、Alex Yu 等人,2022)提出了一個挑釁性的問題:網路是否必要?他們的回答是否定的。它們將場景表示為稀疏的 3D 體素網格。每個佔用的體素儲存單一不透明度值以及編碼與視圖相關的顏色的球諧係數。為了渲染像素,系統沿著光線對這些值進行三線性插值,並將它們與標準體積渲染進行合成。因為沒有網絡,所以整個過程直接透過體素值的梯度下降進行最佳化,並進行正則化以獲得平滑度。整體結果是:品質與 NeRF 相當,在單一 GPU 上只需幾分鐘即可完成訓練。

技術洞察

依賴視圖的顏色是巧妙的部分。每個體素不是按視角輸出 RGB 的網絡,而是按顏色通道儲存一小組球諧 (SH) 係數。評估光線方向上的 SH 基礎可以重建該點的顏色如何隨視點變化 - 捕捉鏡面高光和反射。不透明度與方向無關。可微分三線性內插加上體積渲染使每個體素值都可以直接訓練,因此最佳化是一種簡單的、無網路的最小二乘式擬合。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

Plenoxels 和體素輻射場的未來

Plenoxels 證明是表徵(而不是神經網路)推動了 NeRF 的品質——這一發現重塑了該領域。它直接啟發了顯式混合方法,例如 Instant-NGP 的哈希網格,以及最終的 3D 高斯潑濺法,後者現在在即時輻射渲染中佔據主導地位。預計將繼續朝著明確的、GPU 友好的基元方向發展,這些基元可以在幾秒鐘內訓練並即時渲染,並選擇性地使用神經網路而不是作為核心場景儲存。

現實世界的實施

在幾分鐘內快速將捕獲的物件重建為 3D 資產,以實現電子商務或博物館數位化,而無需等待數小時。

在單一消費級 GPU 上快速建立小說視圖合成原型,用於研究和教育。

與不透明的網路權重不同,產生可編輯的、明確的體素場景,藝術家可以直接檢查和修剪。

作為一個教學範例,場景表示(而不是深度學習)產生了逼真的結果。

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Plenoxels and Voxel Radiance Fields quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

神經輻射場

常見問題

What is Plenoxels and Voxel Radiance Fields?

Plenoxels 表明,您可以重建具有 NeRF 品質結果的 3D 場景,而無需任何神經網路——只需儲存顏色和密度的體素網格。結果訓練速度比原始 NeRF 快約 100 倍,同時符合其視覺品質。

與 NeRF 相比,Plenoxels 最令人驚訝的設計選擇是什麼?

Plenoxels 將場景直接儲存在體素網格中並最佳化這些值,管道中沒有神經網路。

Plenoxels 中的每個佔用體素儲存什麼來捕捉依賴視圖的顏色?

每個體素都包含每個顏色通道的不透明度和球諧係數,這些係數對顏色如何隨觀察方向變化進行編碼。

與最初的 NeRF 相比,Plenoxels 的訓練速度大約快了多少?

透過消除每個樣本的網路傳遞,Plenoxels 的訓練速度提高了 100 倍,在幾分鐘內完成。

如何沿著射線從體素網格取得值?

Plenoxels 使用可微分三線性內插法來平滑地讀取體素中心之間的顏色和不透明度。

Plenoxels 向該領域展示了哪些更廣泛的結論?

透過將 NeRF 品質與無網路進行匹配,Plenoxels 表明表示和優化(而不是 MLP)對結果負責。