視覺人工智慧指南

神經輻射場

神經輻射場 (NeRF) 從幾張普通照片重建完整的 3D 場景,讓您將相機帶到全新的視角。

閱讀時間約2分鐘最後更新

概述

It reframed 3D capture as training a tiny neural network rather than building a mesh.

深入探討

NeRF 由 Mildenhall 及其同事於 2020 年推出,將整個場景儲存在小型神經網路(多層感知器)內。給定 3D 點和觀察方向,網路會輸出該點的顏色及其不透明程度。為了渲染像素,NeRF 將光線射入場景,沿其採樣點,查詢網絡,並使用體積渲染混合結果。由於整個過程是可微分的,因此透過將渲染像素與真實輸入照片進行比較並進行調整直到它們匹配來訓練網路。其回報是驚人的照片級真實感,包括依賴視圖的效果,例如隨著您移動而變化的反射和光澤高光。缺點是每個場景都需要自己的訓練運行,原始方法的訓練和渲染速度都很慢。

技術洞察

NeRF 將場景表示為連續的 5D 函數:輸入位置(x、y、z)加上觀察方向(兩個角度),MLP 傳回 RGB 顏色和體積密度。一個關鍵的細節是位置編碼,它透過高頻正弦和餘弦函數來映射座標,以便網路可以捕捉清晰的細節,而不是產生模糊的輸出。渲染沿著每個相機光線整合顏色和密度,對更近、更不透明的樣本進行更重的加權,這正是經典體積渲染的可訓練數學。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

神經輻射場的未來

NeRF 研究在 2020 年後爆炸性成長,後續研究成果包括 Instant-NGP 使用哈希網格編碼將訓練時間從幾小時縮短為幾秒,以及 Mip-NeRF 提高了跨尺度的品質。該領域越來越多地與渲染速度更快的高斯潑濺技術融合或受到挑戰。期待 NeRF 衍生技術在地圖、電子商務產品視圖、電影視覺效果和 AR/VR 方面的發展,以及動態 NeRF 的發展,這些技術可以處理移動場景和隨光線變化而進行的「野外」捕捉。最大的主題是速度、可編輯性以及從更少、更混亂的照片中捕捉場景。

現實世界的實施

將手機拍攝的物件影片轉換為 3D 視圖,您可以在線上購物

將真實地點重建為電影和視覺效果的逼真背景

建立沉浸式 3D 場景以實現虛擬和擴增實境體驗

以數位方式保存照片集中的文化遺產和文物

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Neural Radiance Fields quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

Mip-NeRF 與抗鋸齒輻射場

常見問題

What is Neural Radiance Fields?

神經輻射場 (NeRF) 從幾張普通照片重建完整的 3D 場景,讓您將相機帶到全新的視角。它將 3D 捕獲重新定義為訓練微型神經網路而不是建立網格。

神經輻射場的主要目標是什麼?

NeRF 根據一組影像建立 3D 表示,從而能夠從原始照片之外的視點進行真實感渲染。

對於給定的輸入,NeRF 神經網路輸出什麼?

對於 3D 位置和觀察方向,MLP 會傳回該點的顏色和密度(不透明度)。

NeRF 5D 函數的輸入是什麼?

NeRF 採用 3D 位置(x、y、z)和觀察方向(兩個角度),總共五個輸入。

NeRF 如何將其網路輸出轉換為最終的像素顏色?

NeRF 對每條射線上的點進行取樣,並以密度加權對它們的顏色進行積分,經典體積渲染方程式可微分。

為什麼 NeRF 對輸入座標使用位置編碼?

透過高頻正弦/餘弦函數映射座標使 MLP 能夠表示精細的細節而不是模糊的結果。