プレノセルとボクセル放射フィールド
Plenoxels は、ニューラル ネットワークをまったく使用せずに、色と密度を格納するボクセルのグリッドだけで、NeRF 品質の結果で 3D シーンを再構築できることを示しました。
概要
The result trains roughly 100x faster than the original NeRF while matching its visual quality.
ディープダイブ
NeRF はフォトリアリズムを実現しますが、すべてのサンプルがディープ ニューラル ネットワークを通過する前方パスを必要とし、トレーニングには数時間から数日かかる可能性があるため、速度が遅くなります。 Plenoxels (Sara Fridovich-Keil、Alex Yu 他、2022) は、ネットワークはそもそも必要なのでしょうか?という挑発的な質問をしました。彼らの答えはノーでした。これらは、シーンをまばらな 3D ボクセル グリッドとして表します。占有された各ボクセルには、単一の不透明度値とビュー依存の色をエンコードする球面調和係数が格納されます。ピクセルをレンダリングするために、システムはこれらの値を光線に沿って三重線形に補間し、標準のボリューム レンダリングと合成します。ネットワークがないため、全体がボクセル値の勾配降下法を使用して直接最適化され、滑らかさのために正規化されます。見出しの結果は、単一の GPU で数分でトレーニングされた NeRF に匹敵する品質です。
技術的な洞察
ビュー依存の色は賢い部分です。視野角ごとに RGB を出力するネットワークの代わりに、各ボクセルはカラー チャネルごとに球面調和関数 (SH) 係数の小さなセットを保存します。光線の方向で SH 基底を評価すると、その点の色が視点に応じてどのように変化するかが再構築され、鏡面ハイライトと反射がキャプチャされます。不透明度は方向に依存しません。微分可能なトライリニア補間とボリューム レンダリングにより、すべてのボクセル値が直接トレーニング可能になるため、最適化は直接的でネットワーク不要の最小二乗スタイルのフィットになります。
戦略的影響
速度とスケール
Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。
ビルドの選択
クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。
チームとワークフロー
以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。
プレノセルとボクセル放射フィールドの未来
Plenoxels は、ニューラル ネットワークではなく表現が NeRF の品質を左右することを証明しました。これはこの分野を再形成する発見でした。これは、Instant-NGP のハッシュ グリッドや、最終的には現在リアルタイムの放射輝度レンダリングの主流となっている 3D ガウス スプラッティングなどの明示的およびハイブリッドな手法に直接影響を与えました。ニューラル ネットワークをコア シーン ストアとしてではなく選択的に使用し、数秒でトレーニングしてリアルタイムでレンダリングする、明示的で GPU フレンドリーなプリミティブへの継続的な動きが期待されます。
現実世界の実装
電子商取引や博物館のデジタル化のために、何時間も待つことなく、キャプチャしたオブジェクトを数分で 3D アセットにすばやく再構築します。
研究および教育向けの単一コンシューマ GPU でのノベルビュー合成のラピッド プロトタイピング。
不透明なネットワーク ウェイトとは異なり、アーティストが直接検査してプルーニングできる、編集可能な明示的なボクセル シーンを生成します。
ディープラーニングではなくシーン表現がフォトリアリスティックな結果を生み出すということを教える例として役立ちます。
リスクとガードレール
出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。
モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。
信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。
実装ロードマップ
精度、再現率、エラーコストの許容基準を定義します。
実際の生産条件に一致するデータを使用してテストします。
信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。
モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Plenoxels and Voxel Radiance Fields quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
神経放射フィールド
よくある質問
What is Plenoxels and Voxel Radiance Fields?
Plenoxels は、ニューラル ネットワークをまったく使用せずに、色と密度を格納するボクセルのグリッドだけで、NeRF 品質の結果で 3D シーンを再構築できることを示しました。その結果、元の NeRF よりも約 100 倍の速度でトレーニングが行われ、その視覚的な品質も同等になります。
NeRF と比較して、Plenoxel で最も驚くべき設計の選択は何ですか?
Plenoxels は、パイプラインにニューラル ネットワークを使用せずに、シーンをボクセル グリッドに直接保存し、それらの値を最適化します。
プレノセルの各占有ボクセルは、ビュー依存のカラーをキャプチャするために何を保存しますか?
各ボクセルは、カラー チャネルごとに不透明度に加えて球面調和係数を保持し、視線方向によって色がどのように変化するかをエンコードします。
オリジナルの NeRF と比較して、プレノクセルのトレーニングはおよそどれくらい速くなりましたか?
サンプルごとのネットワーク パスを排除することで、Plenoxel のトレーニングは 100 倍程度速くなり、数分で終了しました。
光線に沿ってボクセル グリッドから値がどのように取得されるのでしょうか?
Plenoxels は、微分可能な三線形補間を使用して、ボクセルの中心間で色と不透明度をスムーズに読み取ります。
プレノクセルはどのような広範な結論を現場に示しましたか?
NeRF 品質をネットワークなしで一致させることにより、Plenoxels は、MLP ではなく表現と最適化が結果の原因であることを示しました。