视觉人工智能指南

Plenoxels 和体素辐射场

Plenoxels 表明,您可以重建具有 NeRF 质量结果的 3D 场景,而无需任何神经网络——只需存储颜色和密度的体素网格。

阅读时间:2分钟最后更新

概述

最终的训练速度大约是原版NeRF的100倍,同时视觉质量相当。

深入探讨

NeRF 实现了照片级真实感,但速度很慢,因为每个样本都需要通过深度神经网络进行前向传播,而训练可能需要数小时或数天。 Plenoxels(Sara Fridovich-Keil、Alex Yu 等人,2022)提出了一个挑衅性的问题:网络是否必要?他们的回答是否定的。它们将场景表示为稀疏的 3D 体素网格。每个占用的体素存储单个不透明度值以及编码与视图相关的颜色的球谐系数。为了渲染像素,系统沿光线对这些值进行三线性插值,并将它们与标准体积渲染进行合成。因为没有网络,所以整个过程直接通过体素值的梯度下降进行优化,并进行正则化以获得平滑度。总体结果是:质量与 NeRF 相当,在单个 GPU 上只需几分钟即可完成训练。

技术洞察

依赖于视图的颜色是巧妙的部分。每个体素不是按视角输出 RGB 的网络,而是按颜色通道存储一小组球谐 (SH) 系数。评估光线方向上的 SH 基础可以重建该点的颜色如何随视点变化 - 捕获镜面高光和反射。不透明度与方向无关。可微分三线性插值加上体积渲染使每个体素值都可以直接训练,因此优化是一种简单的、无网络的最小二乘式拟合。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

Plenoxels 和体素辐射场的未来

Plenoxels 证明是表征(而不是神经网络)推动了 NeRF 的质量——这一发现重塑了该领域。它直接启发了显式混合方法,例如 Instant-NGP 的哈希网格,以及最终的 3D 高斯泼溅法,后者现在在实时辐射渲染中占据主导地位。预计将继续朝着明确的、GPU 友好的基元方向发展,这些基元可以在几秒钟内训练并实时渲染,并有选择地使用神经网络而不是作为核心场景存储。

现实世界的实施

在几分钟内快速将捕获的对象重建为 3D 资产,以实现电子商务或博物馆数字化,而无需等待数小时。

在单个消费级 GPU 上快速构建小说视图合成原型,用于研究和教育。

与不透明的网络权重不同,生成可编辑的、明确的体素场景,艺术家可以直接检查和修剪。

作为一个教学示例,场景表示(而不是深度学习)产生了逼真的结果。

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Plenoxels and Voxel Radiance Fields quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

神经辐射场

常见问题

什么是普洛克瑟尔和体素辐射场?

Plenoxels 表明,您可以重建具有 NeRF 质量结果的 3D 场景,而无需任何神经网络——只需存储颜色和密度的体素网格。结果训练速度比原始 NeRF 快大约 100 倍,同时匹配其视觉质量。

与 NeRF 相比,Plenoxels 最令人惊讶的设计选择是什么?

Plenoxels 将场景直接存储在体素网格中并优化这些值,管道中没有神经网络。

Plenoxels 中的每个占用体素存储什么来捕获依赖于视图的颜色?

每个体素都包含每个颜色通道的不透明度和球谐系数,这些系数对颜色如何随观察方向变化进行编码。

与最初的 NeRF 相比,Plenoxels 的训练速度大约快了多少?

通过消除每个样本的网络传递,Plenoxels 的训练速度提高了 100 倍,在几分钟内完成。

如何沿着射线从体素网格获取值?

Plenoxels 使用可微分三线性插值来平滑地读取体素中心之间的颜色和不透明度。

Plenoxels 向该领域展示了哪些更广泛的结论?

通过将 NeRF 质量与无网络进行匹配,Plenoxels 表明表示和优化(而不是 MLP)对结果负责。