视觉人工智能指南

神经辐射场

神经辐射场 (NeRF) 从几张普通照片重建完整的 3D 场景,让您将相机带到全新的视角。

阅读时间:2分钟最后更新

概述

It reframed 3D capture as training a tiny neural network rather than building a mesh.

深入探讨

NeRF 由 Mildenhall 及其同事于 2020 年推出,将整个场景存储在小型神经网络(多层感知器)内。给定 3D 点和观察方向,网络会输出该点的颜色及其不透明程度。为了渲染像素,NeRF 将光线射入场景,沿其采样点,查询网络,并使用体积渲染混合结果。由于整个过程是可微分的,因此通过将渲染像素与真实输入照片进行比较并进行调整直到它们匹配来训练网络。其回报是惊人的照片级真实感,包括依赖于视图的效果,例如随着您移动而变化的反射和光泽高光。缺点是每个场景都需要自己的训练运行,并且原始方法的训练和渲染速度都很慢。

技术洞察

NeRF 将场景表示为连续的 5D 函数:输入位置(x、y、z)加上观察方向(两个角度),MLP 返回 RGB 颜色和体积密度。一个关键的细节是位置编码,它通过高频正弦和余弦函数映射坐标,以便网络可以捕获清晰的细节,而不是产生模糊的输出。渲染沿着每条相机光线集成颜色和密度,对更近、更不透明的样本进行更重的加权,这正是经典体积渲染的可训练数学。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

神经辐射场的未来

NeRF 研究在 2020 年之后呈爆炸式增长,后续研究成果包括 Instant-NGP 使用哈希网格编码将训练时间从几小时缩短为几秒,以及 Mip-NeRF 提高了跨尺度的质量。该领域越来越多地与渲染速度更快的高斯泼溅技术融合或受到挑战。期待 NeRF 衍生技术在地图、电子商务产品视图、电影视觉效果和 AR/VR 方面的发展,以及动态 NeRF 的发展,这些技术可以处理移动场景和随光线变化而进行的“野外”捕捉。最大的主题是速度、可编辑性以及从更少、更混乱的照片中捕捉场景。

现实世界的实施

将手机拍摄的物体视频转换为 3D 视图,您可以在线购物

将真实地点重建为电影和视觉效果的逼真背景

构建沉浸式 3D 场景以实现虚拟和增强现实体验

以数字方式保存照片集中的文化遗产和文物

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Neural Radiance Fields quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

Mip-NeRF 和抗锯齿辐射场

常见问题

What is Neural Radiance Fields?

神经辐射场 (NeRF) 从几张普通照片重建完整的 3D 场景,让您将相机带到全新的视角。它将 3D 捕获重新定义为训练微型神经网络而不是构建网格。

神经辐射场的主要目标是什么?

NeRF 根据一组图像构建 3D 表示,从而能够从原始照片之外的视点进行真实感渲染。

对于给定的输入,NeRF 神经网络输出什么?

对于 3D 位置和观察方向,MLP 返回该点的颜色和密度(不透明度)。

NeRF 5D 函数的输入是什么?

NeRF 采用 3D 位置(x、y、z)和观察方向(两个角度),总共五个输入。

NeRF 如何将其网络输出转换为最终的像素颜色?

NeRF 对每条射线上的点进行采样,并按密度加权对它们的颜色进行积分,经典体积渲染方程可微分。

为什么 NeRF 对输入坐标使用位置编码?

通过高频正弦/余弦函数映射坐标使 MLP 能够表示精细的细节而不是模糊的结果。