视觉人工智能指南

新颖的视图合成

新颖的视图合成从从未实际拍摄过的视点生成场景的照片级真实图像。

阅读时间:2分钟最后更新

概述

It matters because it turns a handful of photos into a fully explorable 3D scene, powering immersive media, VR, and digital twins.

深入探讨

新颖的视图合成(NVS)采用一组具有已知相机姿势的输入图像,并从新的、看不见的相机位置渲染场景。现代 NVS 通常学习场景外观和几何形状的连续表示,而不是重建显式网格。神经辐射场 (NeRF) 将场景编码为将 3D 位置和观察方向映射到颜色和密度的函数,然后通过体积射线行进、沿每个像素射线采样点并集成它们来合成视图。 3D 高斯分布将场景表示为数百万个实时光栅化的彩色 3D 高斯。两者都捕捉依赖于视图的效果,例如反射和镜面高光,产生传统基于几何的管道难以匹配的惊人逼真的结果。

技术洞察

NeRF 纯粹通过光度监督来训练小型神经网络:对于每个训练像素,它投射一条光线,对 3D 点进行采样,查询颜色和密度,并通过体积渲染积分将它们合成,然后反向传播与真实像素的差异。位置编码让网络能够表示高频细节。 Gaussian Splatting 放弃了每光线网络,转而采用显式高斯和可微分光栅化,用内存换取更快的训练和实时渲染。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

新颖视图合成的未来

NVS 正在迅速变得更快、可编辑和动态。 Instant-NGP 等技术将训练时间从几小时缩短为几秒,而 4D 方法则将高斯分布扩展到移动场景。期望生成模型能够从稀疏或单个图像中产生幻觉中看似看不见的区域,与文本转 3D、可重新照明和可动画的化身以及流辐射场集成,使体积捕获适用于电影、远程呈现、机器人模拟和消费者 AR。

现实世界的实施

将手机拍摄的物体视频转变为可探索的 3D 场景,用于电子商务或虚拟旅游

通过多机位捕捉在体育和电影中创建子弹时间和自由视点重播

为 VR 演练和房地产构建逼真的房间和环境数字双胞胎

为机器人和自动驾驶车辆模拟生成训练环境和资产

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Novel View Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

零一到三新奇观扩散

常见问题

What is Novel View Synthesis?

新颖的视图合成从从未实际拍摄过的视点生成场景的照片级真实图像。这很重要,因为它将少量照片转变为完全可探索的 3D 场景,为沉浸式媒体、VR 和数字孪生提供动力。

新颖视图合成的目标是什么?

新颖的视图合成使用一组具有已知姿势的输入图像,从新的、看不见的视点生成逼真的图像。

神经辐射场 (NeRF) 将 3D 位置和观看方向映射到什么?

NeRF 学习从(位置、方向)到发射颜色和密度的函数,然后沿着光线积分以渲染图像。

NeRF 如何为新视图渲染像素?

对于每个像素,NeRF 投射一条射线,对 3D 点进行采样,查询网络的颜色/密度,并将它们与体积渲染积分进行合成。

与 NeRF 相比,3D Gaussian Splatting 的关键表征差异是什么?

Gaussian Splatting 使用显式 3D 高斯基元和可微分光栅化来表示场景,从而实现比 NeRF 的每光线网络查询更快、更实时的渲染。

为什么 NVS 方法可以再现反射和闪亮的高光?

通过根据观察方向调节颜色,NeRF 和高斯斑点可捕获依赖于视图的效果,例如镜面高光和反射。