零一到三新奇观扩散
零一到三使用以您要求的相机旋转为条件的扩散模型,将一个物体的单张照片转换为从任何新角度看到的同一物体的图像。
概述
它很重要,因为它允许你在不必从多个方向扫描物体的情况下重建3D一致的视图。
深入探讨
Zero-1-to-3(来自哥伦比亚,2023)对稳定扩散进行了微调,因此它可以从一张输入图像执行零样本新颖的视图合成。你向它提供一张图片加上相对相机变换(旋转和小的平移),模型就会生成从新视点看对象的样子。关键思想是,在巨大的网络图像集合上训练的大型 2D 扩散模型已经隐含地吸收了有关物体在 3D 中的外观的几何和物理先验。通过对从多个受控摄像机角度(使用 Objaverse)渲染的对象的合成数据集进行微调,模型学会将这些先验映射到显式摄像机控制上。然后生成的视图可以提供给下游 3D 重建。
技术洞察
源图像上的模型条件有两种方式:CLIP 嵌入与相对相机姿态(方位角、仰角、半径)连接以引导交叉注意力,而原始图像与噪声潜图像通道连接,因此保留了精细的细节和身份。训练使用从 CAD 对象渲染的图像-姿态-图像三元组,因此网络可以学习视点变化和由此产生的像素变化之间的可控映射。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
零一到三小说观扩散的未来
从零到 3 催生了图像到 3D 管道的浪潮。 Zero123-XL、SyncDreamer 和 One-2-3-45 等后继产品致力于实现多视图一致性和更快、更可靠的 3D 网格输出,同时与高斯泼溅和大型重建模型的集成将生成时间从几分钟缩短到几秒。随着这些视点可控的扩散模型成熟为内容创建的标准工具,预计会出现更严格的视图一致性、更高分辨率和现实世界(不仅仅是合成对象)泛化。
现实世界的实施
生成单个产品照片的转盘视图,以便电子商务列表可以从各个方面显示该商品
从一张随意的手机快照中引导对象的纹理 3D 网格以进行 AR 预览
为游戏和电影概念艺术家创建一致的多角度角色或道具参考艺术
将合成的新颖视图输入 NeRF 或高斯泼溅重建中以填充看不见的几何形状
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Zero-1-to-3 Novel View Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
什么是零一到三小说视角扩散?
零一到三使用以您要求的相机旋转为条件的扩散模型,将一个物体的单张照片转换为从任何新角度看到的同一物体的图像。这很重要,因为它可以让您重建 3D 一致的视图,而无需从多个侧面扫描对象。
除了单张图像之外,零一到三还需要什么核心输入才能生成新视图?
0-1-to-3 以单个图像加上相对相机姿势为条件,因此您可以指定所需视点的旋转和平移。
零一到三是通过微调哪一种模型来构建的?
它对大型预训练二维扩散模型进行微调,以便可以利用这些模型从网络图像中隐式学习的几何先验。
为什么 2D 扩散模型能够执行零样本新颖视图合成?
大规模 2D 训练传授有关对象如何在 3D 中显示的隐式知识,通过微调可以通过相机姿势进行控制。
哪些 3D 对象数据集对于零一到三的训练至关重要?
它接受了从 Objaverse 等大型合成 3D 对象集合渲染的图像-姿势-图像三元组的训练。
源图像的精细细节如何在生成过程中保留?
原始图像与噪声潜在图像进行通道级联(以及用于语义的 CLIP 嵌入),因此身份和细节得以延续。