DreamFusion 和分数蒸馏采样
DreamFusion 使用 2D 图像扩散模型作为批评者,从文本生成 3D 对象,从不训练任何 3D 数据。
概述
Its core invention, Score Distillation Sampling, became the foundational recipe for the entire text-to-3D field.
深入探讨
来自 2022 年 Google 的 DreamFusion 问:2D 文本到图像模型能否教会 3D 场景从各个角度看都是正确的?它优化了 NeRF(神经辐射场),以便来自随机摄像机视点的渲染在加噪并显示到冻结扩散模型 (Imagen) 时,可以为文本提示评分为合理的图像。至关重要的是,它不使用 3D 训练数据。突破在于分数蒸馏采样(SDS):SDS 不通过扩散模型昂贵的 U-Net 进行反向传播,而是使用模型的预测噪声作为直接在渲染像素上的梯度信号。通过数千个视点进行迭代,可以通过单个句子雕刻出连贯的 3D 资产,包括几何图形和依赖于视图的外观。
技术洞察
SDS 将扩散模型视为冻结的评分函数。它渲染 NeRF,添加噪声,要求扩散 U-Net 预测该噪声,并计算推回到渲染图像上的梯度(预测噪声减去添加的噪声),从而计算 NeRF 权重。跳过 U-Net 雅可比行列式使其易于处理。需要高的无分类器指导(大约 100)才能获得清晰的结果,这会导致特征过度饱和,有时模糊的“DreamFusion 外观”。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
DreamFusion 和分数蒸馏采样的未来
SDS 催生了一系列丰富的工作来解决其弱点:Magic3D 提供分辨率和速度,ProlificDreamer 的变分蒸馏提供更清晰、更多样化的输出,以及攻击“Janus”多面工件的方法。该领域越来越多地将 SDS 与多视图扩散先验和快速 3D 表示(例如高斯溅射)结合起来。预计文本转 3D 会发展得更快、几何形状更忠实,从而缩小与手工建模资产的差距。
现实世界的实施
仅根据文本生成“戴着小帽子的松鼠的 DSLR 照片”的 3D 模型
创建草稿游戏和 AR 资源,无需手动 3D 雕刻
生成可供艺术家改进的可导出网格,而不是从头开始构建
根据 SDS 评估较新的文本转 3D 方法的研究基线
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DreamFusion and Score Distillation Sampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is DreamFusion and Score Distillation Sampling?
DreamFusion 使用 2D 图像扩散模型作为批评者,从文本生成 3D 对象,从不训练任何 3D 数据。其核心发明“分数蒸馏采样”成为整个文本转 3D 领域的基础配方。
DreamFusion 优化了哪些 3D 表示?
DreamFusion 优化了 NeRF,使其渲染视图满足 2D 扩散模型对文本提示的判断。
DreamFusion 需要多少 3D 训练数据?
DreamFusion 使用冻结的 2D 文本到图像扩散模型作为唯一的监督,不需要 3D 训练数据。
分数蒸馏采样中的关键计算捷径是什么?
SDS 使用预测减去添加的噪声作为渲染像素上的直接梯度,避免了昂贵的 U-Net 雅可比行列式。
为什么 DreamFusion 使用非常高的无分类器指导(~100)?
SDS 梯度噪声较大且较弱,因此需要异常高的指导才能获得清晰、即时的几何形状,尽管它会导致过饱和。
最初的 DreamFusion 使用哪个 2D 模型作为其冻结先验?
DreamFusion 建立在 Google 的 Imagen 文本到图像扩散模型上,作为冻结评分函数。