DDPM 和 DDIM 采样器
DDPM 和 DDIM 是运行扩散模型的逆过程的两种方法,将随机噪声逐步转化为图像。
概述
DDPM is the original stochastic recipe; DDIM is a faster, deterministic shortcut that produces comparable images in far fewer steps.
深入探讨
通过逐渐向图像添加高斯噪声来训练扩散模型,然后学习预测该噪声。抽样扭转了这一点。 DDPM(去噪扩散概率模型,Ho et al. 2020)会回溯每个噪声级别,在每个步骤中添加一些新的随机噪声,因此通常需要数百到一千个步骤。 DDIM(去噪扩散隐式模型,Song 等人,2021)重复使用完全相同的训练网络,但遵循非马尔可夫确定性轨迹。通过丢弃注入的随机性,DDIM 可以跳过许多时间步长,并且仍然可以在 10-50 个步长内获得高质量图像。由于 DDIM 是确定性的,因此相同的起始噪声始终会产生相同的图像,从而实现平滑插值和再现性。
技术洞察
两个采样器都使用一个网络来预测在时间步 t 添加到图像中的噪声 epsilon。 DDPM 的更新减去该预测的缩放版本,然后添加从后验中提取的方差噪声。 DDIM 重写更新以首先估计干净图像 x0,然后将其重新投影到没有随机项的下一个(较小的)时间步长。参数 eta 将两者混合在一起:eta=1 恢复 DDPM,eta=0 给出完全确定性 DDIM。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
DDPM 和 DDIM 采样器的未来
采样器研究正朝着一步或几步生成的方向发展。 DPM-Solver 和 DPM-Solver++ 等高阶 ODE 求解器已将质量采样减少到 20 个步骤以下,而蒸馏方法(渐进蒸馏、一致性模型、潜在一致性)将模型压缩为 1-4 步生成器。预计 DDPM/DDIM 仍将保持概念基线,而生产系统则依靠精炼和自适应求解器在消费类硬件上进行实时图像和视频合成。
现实世界的实施
稳定的扩散图像生成,其中 DDIM 作为 Automatic1111 和 ComfyUI 等工具中文本到图像提示的快速默认采样器提供。
可重现的艺术管道,使用确定性 DDIM 修复随机种子,因此相同的提示和种子始终会重新生成相同的图像。
通过 DDIM 从噪声到输出的确定性映射,可以在两个图像之间实现平滑的潜在空间插值以实现变形动画。
快速创意迭代,设计人员使用 20 步 DDIM 预览来探索概念,然后再进行更慢、保真度更高的全步渲染。
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DDPM and DDIM Samplers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is DDPM and DDIM Samplers?
DDPM 和 DDIM 是运行扩散模型的逆过程的两种方法,将随机噪声逐步转化为图像。 DDPM是原始随机配方; DDIM 是一种更快、确定性的快捷方式,可以用更少的步骤生成类似的图像。
DDIM 相对于 DDPM 的主要实际优势是什么?
DDIM 遵循确定性的非马尔可夫轨迹,使其可以跳过许多时间步,以大约 10-50 个步骤(而不是数百个步骤)生成高质量图像。
扩散模型的神经网络在训练过程中实际上学会预测什么?
该网络经过训练可以预测每个时间步添加的高斯噪声 (epsilon),然后 DDPM 和 DDIM 使用该噪声来反转该过程。
为什么 DDIM 每次都能从相同的起始噪声生成完全相同的图像?
DDIM 在其更新中删除了随机噪声项,使得从噪声到图像的路径完全确定,因此可再现。
在 DDIM 中,参数 eta 的什么值可以恢复原始的随机 DDPM 行为?
eta 参数在两个采样器之间进行插值:eta=1 给出完全的 DDPM 随机性,而 eta=0 给出完全确定的 DDIM。
原始 DDPM 通常需要多少步才能获得高质量样本?
DDPM 会回溯每个噪声级别,增加随机性,因此通常需要数百到一千个反向步骤。