潜在扩散模型
潜在扩散模型通过在压缩的潜在空间而不是原始像素中运行扩散过程来生成图像,从而大幅削减计算成本。
概述
They are the engine behind Stable Diffusion and most modern open-source image generators.
深入探讨
标准扩散模型学习逆转噪声过程:它从纯噪声开始,逐渐去噪为图像。直接在像素上执行此操作的成本很高,因为 512x512 图像具有数十万个值。 Rombach 及其同事于 2022 年提出的潜在扩散技术,首先使用预训练的变分自动编码器 (VAE) 将图像压缩为小型潜在网格(通常为 64x64x4,大约小 48 倍)。然后,扩散 U-Net 在文本的交叉注意力引导下,学习在紧凑的潜在空间内进行去噪。最后,VAE 解码器重建全分辨率像素。这种感知压缩保留了语义上有意义的信息,同时丢弃了难以察觉的细节,从而在消费级 GPU 上实现高质量生成。
技术洞察
关键技巧是将感知压缩与生成建模分开。 VAE 处理一次高频像素细节,而 U-Net 仅对较低维的潜在分布进行建模。文本调节是通过交叉注意力层注入的,其中 U-Net 的空间特征负责来自 CLIP 等文本编码器的标记嵌入。由于潜在图像大约比像素小 48 倍,因此每个去噪步骤的内存和 FLOP 成本都显着降低。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
潜在扩散模型的未来
潜在扩散正在从图像扩展到视频(稳定视频扩散)、3D 资产和音频频谱图,所有这些都使用相同的压缩然后降噪配方。研究正在推动通过蒸馏和一致性模型减少采样步骤、保留精细文本和面孔的更好 VAE,以及稳定扩散 3 中的整流流公式,以拉直生成轨迹以获得更快、更清晰的结果。
现实世界的实施
稳定扩散在单个消费级 GPU 上根据文本提示生成艺术作品和概念设计
Adobe 和 Canva 支持基于潜在扩散主干的文本到图像和生成填充功能
游戏工作室制作纹理贴图、精灵和环境概念艺术以加速预制作
库存图像和营销团队无需拍摄照片即可创建品牌产品模型和广告视觉效果
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Latent Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Latent Diffusion Models?
潜在扩散模型通过在压缩的潜在空间而不是原始像素中运行扩散过程来生成图像,从而大幅削减计算成本。它们是稳定扩散和大多数现代开源图像生成器背后的引擎。
与像素空间扩散相比,潜在扩散模型的主要创新是什么?
潜在扩散使用 VAE 将图像压缩到更小的潜在空间中,因此昂贵的去噪发生在比完整像素少得多的值上。
哪个组件将图像压缩到潜在空间并随后重建它?
预训练的 VAE 将图像编码为紧凑的潜在网格,其解码器最后重建全分辨率像素。
文本通常如何在潜在扩散中注入去噪 U-Net 中?
来自文本编码器的标记嵌入被输入交叉注意层,让空间特征关注提示。
为什么在潜在空间中操作可以降低计算成本?
等等——正确的原因是潜在网格比像素图像小得多(通常约为 48 倍),因此每个去噪步骤需要的 FLOP 和内存要少得多。
哪种广泛使用的开源模型普及了潜在扩散?
Stable Diffusion 于 2022 年发布,为消费类硬件带来了潜在的扩散和大规模采用。