扩散模型
扩散模型通过学习逆转噪声过程来生成图像,逐步将随机静态转化为详细的图片。
概述
They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.
深入探讨
扩散模型在两个方向上进行训练。在前向过程中,干净的图像通过添加少量随机噪声逐渐被破坏,直到变成纯静态。然后,模型学习相反的过程:从噪声开始,每一步都会预测并消除一点噪声,重复数十或数百次,直到出现清晰的图像。为了使其可控,文本提示会指导每个去噪步骤,因此“骑马的宇航员”会将静电引导到该图片。像稳定扩散这样的现代系统在压缩的潜在空间中运行这个过程,而不是在原始像素上,从而使其速度更快。与 GAN 相比,扩散模型训练更稳定并产生更大的多样性,这就是为什么它们在 2022 年左右取代 GAN 成为高质量图像生成的主要方法。
技术洞察
关键技巧是网络永远不需要一次性生成图像;它只学会预测在给定步骤中添加的噪声。在训练期间,将已知量的噪声添加到真实图像中,并要求模型估计该噪声;差异在于训练误差。在生成时,模型反复减去其预测的噪声,逐渐揭示结构。文本调节是通过交叉注意力注入的,无分类器的指导放大了提示引导输出的强度。
战略影响
更清晰的判决
它可以帮助您将清晰的技术声明与营销语言分开。
成本与预算
在花费金钱或时间之前,您可以提出更好的实施问题。
团队与工作流程
具有共同理解的团队可以做出更好的产品、政策和学习决策。
扩散模型的未来
扩散是当前图像以及越来越多的视频和音频生成的最先进技术,使用 Sora 等工具将其扩展到运动。最大的推动力是速度:蒸馏和一致性模型等技术旨在将数百个降噪步骤减少到少数甚至一个,从而实现实时生成。预计扩散将扩展到 3D 资产、分子和蛋白质等科学设计以及严格可控的编辑,同时变得足够便宜,可以在手机上运行。
现实世界的实施
根据稳定扩散、DALL-E 和 Midjourney 中的文本提示创建原创艺术作品和图像
修复和修复,无缝填充或扩展照片的某些部分
在 OpenAI 的 Sora 等工具中从文本生成视频
为药物发现研究设计新颖的分子和蛋白质结构
风险与防护栏
不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。
基准测试可能看起来很强大,但实际性能却参差不齐。
忽视数据质量和评估计划通常会产生脆弱的结果。
实施路线图
从您需要的结果的简单语言定义开始。
在测试之前选择一种成功指标和一种失败条件。
使用代表性数据运行小型试点,而不是完善的演示集。
记录扩散模型在哪些方面有帮助以及在哪些方面更简单的方法更好。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Diffusion Models?
扩散模型通过学习逆转噪声过程来生成图像,逐步将随机静态转化为详细的图片。它们为当今领先的文本到图像工具提供支持,例如 Stable Diffusion、DALL-E 和 Midjourney。
扩散模型生成图像背后的核心思想是什么?
扩散模型学习逆转噪声过程,从纯噪声开始,逐步去噪,直到出现清晰的图像。
在训练过程中,模型在每一步中实际学习预测什么?
该模型会获得一幅噪声图像,并学习估计添加的噪声,以便稍后在生成过程中减去噪声。
文本提示如何影响生成的图像?
文本调节(通过交叉注意力和指导)推动每个去噪步骤,使出现的图像与提示相匹配。
为什么稳定扩散在“潜在空间”中运行该过程?
在压缩的潜在空间而不是全分辨率像素中操作可显着减少计算量,同时保持质量。
与 GAN 相比,扩散模型的主要优势是什么?
扩散模型避免了 GAN 不稳定的对抗性博弈和模式崩溃,从而产生更可靠的训练和更大的输出多样性。