扩散变压器
Diffusion Transformers (DiTs) 将图像和视频生成器核心的卷积 U-Net 替换为 Transformer 主干。
概述
This architecture powers leading systems like Stable Diffusion 3 and OpenAI's Sora, and it scales remarkably well as you add compute.
深入探讨
扩散模型通过从纯噪声开始并迭代地将其去噪成连贯的图片来生成图像。多年来,进行去噪的网络一直是 U-Net,一种卷积架构。 Peebles 和 Xie 在 2022 年推出的 Diffusion Transformer 用 Transformer 取代了 U-Net。图像首先被压缩到潜在空间中,分成小块,每个块变成一个标记,就像语言模型中的单词一样。然后,Transformer 在每个去噪步骤中通过自注意力处理这些标记。一个重要的发现是,当您遵循干净的缩放法则增加模型大小并减少补丁大小时,DiT 性能可预测地提高。这种可扩展性就是文本到视频和高端文本到图像系统大部分迁移到 Transformer 主干的原因。
技术洞察
核心创新是 DiT 如何注入时间步长和文本提示等条件。他们使用自适应层归一化 (adaLN),而不是简单的串联,其中网络根据调节信号预测归一化层的尺度和移位参数。 adaLN-zero 变体初始化这些,因此每个块都作为恒等函数启动,从而稳定训练。补丁被展平为令牌,由具有自注意力的标准 Transformer 块进行处理,然后重新组装并解码回像素。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
扩散变压器的未来
扩散变压器正在成为生成媒体的默认支柱。它们基于代币的设计使它们能够自然地在一个可扩展架构下统一图像、视频甚至多模式生成。研究正在推动更长的视频、更高分辨率和更有效的注意力,以控制许多代币的二次成本。预计语言和视觉模型之间会融合,类似的 Transformer 扩展方法和基础设施可以同时服务于这两种模型,从而加速世界模型和交互式视频的进步。
现实世界的实施
OpenAI 的 Sora 使用时空补丁上的 Transformer 主干,根据文本提示生成一分钟长的高保真视频。
Stable Diffusion 3 采用多模态 Diffusion Transformer (MMDiT) 来更好地将生成的图像与详细的文本描述对齐。
研究人员将 DiT 扩展到数十亿个参数,并观察到图像质量可预测地改善,从而指导计算预算决策。
工作室使用基于 DiT 的模型来扩展短片,将额外的视频帧视为附加的补丁标记来降噪。
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Diffusion Transformers?
Diffusion Transformers (DiTs) 将图像和视频生成器核心的卷积 U-Net 替换为 Transformer 主干。该架构为 Stable Diffusion 3 和 OpenAI 的 Sora 等领先系统提供支持,并且随着计算量的增加,它的扩展性非常好。
与传统扩散模型相比,扩散变压器取代了哪些组件?
DiT 用 Transformer 主干取代了 U-Net(执行去噪功能的卷积网络)。
DiT 如何将图像转换为 Transformer 可以处理的内容?
潜在图像被分成小块,每个块成为一个令牌,类似于语言模型中的单词。
最初的 DiT 论文对于缩放有什么发现?
当您增加模型计算量并使用较小的补丁并遵循缩放法则时,DiT 质量会以干净、可预测的方式得到提高。
DiT 通常如何注入时间步长和文本提示等条件?
DiT 使用自适应层归一化来根据调节信号预测归一化层的尺度和移位参数。
“adaLN-zero”初始化完成什么作用?
adaLN-zero 初始化调制,因此每个块最初都充当身份,从而稳定并改进训练。