视觉人工智能指南

SDXL 和级联扩散

SDXL 是 Stability AI 的高分辨率文本到图像模型,它将强大的基础生成器与精炼器配对,而级联扩散链接多个模型以构建从低到高分辨率的图像。

阅读时间:2分钟最后更新

概述

Together they explain how modern open-source image generators hit photorealistic quality.

深入探讨

SDXL (Stable Diffusion XL) 是一个大约 35 亿个参数的扩散模型,本身可以生成 1024x1024 图像,比原始的 512x512 稳定扩散有了很大的提升。它使用两个文本编码器(OpenCLIP ViT-bigG 和 CLIP ViT-L)来实现更丰富的即时理解,加上尺寸和裁剪调节,以便模型了解目标分辨率和取景。 SDXL 作为两级管道提供:基础模型生成潜在图像,然后可选的细化器模型在最终的去噪步骤中添加精细细节。级联扩散是其背后更广泛的想法:不是一个模型做所有事情,而是将一个创建低分辨率图像的小模型与放大图像的超分辨率扩散模型链接起来,每个模型都针对其阶段进行训练。 Google 的 Imagen 普及了级联方法。

技术洞察

两者都在去噪框架中工作:从随机噪声开始,并在文本引导下迭代预测和删除它。 SDXL 通过 VAE 在压缩的潜在空间中运行,因此去噪比处理原始像素更便宜。精炼机是一个单独的专家模型,仅处理最后的低噪音步骤。在真正的级联中,基本模型输出一个小图像,然后条件超分辨率扩散模型对其进行上采样,每个模型都以较低分辨率的输出为条件,通常使用噪声调节增强来保持鲁棒性。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

SDXL 和级联扩散的未来

趋势是更少、更快的步骤和统一的架构。 SDXL Turbo 和潜在一致性模型等蒸馏方法已经将生成步骤减少到一到四个步骤。扩散变压器(如 Stable Diffusion 3 和 FLUX)正在很大程度上取代 U-Net 主干网,并且端到端高分辨率生成正在减少对显式级联的依赖。随着效率的不断提高,细化、更好的文本渲染和实时设备图像合成将得到更紧密的集成。

现实世界的实施

直接根据文本提示生成 1024x1024 营销和概念艺术,无需单独的升级器

使用 SDXL 基础加细化器管道为产品模型中的面部和纹理添加清晰的细节

运行 SDXL Turbo 在交互式设计工具中实现近乎即时的图像预览

构建自定义超分辨率级联,将低分辨率草图转换为高分辨率插图

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SDXL and Cascaded Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

定制扩散多概念调音

常见问题

What is SDXL and Cascaded Diffusion?

SDXL 是 Stability AI 的高分辨率文本到图像模型,它将强大的基础生成器与精炼器配对,而级联扩散链接多个模型以构建从低到高分辨率的图像。他们共同解释了现代开源图像生成器如何实现逼真的质量。

与原始稳定扩散相比,SDXL 生成图像的原始分辨率是多少?

SDXL 本身可生成 1024x1024 图像,比原始稳定扩散的 512x512 图像面积大四倍。

SDXL的炼油机模型有什么作用?

细化器是一个单独的专家模型,应用于管道末端,用于在基本模型创建潜在图像后锐化细节。

SDXL 使用多少个文本编码器?

SDXL 使用两种文本编码器:OpenCLIP ViT-bigG 和 CLIP ViT-L,两者相结合可实现更丰富的提示理解。

级联扩散的核心思想是什么?

级联扩散将一个小型基础生成器与一个或多个超分辨率扩散模型链接起来,每个模型都以先前的较低分辨率输出为条件。

为什么 SDXL 在潜在空间中降噪,而不是直接在像素上降噪?

VAE 将图像压缩到更小的潜在空间中,因此扩散过程比对全分辨率原始像素进行操作要便宜得多。