视觉人工智能指南

VQGAN 和 Codebook 图像合成

VQGAN 将图像压缩为从学习的码本中提取的离散标记网格,让转换器以与语言模型生成文本相同的方式生成图像。

阅读时间:2分钟最后更新

深入探讨

VQGAN 在 2021 年论文“Taming Transformers for High-Resolution Image Synthesis”中介绍,将矢量量化自动编码器 (VQVAE) 与对抗性和感知训练相结合。编码器将图像映射到特征向量的小网格;每个向量都被捕捉到学习的密码本中最近的条目,例如 1024 个离散代码,将图像转换为整数标记序列。解码器根据这些标记重建图像,并使用 GAN 判别器和感知损失进行训练,因此重建看起来清晰而不是模糊。由于图像现在是离散的标记序列,因此自回归转换器可以像语言一样对它们进行建模,一一预测标记。当与 CLIP 指导配合使用时,VQGAN 为早期的文本到图像艺术工具提供了强大的支持。

技术洞察

核心操作是矢量量化:连续的编码器输出被它们最近的码本矢量替换,并带有“直通”梯度估计器,因此尽管进行不可微查找,编码器仍然可以学习。在自动编码器之上添加基于补丁的 GAN 鉴别器,可以让 VQGAN 使用比 VQVAE 小得多的令牌网格(例如 16x16),同时保持纹理清晰,使 Transformer 建模变得易于处理。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

VQGAN 和 Codebook 图像合成的未来

VQGAN 的离散令牌配方成为基于令牌的图像和视频模型的基础,从 MaskGIT 到在一个变压器中混合图像和文本令牌的多模态系统。现在的研究正在推动更大的、有限标量或免查找的码本,以避免码本崩溃,并朝着统一的模型发展,其中相同的词汇跨越图像、音频和语言,从而实现任意生成。

现实世界的实施

将照片编码为 16x16 的密码本标记网格,以便转换器可以对其进行建模和重新生成

将 VQGAN 与 CLIP 指导相结合,创造出 2021 年病毒式传播的超现实“VQGAN+CLIP”人工智能艺术

将图像压缩为紧凑的离散代码,以进行高效存储或下游生成训练

用作较大的基于标记的生成器(如 MaskGIT 和多模态转换器)内的图像标记生成器

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQGAN and Codebook Image Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

SPADE语义图像合成

常见问题

什么是VQGAN和Codebook图像合成?

VQGAN 将图像压缩为从学习的码本中提取的离散标记网格,让转换器以与语言模型生成文本相同的方式生成图像。

VQGAN 使用什么将图像表示为离散标记?

VQGAN 将编码器特征量化为学习码本中最近的条目,将图像转换为离散码索引序列。

为什么 VQGAN 在 VQVAE 之上添加 GAN 鉴别器?

对抗性和感知损失让 VQGAN 从紧凑的令牌网格中重建清晰的图像,而仅使用 VQVAE 就会使图像变得模糊。

一旦图像是标记序列,什么模型会生成新图像?

由于图像成为离散的标记序列,因此转换器可以对它们进行自回归建模,就像生成文本一样。

什么技术让梯度流经不可微的量化步骤?

矢量量化是不可微的,因此 VQGAN 使用直通梯度估计器来训练编码器。

VQGAN在2021年助力打造了哪些著名的AI艺术潮流?

将 VQGAN 与 CLIP 指导配对产生了广泛共享的“VQGAN + CLIP”艺术,从而普及了文本驱动的图像生成。