视觉人工智能指南

GigaGAN 规模化生成器

GigaGAN 是一个十亿参数的 GAN,它证明生成对抗网络可以扩展到文本到图像的生成,与扩散模型相媲美,同时生成图像的速度快数百倍。

阅读时间:2分钟最后更新

深入探讨

Adobe 和研究人员于 2023 年推出的 GigaGAN 挑战了 GAN 无法像扩散模型那样扩展的假设。早期的大型 GAN(例如 StyleGAN-XL)很难在巨大且多样化的数据集上进行稳定训练。 GigaGAN 通过扩展生成器和鉴别器、添加按样本选择的一组学习卷积滤波器以及将交叉注意力纳入文本嵌入来解决这个问题。经过数十亿图像-文本对的训练,其 10 亿参数生成器在大约 0.13 秒内生成 512 像素的图像,远远快于扩散的迭代去噪。它还支持潜在空间插值、风格混合和一个单独的基于 GAN 的上采样器,可以将 128px 输入转换为清晰的 4K 图像。

技术洞察

关键技巧是“样本自适应内核选择”模块:生成器不是一个固定的卷积滤波器组,而是拥有一组滤波器,并使用文本嵌入来计算将每个图像混合的权重。结合多尺度训练和判别器(以多种分辨率判断补丁并匹配 CLIP 文本特征),这可以稳定对抗性训练,使其达到之前 GAN 崩溃的规模。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

GigaGAN 规模化生成器的未来

GigaGAN 重新激发了人们对 GAN 作为扩散的注重速度的替代方案的兴趣,特别是对于单遍生成很重要的实时和交互式编辑。预计混合系统会使用 GAN 式生成器进行即时预览,并使用扩散进行最终细化,再加上与扩散基础配对的 GAN 上采样器。其解开的潜在空间也使其对于可控编辑工具具有吸引力,其中平滑插值胜过缓慢采样。

现实世界的实施

根据文本提示生成 512 像素的图像,只需大约十分之一秒即可进行交互式设计预览

使用基于 GAN 的超分辨率上采样器将低分辨率 128 像素照片升级为清晰的 4K 图像

在潜在空间中的两个提示之间平滑插入以实现过渡动画,就像咖啡杯变成茶壶一样

应用风格混合以保持主题的布局,同时在 Adobe 风格的编辑工具中交换其艺术风格或调色板

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GigaGAN Scaled Generators quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

MaskGIT 并行令牌解码

常见问题

What is GigaGAN Scaled Generators?

GigaGAN 是一个十亿参数的 GAN,它证明生成对抗网络可以扩展到文本到图像的生成,与扩散模型相媲美,同时生成图像的速度快数百倍。

GigaGAN 对生成模型的主要贡献是什么?

GigaGAN 证明了长期以来被认为难以扩展的 GAN 可以达到 10 亿个参数,并且可以在文本到图像任务上与扩散模型相媲美。

GigaGAN 相对于扩散模型的主要速度优势是什么?

GAN 一次性生成,因此 GigaGAN 在大约 0.13 秒内生成一张 512 像素的图像,远远快于扩散的迭代去噪。

GigaGAN 的“样本自适应内核选择”有什么作用?

GigaGAN 不是固定的滤波器,而是拥有一个滤波器组,并使用文本嵌入来对每个样本进行加权和混合,从而提高容量和稳定性。

GigaGAN 如何将文本信息融入到图像生成中?

GigaGAN 在生成器中使用对文本嵌入的交叉注意力,并通过鉴别器将生成的图像与 CLIP 文本特征对齐。

除了基础生成之外,GigaGAN 还提供哪些额外功能?

GigaGAN 包含一个基于 GAN 的超分辨率上采样器,可以将小输入转换为清晰的 4K 图像。