自回归图像生成
自回归图像生成一次构建一张图片,从之前生成的所有内容中预测每个标记。
概述
It matters because the same next-token machinery powering language models can produce coherent, controllable images.
深入探讨
自回归图像生成将图片视为序列并逐个元素地预测它,其中每个新元素都以所有先前的元素为条件。 PixelRNN 和 PixelCNN 等早期工作每次预测一个原始像素,逐行扫描,虽然速度很慢,但理论上是干净的。现代系统首先使用 VQ-VAE 式编码器将图像压缩为离散标记网格,然后 Transformer 从左到右预测这些标记。 OpenAI 的 DALL-E 1 和 Google 的 Parti 遵循此配方,生成以文本提示为条件的图像标记,然后将其解码回像素。最大的优点是精确的似然建模和与语言共享的统一架构。成本是连续的、缓慢的采样。
技术洞察
该模型将所有标记的联合概率分解为条件的乘积:p(x) = p(x_i 给定 x_1...x_{i-1}) 的乘积。具有因果(屏蔽)注意力的 Transformer 强制每个位置只能看到较早的标记。在训练期间,它使用教师强制并行预测每个标记,但在推理时,它必须一次采样一个标记,并将每个标记反馈回来。学习的密码本将标记映射回图像块,解码器将其上采样为最终像素。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
自回归图像生成的未来
速度是中心战场。并行和屏蔽令牌解码(MaskGIT、Muse)等技术可以同时生成许多令牌,并且从语言模型借用的推测性解码正在适应图像。研究人员还将文本和图像标记统一在一个自回归主干中,以便一个模型可以读取和绘图,如多模态系统中所见。预计自回归和扩散思想将继续混合,混合模型捕获代币的可控性和扩散的质量。
现实世界的实施
DALL-E 1 通过从文本标题中自回归预测离散图像标记网格来生成图像。
Google 的 Parti 将自回归文本到图像 Transformer 扩展至 200 亿个参数,以实现详细、即时忠实的场景。
PixelCNN 和 PixelRNN 演示了原始的逐像素生成,并且仍然用作基于可能性的模型的教学基线。
MaskGIT 和 Muse 使用并行掩码令牌解码来加速基于令牌的图像合成,同时保持自回归式训练。
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Autoregressive Image Generation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Autoregressive Image Generation?
自回归图像生成一次构建一张图片,从之前生成的所有内容中预测每个标记。这很重要,因为为语言模型提供动力的相同的下一代机器可以产生连贯的、可控的图像。
在图像生成的背景下“自回归”意味着什么?
自回归模型将图像分解为序列,根据之前生成的所有元素来预测每个标记或像素。
像 DALL-E 1 这样的现代自回归图像模型在预测图像之前通常如何表示图像?
现代系统将图像压缩为离散标记(通常通过 VQ-VAE 式编码器),然后使用 Transformer 预测该标记序列。
哪些早期模型一次生成一个原始像素图像?
PixelRNN 和 PixelCNN 是自回归模型的先驱,可以逐像素扫描和预测图像。
什么机制可以确保 Transformer 在自回归生成过程中只关注较早的令牌?
因果屏蔽阻止每个位置关注未来的标记,从而强制执行从左到右的分解。
自回归图像采样的主要实际缺点是什么?
由于每个令牌都依赖于之前的令牌,因此推理必须逐个令牌运行,从而使得生成速度相对较慢。