视觉人工智能指南

部分通路自回归成像

Parti(自回归文本到图像的路径)以语言模型编写句子的方式生成图片:一次一个图像标记,根据之前的所有图像预测下一个图像标记。

阅读时间:2分钟最后更新

概述

It matters because it showed that simply scaling a sequence model can produce strikingly detailed, prompt-faithful images.

深入探讨

Parti 将图像生成视为序列到序列的翻译问题,就像机器翻译一样。 ViT-VQGAN 标记器首先将图像编码为从学习的码本中提取的离散标记序列。 Transformer 编码器读取文本提示,然后 Transformer 解码器自回归生成图像令牌,每个令牌都以文本和之前发出的令牌为条件。生成所有标记后,标记器的解码器将重建像素。 Google 将 Parti 从 3.5 亿个参数扩展至 200 亿个参数,并且图像质量和文本对齐随着尺寸的变化而稳步提高。 20B 模型可以处理长的组合提示、呈现清晰的文本并尊重细节。 Parti 还推出了 PartiPrompts 基准,这是一组涵盖多个类别和难度级别的 1,600 多个具有挑战性的提示。

技术洞察

定义特征是对离散视觉标记的纯自回归:该模型将图像分解为条件下一个标记概率的产物,其本质与 GPT 风格的文本生成相同。这将视觉和语言统一在一个训练方案中,并让它继承了数十年的序列建模技巧。成本是顺序解码,因为令牌必须按顺序生成,这使得生成速度比并行方法慢,但它可预测地扩展并直接受益于更大的模型。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

部分通路自回归成像的未来

自回归成像正在复兴,因为相同的主干可以将文本、图像、音频和视频建模为一个令牌流,从而实现真正统一的多模态模型。研究正在通过推测性解码、并行标记预测和更好的标记器来解决其主要弱点,即缓慢的顺序采样。期待通用助理内部的自回归核心能够交错阅读、推理和图像生成,并看到缩放法则进一步推动构图准确性和可靠的图像内文本渲染。

现实世界的实施

根据长描述性提示渲染复杂的多对象场景,例如动物、物体和背景的特定排列。

生成包含清晰书面文字或符号的图像,其中自回归排序有助于正确拼写文本。

使用 PartiPrompts 套件跨世界知识和抽象概念等类别对文本到图像系统进行基准测试和压力测试。

为需要精确计数和许多元素之间的空间关系的提示制作详细的插图。

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Parti Pathways Autoregressive Imaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

自回归图像生成

常见问题

What is Parti Pathways Autoregressive Imaging?

Parti(自回归文本到图像的路径)以语言模型编写句子的方式生成图片:一次一个图像标记,根据之前的所有图像预测下一个图像标记。这很重要,因为它表明,简单地缩放序列模型就可以产生极其详细、迅速忠实的图像。

Parti 如何生成图像?

Parti 是自回归的:它按顺序生成图像标记,每个标记都以文本和先前生成的标记为条件。

Parti 使用什么整体框架来执行文本到图像任务?

Parti 将生成视为机器翻译:编码器读取文本,解码器发出图像标记,这是一种经典的序列到序列设置。

将 Parti 参数扩展至 200 亿个参数证明了什么?

随着 Parti 从 350M 参数增长到 20B 参数,保真度和提示忠实度均得到改善,包括更好的构图提示和清晰的文本。

是什么将图像转换为 Parti 的离散标记?

Parti 使用 ViT-VQGAN 将图像编码为离散标记序列,然后 Transformer 解码器学习预测。

Parti 自回归解码的主要缺点是什么?

由于每个令牌都依赖于前一个令牌,因此生成是连续的,并且比并行方法慢,尽管它的扩展是可预测的。