視覺人工智慧指南

自回歸影像生成

自回歸影像產生一次建立一張圖片,從先前產生的所有內容中預測每個標記。

閱讀時間約2分鐘最後更新

概述

It matters because the same next-token machinery powering language models can produce coherent, controllable images.

深入探討

自回歸圖像生成將圖片視為序列並逐個元素預測它,其中每個新元素都以所有先前的元素為條件。 PixelRNN 和 PixelCNN 等早期工作每次都預測一個原始像素,逐行掃描,雖然速度很慢,但理論上是乾淨的。現代系統首先使用 VQ-VAE 式編碼器將影像壓縮為離散標記網格,然後 Transformer 從左到右預測這些標記。 OpenAI 的 DALL-E 1 和 Google 的 Parti 遵循此配方,產生以文字提示為條件的圖像標記,然後將其解碼回像素。最大的優點是精確的似然建模和與語言共享的統一架構。成本是連續的、緩慢的採樣。

技術洞察

此模型將所有標記的聯合機率分解為條件的乘積:p(x) = p(x_i 給定 x_1...x_{i-1}) 的乘積。具有因果(屏蔽)注意力的 Transformer 強制每個位置只能看到較早的標記。在訓練期間,它使用教師強制並行預測每個標記,但在推理時,它必須一次採樣一個標記,並將每個標記回饋回來。學習的密碼本將標記映射回圖像塊,解碼器將其上採樣為最終像素。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

自回歸影像生成的未來

速度是中心戰場。並行和屏蔽令牌解碼(MaskGIT、Muse)等技術可以同時產生許多令牌,並且從語言模型借用的推測性解碼正在適應圖像。研究人員也將文字和圖像標記統一在一個自回歸主幹中,以便一個模型可以讀取和繪圖,如多模態系統中所見。預計自回歸和擴散思想將繼續混合,混合模型捕獲代幣的可控性和擴散的品質。

現實世界的實施

DALL-E 1 透過從文字標題自回歸預測離散圖像標記網格來產生圖像。

Google 的 Parti 將自回歸文字到圖像 Transformer 擴展至 200 億個參數,以實現詳細、即時忠實的場景。

PixelCNN 和 PixelRNN 展示了原始的逐像素生成,並且仍然用作基於可能性的模型的教學基線。

MaskGIT 和 Muse 使用平行遮罩代幣解碼來加速基於代幣的影像合成,同時保持自迴歸式訓練。

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Autoregressive Image Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

人工智慧圖像生成

常見問題

What is Autoregressive Image Generation?

自回歸影像產生一次建立一張圖片,從先前產生的所有內容中預測每個標記。這很重要,因為為語言模型提供動力的相同的下一代機器可以產生連貫的、可控的圖像。

在影像生成的背景下「自回歸」意味著什麼?

自迴歸模型將影像分解為序列,根據先前產生的所有元素來預測每個標記或像素。

像 DALL-E 1 這樣的現代自回歸影像模型在預測影像之前通常如何表示影像?

現代系統將影像壓縮為離散標記(通常透過 VQ-VAE 式編碼器),然後使用 Transformer 預測該標記序列。

哪些早期模型一次產生一個原始像素影像?

PixelRNN 和 PixelCNN 是自迴歸模型的先驅,可以逐像素掃描和預測影像。

什麼機制可以確保 Transformer 在自迴歸產生過程中只專注於較早的代幣?

因果屏蔽阻止每個位置專注於未來的標記,從而強制執行從左到右的分解。

自回歸影像取樣的主要實際缺點是什麼?

由於每個令牌都依賴先前的令牌,因此推理必須逐一令牌運行,從而使得生成速度相對較慢。