視覺人工智慧指南

VQGAN 和 Codebook 影像合成

VQGAN 將圖像壓縮為從學習的碼本中提取的離散標記網格,讓轉換器以與語言模型生成文字相同的方式生成圖像。

閱讀時間約2分鐘最後更新

深入探討

VQGAN 在 2021 年論文「Taming Transformers for High-Resolution Image Synthesis」中介紹,將向量量化自動編碼器 (VQVAE) 與對抗性和感知訓練結合。編碼器將圖像映射到特徵向量的小網格;每個向量都被捕捉到學習的密碼本中最近的條目,例如 1024 個離散代碼,將圖像轉換為整數標記序列。解碼器根據這些標記重建圖像,並使用 GAN 判別器和感知損失進行訓練,因此重建看起來清晰而不是模糊。由於影像現在是離散的標記序列,因此自迴歸轉換器可以像語言一樣對它們進行建模,一一預測標記。當與 CLIP 指導配合使用時,VQGAN 為早期的文本到圖像藝術工具提供了強大的支援。

技術洞察

核心運算是向量量化:連續的編碼器輸出被它們最近的碼本向量替換,並帶有「直通」梯度估計器,因此儘管進行不可微查找,編碼器仍然可以學習。在自動編碼器之上添加基於補丁的 GAN 鑑別器,可以讓 VQGAN 使用比 VQVAE 小得多的令牌網格(例如 16x16),同時保持紋理清晰,使 Transformer 建模變得易於處理。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

VQGAN 和 Codebook 影像合成的未來

VQGAN 的離散令牌配方成為基於令牌的圖像和視訊模型的基礎,從 MaskGIT 到在一個變壓器中混合圖像和文字令牌的多模態系統。現在的研究正在推動更大的、有限標量或免查找的碼本,以避免碼本崩潰,並朝著統一的模型發展,其中相同的詞彙跨越圖像、音訊和語言,從而實現任意生成。

現實世界的實施

將照片編碼為 16x16 的密碼本標記網格,以便轉換器可以對其進行建模和重新生成

將 VQGAN 與 CLIP 指導結合,創造出 2021 年病毒式傳播的超現實「VQGAN+CLIP」人工智慧藝術

將影像壓縮為緊湊的離散程式碼,以進行高效儲存或下游生成訓練

用作較大的基於標記的生成器(如 MaskGIT 和多模態轉換器)內的圖像標記生成器

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQGAN and Codebook Image Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

SPADE語意影像合成

常見問題

What is VQGAN and Codebook Image Synthesis?

VQGAN 將圖像壓縮為從學習的碼本中提取的離散標記網格,讓轉換器以與語言模型生成文字相同的方式生成圖像。

VQGAN 使用什麼將影像表示為離散標記?

VQGAN 將編碼器特徵量化為學習碼本中最近的條目,將影像轉換為離散碼索引序列。

為什麼 VQGAN 在 VQVAE 之上添加 GAN 鑑別器?

對抗性和感知損失讓 VQGAN 從緊湊的令牌網格中重建清晰的圖像,而僅使用 VQVAE 就會使圖像變得模糊。

一旦影像是標記序列,什麼模型會產生新影像?

由於影像成為離散的標記序列,因此轉換器可以對它們進行自回歸建模,就像生成文字一樣。

什麼技術讓梯度流經不可微的量化步驟?

向量量化是不可微的,因此 VQGAN 使用直通梯度估計器來訓練編碼器。

VQGAN在2021年助力打造了哪些著名的AI藝術潮流?

將 VQGAN 與 CLIP 指導配對產生了廣泛共享的“VQGAN + CLIP”藝術,從而普及了文字驅動的圖像生成。