視覺人工智慧指南

VQ-VAE 和離散潛伏

VQ-VAE 將影像、音訊或視訊壓縮為從學習的碼本中提取的離散程式碼的小網格,而不是連續的數字。

閱讀時間約2分鐘最後更新

概述

This discrete bottleneck lets powerful sequence models like Transformers treat media as 'tokens', much like words.

深入探討

VQ-VAE(向量量化變分自動編碼器)由 DeepMind 的 van den Oord 及其同事於 2017 年提出,是一種潛在空間離散的自動編碼器。編碼器將影像轉換為連續向量的網格;然後,每個向量都會被捕捉到學習的嵌入碼本中最近的條目(向量量化)。解碼器根據這些量化程式碼重建影像。由於潛在變數現在是索引的有限詞彙,因此單獨的模型可以學習它們的分佈並產生新內容。這個兩階段配方為 DALL-E 1、音樂點唱機和 VQGAN 提供動力,它增加了感知和對抗性損失,以實現更清晰的重建。 VQ-VAE-2堆疊多種解析度以產生高保真影像。

技術洞察

量化步驟(argmin 最近鄰查找)是不可微的,因此 VQ-VAE 使用直通估計器:梯度直接從解碼器輸入複製回編碼器輸出,就好像量化是恆等式一樣。訓練結合了重建損失、將嵌入拉向編碼器輸出的碼本損失以及使編碼器致力於其所選代碼的承諾損失。常見的故障是碼本崩潰,即僅使用了少數代碼。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

VQ-VAE 和離散潛在變數的未來

離散潛在變數是推動統一多模態模型的核心,該模型將圖像、音訊和視訊標記為與文字相同的詞彙表。殘差和有限標量量化、更大的碼本和更好的使用平衡等改進正在減少崩潰並提高保真度。由於模型的目標是跨模態理解和生成,基於 VQ-VAE 思想的強大分詞器仍將是一個基本要素,其競爭日益激烈,並與連續潛在擴散方法相結合。

現實世界的實施

DALL-E 1 使用離散 VQ-VAE 分詞器,因此 Transformer 可以產生圖像作為碼本索引序列。

VQGAN 將 VQ-VAE 與對抗性和感知損失相結合,為藝術生成生成清晰、高解析度的影像標記。

OpenAI 的 Jukebox 將 VQ-VAE 應用於原始音頻,將音樂壓縮為離散代碼以進行生成建模。

VQ-VAE-2 堆疊分層離散潛在影像來合成多樣化的高保真影像,可與同時代的 GAN 相媲美。

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQ-VAE and Discrete Latents quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

潛在混合和圖像插值

常見問題

What is VQ-VAE and Discrete Latents?

VQ-VAE 將影像、音訊或視訊壓縮為從學習的碼本中提取的離散程式碼的小網格,而不是連續的數字。這種離散瓶頸使得像 Transformer 這樣強大的序列模型能夠將媒體視為“令牌”,就像單字一樣。

VQ-VAE 的潛在空間與標準 VAE 的潛在空間有何不同?

VQ-VAE 使用透過向量量化從學習的碼本中提取的離散代碼來替換連續潛在變數。

VQ-VAE 如何透過不可微量化步驟傳遞梯度?

直通估計器將解碼器輸入梯度直接複製到編碼器輸出,將量化視為後向傳遞的恆等式。

什麼是「密碼本崩潰」?

當模型僅依賴少數程式碼時,就會發生碼本崩潰,浪費了大部分碼本並損害了多樣性。

為什麼離散潛在變數對於使用 Transformer 進行生成建模很有用?

離散索引形成有限的詞彙表,因此 Transformer 等序列模型可以像單字一樣學習和取樣它們的分佈。

VQGAN 在基本 VQ-VAE 配方之上添加了什麼?

VQGAN 透過鑑別器和感知損失增強了 VQ-VAE,從而產生更清晰、更詳細的重構標記。