MaskGIT 並行令牌解碼
MaskGIT 透過一次預測許多標記並首先填充最有信心的標記來產生影像,用一些快速並行步驟取代緩慢的從左到右生成。
深入探討
MaskGIT(Masked Generative Image Transformer),來自 2022 年的 Google,重新思考基於令牌的圖像模型如何解碼。早期的轉換器(例如 VQGAN)以自回歸方式產生標記,一次按光柵順序產生一個標記,這對於 2D 影像來說速度緩慢且不自然。相反,MaskGIT 使用 BERT 等屏蔽建模目標進行訓練:隱藏影像標記的隨機子集,模型學習使用雙向注意力同時預測它們。在生成時,它從完全屏蔽的網格開始,並以固定次數的迭代(通常是 8 到 12 次)進行解碼。每一步它都會預測每個被屏蔽的標記,保留最高置信度的預測,並為下一輪重新屏蔽其餘的。這產生高品質影像的步驟比自回歸解碼大約少一個數量級。
技術洞察
關鍵組成部分是基於置信度的屏蔽方案。餘弦時間表決定每次迭代顯示多少個令牌,開始緩慢並加速。因為注意力是雙向的,所以每個標記都會看到整個部分圖像,因此首先提交最有信心的預測可以讓後續步驟以可靠的上下文為條件,就像在解決模糊部分之前解決難題的簡單部分一樣。
戰略影響
速度與規模
視覺人工智慧可以大規模自動化檢查、檢測和標記任務。
配裝選擇
創意團隊可以透過更少的手動修改來更快地建立概念原型。
團隊與工作流程
操作可以使用以前難以處理的影像和視訊訊號。
MaskGIT 並行令牌解碼的未來
MaskGIT 的平行迭代解碼激發了一波非自回歸生成器的浪潮,包括用於文字到圖像的 MUSE 和用於視訊的屏蔽方法。該模式並行預測令牌並透過幾個步驟進行細化,介於一次性 GAN 和多步擴散之間,提供了可調節的質量與速度權衡。預計屏蔽令牌解碼將繼續出現在快速多模式產生器和編輯系統中,其中修復和條件填充是自然的選擇。
現實世界的實施
透過大約 8 到 12 個並行步驟產生完整影像,而不是數百個自回歸標記預測
透過僅重新預測具有周圍上下文的隱藏標記來修復照片的遮罩區域
ImageNet 上的類條件影像合成品質可與慢得多的模型相媲美
充當需要快速生成的文本到圖像系統(例如 Google 的 MUSE)的解碼骨幹
風險與防護欄
如果出處不明,肖像權和同意可能會成為法律風險。
模型表現可能因光照、人口統計和環境的不同而有所不同。
除非監控置信閾值,否則誤報可能會被忽略。
實施路線圖
定義精確度、召回率和錯誤成本的接受標準。
使用符合實際生產條件的數據進行測試。
為低置信度或高影響力的預測添加人工審核。
追蹤模型漂移並在相機或資料集變更後重新驗證。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the MaskGIT Parallel Token Decoding quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is MaskGIT Parallel Token Decoding?
MaskGIT 透過一次預測許多標記並首先填充最有信心的標記來產生影像,用一些快速並行步驟取代緩慢的從左到右生成。
MaskGIT 解碼影像標記與 VQGAN 轉換器有何不同?
MaskGIT 透過雙向注意力同時預測所有屏蔽標記,這與 VQGAN 緩慢的從左到右自回歸解碼不同。
MaskGIT 從語言模型中藉鏡了什麼訓練目標?
MaskGIT 隱藏標記的隨機子集並學習預測它們,這是類似於 BERT 的屏蔽建模目標。
在生成過程中,MaskGIT 在每次迭代時提交哪些令牌?
每個步驟都會保留最可信的預測並重新掩蓋其餘的預測,因此後續步驟會以可靠的上下文為條件。
MaskGIT 通常需要大約多少次迭代才能產生影像?
MaskGIT 以少量固定步驟進行解碼,通常為 8 到 12 個步驟,遠少於自回歸或擴散方法。
什麼時間表控制 MaskGIT 每一步顯示多少個令牌?
餘弦時間表在早期揭示了很少的標記,在後期揭示了更多的標記,從而平衡了迭代之間的質量和速度。