視覺人工智慧指南

Muse 蒙面產生成像

Muse 是來自 Google 的文字到圖像模型,它透過一次性填充蒙版圖像標記來產生圖片,使其比逐步擴散快得多。

閱讀時間約2分鐘最後更新

概述

It matters because it showed you can get high-quality, well-aligned images without the slow iterative denoising that most generators rely on.

深入探討

Muse 在影像的離散標記空間中運作。預先訓練的 VQGAN 將圖片轉換為整數標記網格,就像視覺構建塊的詞彙表一樣。在訓練過程中,這些標記的很大一部分被屏蔽掉,而 Transformer 會根據凍結的大型語言模型 (T5-XXL) 的文本嵌入來學習預測它們。在生成時,Muse 從全屏蔽網格開始並並行解碼,每一步預測許多標記並重新屏蔽最不可信的標記。兩階段設計首先產生低解析度標記網格,然後超解析度模型填滿更高解析度的網格。由於數十個令牌同時解析,因此 900M 和 3B 參數模型只需幾次前向傳遞即可產生 256 或 512 像素影像。

技術洞察

核心技巧是使用基於置信度的重新屏蔽進行並行解碼,通常稱為 MaskGIT 式取樣。 Muse 不是一次預測一個標記(自回歸)或數百次去噪(擴散),而是預測所有屏蔽標記,保留最有信心的標記,並在下一輪重新屏蔽其餘標記。使用凍結的 T5-XXL 文字編碼器可以免費提供強大的語言理解,並且對離散標記進行操作可以讓模型對圖像的推理更像單字。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

Muse Masked 產生成像的未來

屏蔽並行解碼指向高品質和真正快速的生成器,這對於在互動式編輯和設備上使用至關重要。預計標記預測的想法將與擴散和自回歸視訊方法相結合,並支援即時修復、覆蓋和無掩模編輯。隨著離散分詞器的改進,掩模成像可以乾淨地擴展到視訊和 3D,其中並行解碼可以大大降低生成許多幀或視圖的成本。

現實世界的實施

快速概念藝術和情緒板,藝術家需要在幾秒鐘而不是幾分鐘內進行許多圖像變化。

零鏡頭修復,例如移除物件並讓模型填滿與周圍環境一致的遮罩區域。

外塗,將照片延伸到其原始邊界之外,以顯示橫幅或不同的縱橫比。

無遮罩編輯,例如透過編輯文字提示並重新解碼受影響的標記來將狗的顏色或天空更改為日落。

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Muse Masked Generative Imaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

屏蔽自動編碼器

常見問題

What is Muse Masked Generative Imaging?

Muse 是來自 Google 的文字到圖像模型,它透過一次性填充蒙版圖像標記來產生圖片,使其比逐步擴散快得多。這很重要,因為它表明您可以獲得高品質、對齊良好的圖像,而無需大多數生成器所依賴的緩慢迭代去噪。

Muse 在生成過程中預測什麼而不是對像素進行去噪?

Muse 在離散令牌空間中運行,預測由 VQGAN 令牌生成器產生的屏蔽影像令牌,而不是直接處理像素。

為什麼 Muse 通常比標準擴散模型更快?

Muse 同時填充許多屏蔽標記,並且只需要少量的解碼輪次,這與擴散的許多順序去噪步驟不同。

Muse 從哪裡獲得對文字提示的理解?

Muse 條件是根據凍結的預訓練 T5-XXL 語言模型生成文字嵌入,從而賦予其強大的語言理解能力。

基於置信度的重新屏蔽在 Muse 中的作用是什麼?

每次並行預測後,Muse 都會保留最有信心的標記,並重新屏蔽最不自信的標記,以便在連續的輪次中進行改進。

Muse 如何處理產生更高解析度的影像?

Muse 首先產生一個低解析度的令牌網格,然後第二個超解析度模型產生一個更高解析度的令牌網格。