潛在擴散模型
潛在擴散模型透過在壓縮的潛在空間而不是原始像素中運行擴散過程來產生影像,從而大幅削減計算成本。
概述
They are the engine behind Stable Diffusion and most modern open-source image generators.
深入探討
標準擴散模型學習逆轉雜訊過程:它從純雜訊開始,逐漸去雜訊為影像。直接在像素上執行此操作的成本很高,因為 512x512 影像具有數十萬個值。 Rombach 及其同事在 2022 年提出的潛在擴散技術,首先使用預先訓練的變分自動編碼器 (VAE) 將影像壓縮為小型潛在網格(通常為 64x64x4,約小 48 倍)。然後,擴散 U-Net 在文字的交叉注意力引導下,學習在緊湊的潛在空間內進行去雜訊。最後,VAE 解碼器重建全解析度像素。這種感知壓縮保留了語義上有意義的訊息,同時丟棄了難以察覺的細節,從而在消費級 GPU 上實現高品質生成。
技術洞察
關鍵技巧是將感知壓縮與生成建模分開。 VAE 處理一次高頻像素細節,而 U-Net 僅對較低維度的潛在分佈進行建模。文本調節是透過交叉注意力層注入的,其中 U-Net 的空間特徵負責來自 CLIP 等文本編碼器的標記嵌入。由於潛在影像大約比像素小 48 倍,因此每個去雜訊步驟的記憶體和 FLOP 成本都顯著降低。
戰略影響
速度與規模
視覺人工智慧可以大規模自動化檢查、檢測和標記任務。
配裝選擇
創意團隊可以透過更少的手動修改來更快地建立概念原型。
團隊與工作流程
操作可以使用以前難以處理的影像和視訊訊號。
潛在擴散模型的未來
潛在擴散正在從影像擴展到視訊(穩定視訊擴散)、3D 資產和音訊頻譜圖,所有這些都使用相同的壓縮然後降噪配方。研究正在推動透過蒸餾和一致性模型來減少採樣步驟、保留精細文本和臉孔的更好 VAE,以及穩定擴散 3 中的整流流公式,以拉直生成軌跡以獲得更快、更清晰的結果。
現實世界的實施
穩定擴散在單一消費級 GPU 上根據文字提示生成藝術作品和概念設計
Adobe 和 Canva 支援基於潛在擴散主幹的文字到圖像和生成填充功能
遊戲工作室製作紋理貼圖、精靈和環境概念藝術以加速預製作
庫存圖像和行銷團隊無需拍攝照片即可創建品牌產品模型和廣告視覺效果
風險與防護欄
如果出處不明,肖像權和同意可能會成為法律風險。
模型表現可能因光照、人口統計和環境的不同而有所不同。
除非監控置信閾值,否則誤報可能會被忽略。
實施路線圖
定義精確度、召回率和錯誤成本的接受標準。
使用符合實際生產條件的數據進行測試。
為低置信度或高影響力的預測添加人工審核。
追蹤模型漂移並在相機或資料集變更後重新驗證。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Latent Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Latent Diffusion Models?
潛在擴散模型透過在壓縮的潛在空間而不是原始像素中運行擴散過程來產生影像,從而大幅削減計算成本。它們是穩定擴散和大多數現代開源影像生成器背後的引擎。
與像素空間擴散相比,潛在擴散模型的主要創新是什麼?
潛在擴散使用 VAE 將影像壓縮到較小的潛在空間中,因此昂貴的去雜訊發生在比完整像素少得多的值上。
哪個組件將影像壓縮到潛在空間並隨後重建它?
預先訓練的 VAE 將影像編碼為緊湊的潛在網格,其解碼器最後重建全解析度像素。
文字通常如何在潛在擴散中註入去噪 U-Net 中?
來自文字編碼器的標記嵌入被輸入交叉注意層,讓空間特徵專注於提示。
為什麼在潛在空間中操作可以降低計算成本?
等等——正確的原因是潛在網格比像素圖像小得多(通常約為 48 倍),因此每個去噪步驟需要的 FLOP 和內存要少得多。
哪種廣泛使用的開源模型普及了潛在擴散?
Stable Diffusion 於 2022 年發布,為消費性硬體帶來了潛在的擴散和大規模採用。