視覺人工智慧指南

DDPM 和 DDIM 採樣器

DDPM 和 DDIM 是運行擴散模型的逆過程的兩種方法,將隨機雜訊逐步轉換為影像。

閱讀時間約2分鐘最後更新

概述

DDPM是原始隨機配方; DDIM 是一種更快、確定性的快捷方式,可以用更少的步驟產生類似的圖像。

深入探討

透過逐漸向影像添加高斯雜訊來訓練擴散模型,然後學習預測該雜訊。抽樣扭轉了這一點。 DDPM(去噪擴散機率模型,Ho et al. 2020)會回溯每個噪聲級別,在每個步驟中添加一些新的隨機噪聲,因此通常需要數百到一千個步驟。 DDIM(去噪擴散隱式模型,Song 等人,2021)重複使用完全相同的訓練網絡,但遵循非馬可夫確定性軌跡。透過丟棄注入的隨機性,DDIM 可以跳過許多時間步長,並且仍然可以在 10-50 個步長內獲得高品質影像。由於 DDIM 是確定性的,因此相同的起始雜訊始終會產生相同的影像,從而實現平滑插值和再現性。

技術洞察

兩個取樣器都使用一個網路來預測在時間步 t 新增到影像中的雜訊 epsilon。 DDPM 的更新減去該預測的縮放版本,然後加入從後驗中提取的方差雜訊。 DDIM 重寫更新以首先估計乾淨影像 x0,然後將其重新投影到沒有隨機項目的下一個(較小的)時間步長。參數 eta 將兩者混合在一起:eta=1 恢復 DDPM,eta=0 給出完全確定性 DDIM。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

DDPM 和 DDIM 採樣器的未來

採樣器研究正朝著一步或幾步產生的方向發展。 DPM-Solver 和 DPM-Solver++ 等高階 ODE 求解器已將質量採樣減少到 20 個步驟以下,而蒸餾方法(漸進式蒸餾、一致性模型、潛在一致性)則將模型壓縮為 1-4 步生成器。預計 DDPM/DDIM 仍將保持概念基線,而生產系統則依靠精煉和自適應求解器在消費性硬體上進行即時影像和視訊合成。

現實世界的實施

穩定的擴散影像生成,其中 DDIM 作為 Automatic1111 和 ComfyUI 等工具中文字到影像提示的快速預設取樣器提供。

可重現的藝術管道,使用確定性 DDIM 修復隨機種子,因此相同的提示和種子始終會重新生成相同的圖像。

透過 DDIM 從雜訊到輸出的確定性映射,可以在兩個影像之間實現平滑的潛在空間插值以實現變形動畫。

快速創意迭代,設計人員使用 20 步驟 DDIM 預覽來探索概念,然後再進行更慢、保真度更高的全步渲染。

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DDPM and DDIM Samplers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

弗雷謝起始距離

常見問題

什麼是 DDPM 和 DDIM 採樣器?

DDPM 和 DDIM 是運行擴散模型的逆過程的兩種方法,將隨機雜訊逐步轉換為影像。 DDPM是原始隨機配方; DDIM 是一種更快、確定性的快捷方式,可以用更少的步驟產生類似的圖像。

DDIM 相對於 DDPM 的主要實際優勢是什麼?

DDIM 遵循確定性的非馬可夫軌跡,使其可以跳過許多時間步,以大約 10-50 個步驟(而不是數百個步驟)產生高品質影像。

擴散模型的神經網路在訓練過程中實際上學會預測什麼?

此網路經過訓練可以預測每個時間步驟所添加的高斯雜訊 (epsilon),然後 DDPM 和 DDIM 使用該雜訊來反轉該過程。

為什麼 DDIM 每次都能從相同的起始雜訊產生完全相同的影像?

DDIM 在其更新中刪除了隨機雜訊項,使得從雜訊到影像的路徑完全確定,因此可重現。

在 DDIM 中,參數 eta 的什麼值可以恢復原始的隨機 DDPM 行為?

eta 參數在兩個採樣器之間進行內插:eta=1 給出完全的 DDPM 隨機性,而 eta=0 給出完全確定的 DDIM。

原始 DDPM 通常需要多少步驟才能獲得高品質樣本?

DDPM 會回溯每個噪音級別,增加隨機性,因此通常需要數百到一千個反向步驟。