基礎知識指南

變分自動編碼器

變分自編碼器 (VAE) 是一種生成神經網絡,它學習將資料壓縮到平滑的機率潛在空間,然後從中重建或產生新的範例。

閱讀時間約2分鐘最後更新

概述

They matter because they gave deep learning one of its first principled, sampleable models of data — powering image generation, anomaly detection, and the latent spaces inside modern diffusion models.

深入探討

VAE 有兩個部分:編碼器將輸入(例如圖像)映射到機率分佈(通常是具有學習均值和方差的高斯分佈),而不是將輸入(例如圖像)映射到單點;解碼器從從該分佈採樣的點重建輸入。訓練優化了證據下界(ELBO),它平衡了兩個壓力:重建精度(輸出應該類似於輸入)和 KL 散度正則化器,它將每個輸入的潛在分佈拉向標準正態。這種正則化是關鍵技巧:它迫使潛在空間連續且密集,以便解碼附近的隨機點產生合理的新樣本,而不是無意義的。這種平滑性正是 VAE 與一般自動編碼器的差異。

技術洞察

巧妙的工程是重新參數化技巧。您無法透過隨機採樣步驟進行反向傳播,因此 VAE 不是直接從 N(mu, sigma squared) 採樣 z,而是計算 z = mu + sigma * epsilon,其中 epsilon 是從固定標準法線中提取的。隨機性現在存在於 epsilon 中,epsilon 是輸入而不是參數,因此梯度可以乾淨地流過 mu 和 sigma,並且可以使用普通的隨機梯度下降來訓練編碼器。

戰略影響

更明確的決策

它可以幫助您將清晰的技術聲明與行銷語言分開。

成本與預算

在花費金錢或時間之前,您可以提出更好的實施問題。

團隊與工作流程

具有共同理解的團隊可以做出更好的產品、政策和學習決策。

變分自動編碼器的未來

純 VAE 很少能產生最清晰的影像,但它們的影響無所不在。穩定擴散等潛在擴散模型在 VAE 壓縮的潛在空間內運行擴散,從而大幅削減計算量。具有離散碼本的 VQ-VAE 支援許多饋入變壓器的音訊和影像標記器。期望 VAE 繼續作為大型生成系統下的高效、結構化壓縮層,並繼續在分子和蛋白質設計等科學領域中使用,在這些領域,平滑、可插值的潛在空間真正有用。

現實世界的實施

穩定擴散使用 VAE 將影像壓縮到實際發生擴散去噪的緊湊潛在空間中,然後解碼回像素。

透過標記 VAE 重建的輸入來偵測製造缺陷或詐欺交易,因為異常情況超出了習得的常態分佈。

透過在藥物研究中的化學潛在空間中平穩行走來產生和插入新型藥物分子。

透過學習健康解剖結構的低維表示,對 MRI 掃描等醫學影像進行壓縮和去噪。

風險與防護欄

不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。

基準測試可能看起來很強大,但實際效能卻參差不齊。

忽視數據品質和評估計劃通常會產生脆弱的結果。

實施路線圖

1

從您需要的結果的簡單語言定義開始。

2

在測試之前選擇一種成功指標和一種失敗條件。

3

使用代表性資料運行小型試點,而不是完善的演示集。

4

記錄變分自動編碼器在哪些方面有幫助以及在哪些方面更簡單的方法更好。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Variational Autoencoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

自動編碼器

常見問題

What is Variational Autoencoders?

變分自編碼器 (VAE) 是一種生成神經網絡,它學習將資料壓縮到平滑的機率潛在空間,然後從中重建或產生新的範例。它們很重要,因為它們為深度學習提供了第一個有原則的、可採樣的資料模型之一——為影像生成、異常檢測和現代擴散模型內的潛在空間提供動力。

對於給定的輸入,VAE 中的編碼器輸出什麼?

與普通自動編碼器不同,VAE 編碼器輸出分佈參數(通常是高斯均值和方差),然後從該分佈中取樣一個點。

重新參數化技巧的目的是什麼?

透過編寫 z = mu + sigma * epsilon(其中 epsilon 從固定法線繪製),隨機性被轉移到輸入,因此反向傳播可以流經 mu 和 sigma。

VAE 損失中的 KL 散度項鼓勵什麼?

KL 項將每個輸入的潛在分佈標準化為標準常態分佈,保持潛在空間平滑連續,以便取樣產生合理的輸出。

為什麼 VAE 可以產生新樣本,而普通自動編碼器通常不能?

KL 正則化使潛在空間變得平滑且密集,因此對隨機點進行採樣並對其進行解碼會產生一個連貫的新範例。

在穩定擴散這樣的潛在擴散模型中,VAE 發揮什麼作用?

與直接在像素空間中工作相比,在 VAE 壓縮的潛在空間內運行擴散可顯著減少計算量。