視覺人工智慧指南

GAN 的逐步發展

漸進式生長透過從微小分辨率開始並逐漸添加層以達到高解析度影像來訓練 GAN。

閱讀時間約2分鐘最後更新

概述

這很重要,因為它首次讓穩定且百萬像素品質的GAN合成成為實際可行。

深入探討

由卡拉斯等人介紹。 (NVIDIA) 2017 年,漸進式成長 (ProGAN) 解決了直接以高解析度訓練 GAN 的不穩定和緩慢問題。生成器和鑑別器都從很小的 4x4 像素開始,只學習大規模結構。然後,在訓練過程中,將解析度加倍(8x8、16x16、最高 1024x1024)的新層對稱地添加到兩個網路中。至關重要的是,每個新層都使用線性 alpha 混合來平滑淡入,因此網路不會因突然的架構變化而受到衝擊。透過在精細細節之前學習粗略特徵,訓練更加穩定,收斂速度更快,並產生使 CelebA-HQ 結果聞名的高保真面孔。論文還引入了小批量標準差和均衡學習率來進一步穩定訓練。

技術洞察

淡入是核心技巧。當添加更高解析度的區塊時,其輸出會使用從 0 到 1 的權重 alpha 與先前解析度的上取樣版本混合。這可以讓新層的權重逐漸預熱,而不是破壞網路已經學到的內容。鑑別器中發生對稱過程。小批量標準差附加了一個總結批次變化的功能,防止生成器崩潰到有限的輸出。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

GAN 漸進發展的未來

漸進式增長是 StyleGAN 的基礎,但 StyleGAN2 後來表明,具有跳躍連接和殘差塊的固定架構可以在沒有分階段時間表的情況下達到其質量,因此顯式增長不再受歡迎。更深層的遺產仍然存在:從粗到細的生成現在出現在多尺度擴散、級聯超分辨率管道和潛在空間放大器中。理解漸進式成長對於理解為什麼分層的、從低頻到高頻的學習能夠穩定產生訓練仍然很有價值。

現實世界的實施

產生高解析度 CelebA-HQ 臉部影像,展示 1024x1024 GAN 合成。

大規模生成臥室 (LSUN) 和物體等其他領域的高品質樣本。

作為 StyleGAN 擴展用於可控臉部生成的架構起點。

教導在級聯和多尺度生成管道中重複使用的從粗到細的訓練原理。

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Progressive Growing of GANs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

什麼是GAN的漸進式種植?

漸進式生長透過從微小分辨率開始並逐漸添加層以達到高解析度影像來訓練 GAN。這很重要,因為它首次使穩定、百萬像素品質的 GAN 合成變得實用。

逐漸成長的 GAN 如何開始訓練?

訓練從 4x4 開始,網路在添加更高解析度的層之前學習粗略結構。

逐漸提高解析度的主要好處是什麼?

與從一開始就攻擊全解析度相比,學習粗略特徵首先可以穩定訓練並加速收斂。

當添加新的更高解析度層時,它是如何引入的?

線性淡入將新層的輸出與上採樣的低解析度輸出混合在一起,以便網路逐漸適應。

為什麼要在生成器和鑑別器中添加層?

兩個網路同步增長,因此鑑別器可以繼續以生成器的當前解析度評估影像。

ProGAN 中引入小批量標準差層的目的是什麼?

它附加了有關批次變化的統計數據,鼓勵生成器產生不同的輸出而不是崩潰。