視覺人工智慧指南

CycleGAN 不配對翻譯

CycleGAN 學習在兩個視覺域之間轉換影像(例如將馬轉換為斑馬,或將照片轉換為繪畫),而無需匹配的前後範例對。

閱讀時間約2分鐘最後更新

概述

It matters because collecting paired training data is often impossible, and CycleGAN unlocks style transfer for messy real-world datasets.

深入探討

CycleGAN 由 Zhu、Park、Isola 和 Efros 於 2017 年推出,可解決不配對的影像到影像的轉換問題。大多數早期的方法(如 pix2pix)需要精確的配對:與照片和草圖相同的場景。 CycleGAN 使用兩個生成器(G 將域 A 轉換為 B,F 將 B 轉換回 A)和兩個判斷每個域中真實性的判別器消除了此要求。突破在於循環一致性損失:如果你將馬照片翻譯成斑馬並將其翻譯回來,你應該恢復原始的馬。此約束阻止生成器發明任意輸出並強制有意義的、內容保留的對應。眾所周知,它將夏天的風景變成了冬天,把莫奈的畫變成了照片,把蘋果變成了橘子,所有這些都是從兩個不相關的圖像堆中學到的。

技術洞察

CycleGAN 將對抗性損失與循環一致性損失結合。每個生成器都面臨一個 PatchGAN 判別器,該判別器將重疊的影像區塊分類為真或假,而不是判斷整個影像。循環損失使用 L1 重建懲罰來強制執行關於 x 的 F(G(x)) 和關於 y 的 G(F(y))。當影像已經屬於目標域時,可選的身份遺失會保留顏色。兩個生成器同時訓練,學習保持結構完整的逆映射。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

CycleGAN 非配對翻譯的未來

CycleGAN 的核心思想——循環一致性——在現代非配對翻譯工作中得以延續,包括基於擴散的方法,將 GAN 主幹交換為具有更清晰、更多樣化輸出的去噪模型。研究人員現在將不成對翻譯應用於醫學成像(合成掃描模式)、自動駕駛模擬到真實傳輸的領域適應以及數據增強。期望對變化的內容和保持不變的內容進行更嚴格的控制,以及混合循環約束與文本條件擴散編輯的混合方法。

現實世界的實施

將照片變成莫內、梵谷或塞尚的繪畫風格,無需配對照片繪畫範例

將夏季風景照片轉換為冬季場景(反之亦然)以創建電影和遊戲資產

在無法進行配對患者掃描的醫學研究中將 MRI 掃描轉換為類似 CT 的影像

採用合成駕駛模擬器鏡頭使其看起來逼真,以訓練自動駕駛車輛感知

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CycleGAN Unpaired Translation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

Pix2Pix 影像到影像翻譯

常見問題

What is CycleGAN Unpaired Translation?

CycleGAN 學習在兩個視覺域之間轉換影像(例如將馬轉換為斑馬,或將照片轉換為繪畫),而無需匹配的前後範例對。這很重要,因為收集配對訓練資料通常是不可能的,而 CycleGAN 為混亂的現實世界資料集解鎖了風格遷移。

CycleGAN 解決了哪些像 pix2pix 這樣的早期方法無法解決的關鍵問題?

CycleGAN 的主要貢獻是不配對翻譯,從兩個不相關的圖像集合而不是精確的圖像對中學習域之間的映射。

循環一致性損失會強制執行什麼?

循環一致性意味著 F(G(x)) 應等於 x:一匹馬變成了斑馬,而背部應該看起來像原來的馬。

標準 CycleGAN 使用多少個生成器?

CycleGAN 使用兩個生成器,每個生成器對應一個平移方向(A 到 B 和 B 到 A),以及兩個判別器。

CycleGAN 通常使用哪種類型的判別器?

CycleGAN 使用 PatchGAN 判別器來判斷重疊補丁的真假,鼓勵局部現實主義。

為什麼 CycleGAN 中有時會新增身分損失?

當影像已位於目標域中時,身份遺失會懲罰不必要的更改,從而有助於保留顏色和色調。