視覺人工智慧指南

圖像摳圖

影像摳圖是一門以像素完美、半透明邊緣從照片中剪切主題的藝術,捕捉每一縷頭髮或運動模糊。

閱讀時間約2分鐘最後更新

概述

Unlike simple segmentation, it estimates how much of each pixel belongs to the foreground.

深入探討

摳圖解決了合成方程式:每個觀察到的像素都是前景色和背景色的混合,並透過 0 到 1 之間的 alpha 值混合。目標是恢復 alpha 遮罩 - 一種軟掩模,其中 1 是完全前景,0 是完全背景,小數值捕獲模糊或半透明區域。這在數學上是不確定的,因此經典方法依賴使用者繪製的三元圖來標記明確的前景、明確的背景和未知區域。 Deep Image Matting (2017) 等深度學習方法學習直接從影像和 trimap 預測 alpha,而 MODNet 和 Robust Video Matting 等較新的無 trimap 模型則僅根據肖像或網路攝影機輸入即時估計遮罩。

技術洞察

核心模型是I = alpha*F + (1 - alpha)*B,其中I是像素,F和B是前景色和背景色,alpha是不透明度。由於三個已知(RGB 像素)和七個未知,該問題需要先驗或指導。神經摳圖網路使用編碼器-解碼器架構來回歸 alpha,通常具有銳化邊緣的單獨細化階段。損失將 alpha 預測誤差與組合損失相結合,重新混合預測並與原始影像進行比較。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

圖像摳圖的未來

Matting 正在朝著全自動、即時、無三圖操作的視訊方向發展——已經為視訊通話中的背景替換提供了動力。研究正在推動更高的分辨率、更好地處理玻璃和煙霧等複雜的透明度,以及與用於重新照明和無縫合成的生成模型更緊密的整合。期望摳圖與基於擴散的編輯管道合併,以便剪切主題並將其放入新的、照明一致的場景中成為消費設備上的一個自動化步驟。

現實世界的實施

視訊會議中的虛擬背景,即時替換揚聲器後面的房間

影視綠幕合成,提取頭髮邊緣乾淨的演員進行VFX

電商產品照片,自動將商品放在乾淨的白色背景上

手機應用程式中的肖像模式和貼紙創建,將人們排除在社交分享之外

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Image Matting quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

Imagen 文字到圖像

常見問題

What is Image Matting?

影像摳圖是一門以像素完美、半透明邊緣從照片中剪切主題的藝術,捕捉每一縷頭髮或運動模糊。與簡單的分割不同,它估計每個像素有多少屬於前景。

影像摳圖中的 alpha 遮罩代表什麼?

Alpha 是每個像素的不透明度:1 是完整前景,0 是完整背景,分數捕捉軟或透明區域。

摳圖與二值分割有何根本差異?

分割提供硬性前景/背景標籤,而摳圖則恢復連續的 Alpha 值以獲得精細的半透明細節。

什麼是經典摳圖中的 trimap?

trimap 將影像劃分為已知前景、已知背景和必須求解 alpha 的未知波段。

MODNet 和 Robust Video Matting 等模型有什麼值得注意的地方?

這些較新的網路直接從肖像或影片中估計 alpha 遮罩,而不需要使用者提供的 trimap。

在深度摳圖中,哪一種損失通常與 alpha 預測誤差結合在一起?

合成損失使用預測的 alpha 重新合成前景和背景,並將結果與輸入進行比較,從而提高準確性。