视觉人工智能指南

图像抠图

图像抠图是一门以像素完美、半透明边缘从照片中剪切主题的艺术,捕捉每一缕缕头发或运动模糊。

阅读时间:2分钟最后更新

概述

Unlike simple segmentation, it estimates how much of each pixel belongs to the foreground.

深入探讨

抠图解决了合成方程:每个观察到的像素都是前景色和背景色的混合,并通过 0 到 1 之间的 alpha 值混合。目标是恢复 alpha 遮罩 - 一种软掩模,其中 1 是完全前景,0 是完全背景,小数值捕获模糊或半透明区域。这在数学上是不确定的,因此经典方法依赖于用户绘制的三元图来标记明确的前景、明确的背景和未知区域。 Deep Image Matting (2017) 等深度学习方法学习直接从图像和 trimap 预测 alpha,而 MODNet 和 Robust Video Matting 等较新的无 trimap 模型则仅根据肖像或网络摄像头输入实时估计遮罩。

技术洞察

核心模型是I = alpha*F + (1 - alpha)*B,其中I是像素,F和B是前景色和背景色,alpha是不透明度。由于三个已知(RGB 像素)和七个未知,该问题需要先验或指导。神经抠图网络使用编码器-解码器架构来回归 alpha,通常具有锐化边缘的单独细化阶段。损失将 alpha 预测误差与组合损失相结合,重新混合预测并将其与原始图像进行比较。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

图像抠图的未来

Matting 正在朝着全自动、实时、无三图操作的视频方向发展——已经为视频通话中的背景替换提供了动力。研究正在推动更高的分辨率、更好地处理玻璃和烟雾等复杂的透明度,以及与用于重新照明和无缝合成的生成模型更紧密的集成。期望抠图与基于扩散的编辑管道合并,以便剪切主题并将其放入新的、照明一致的场景中成为消费设备上的一个自动化步骤。

现实世界的实施

视频会议中的虚拟背景,实时替换扬声器后面的房间

影视绿屏合成,提取头发边缘干净的演员进行VFX

电商产品照片,自动将商品放在干净的白色背景上

手机应用程序中的肖像模式和贴纸创建,将人们排除在社交分享之外

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Image Matting quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

Imagen 文本到图像

常见问题

What is Image Matting?

图像抠图是一门以像素完美、半透明边缘从照片中剪切主题的艺术,捕捉每一缕缕头发或运动模糊。与简单的分割不同,它估计每个像素有多少属于前景。

图像抠图中的 alpha 遮罩代表什么?

Alpha 是每个像素的不透明度:1 是完整前景,0 是完整背景,分数捕获软或透明区域。

抠图与二值分割有何根本区别?

分割提供硬性前景/背景标签,而抠图则恢复连续的 Alpha 值以获得精细的半透明细节。

什么是经典抠图中的 trimap?

trimap 将图像划分为已知前景、已知背景和必须求解 alpha 的未知波段。

MODNet 和 Robust Video Matting 等模型有什么值得注意的地方?

这些较新的网络直接从肖像或视频中估计 alpha 遮罩,而不需要用户提供的 trimap。

在深度抠图中,哪种损失通常与 alpha 预测误差结合在一起?

合成损失使用预测的 alpha 重新合成前景和背景,并将结果与​​输入进行比较,从而提高准确性。