视觉人工智能指南

知觉损失和 LPIPS

感知损失通过比较深度神经网络特征而不是原始像素来衡量两幅图像与人类的相似程度。

阅读时间:2分钟最后更新

概述

It matters because pixel-by-pixel comparison wrongly punishes tiny shifts and blurs detail, while perceptual loss rewards sharp, realistic results.

深入探讨

像 L2(均方误差)这样的传统损失会逐像素比较图像,因此一个像素的偏移或稍微不同的纹理看起来像是一个巨大的错误,即使人类几乎没有注意到。感知损失通过预训练网络(通常是 VGG)运行两个图像,并比较中间层的激活。由于这些特征对边缘、纹理和对象部分进行编码,而不是精确的像素值,因此损失可以更好地与人类判断保持一致,从而鼓励清晰、语义上忠实的输出。 LPIPS(学习感知图像块相似度),由Zhang等人提出。 2018 年,它正式化了这一点:它提取深层特征,对其进行标准化,并应用根据数千个人类相似性判断校准的学习权重,产生单个距离分数,其中越低意味着感知上越相似。

技术洞察

LPIPS 通过固定主干网(VGG、AlexNet 或 SqueezeNet)传递两个图像,对多个层的通道激活进行单元归一化,然后在每个空间位置求平方差。在对这些差异进行空间平均并跨层求和之前,一小部分学习的每通道权重会缩放这些差异。这些权重是在人类二选一强制选择判断的 BAPPS 数据集上进行训练的,因此该指标反映了人们实际感知的内容,而不是原始特征距离。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

知觉损失和 LPIPS 的未来

感知指标正在从 CNN 主干转向 DINO 和 CLIP 等自监督和视觉转换器模型的特征,这些模型捕获更丰富的语义。预计与扩散模型训练和文本到图像评估的更紧密集成,以及针对视频时间一致性调整的感知分数。研究人员还在探索 LPIPS 的盲点:它可能会被对手愚弄,并且与非常高保真度的质量相关性较弱,从而激发了新的人类对齐指标,例如 DISTS 和集成方法。

现实世界的实施

训练超分辨率网络(例如 SRGAN),使放大的照片看起来清晰且有纹理,而不是模糊。

通过对解码图像在感知上与原始图像的接近程度进行评分来评估图像压缩和编解码器。

指导风格转换,其中内容通过深度 VGG 特征而不是精确像素进行匹配。

通过报告生成图像和真实图像之间的 LPIPS 距离对 GAN 和扩散图像生成器进行基准测试。

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Perceptual Loss and LPIPS quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

不平衡检测的焦点损失

常见问题

What is Perceptual Loss and LPIPS?

感知损失通过比较深度神经网络特征而不是原始像素来衡量两幅图像与人类的相似程度。这很重要,因为逐像素比较错误地惩罚了微小的变化并模糊了细节,而感知损失则奖励了清晰、真实的结果。

与感知损失相比,为什么基于像素的 L2 损失经常误判图像相似性?

L2 直接比较像素,因此即使图像对人来说看起来不错,小的空间偏移或纹理差异也会被记录为大错误。

LPIPS 主要比较两个图像之间的什么?

LPIPS 从固定主干中提取深层特征激活并测量它们的距离,这比像素更符合人类感知。

LPIPS 中每个通道的权重是如何确定的?

学习权重以匹配人类两个替代强制选择相似决策的大型数据集(BAPPS)。

哪个骨干网络最常与经典感知(特征)损失相关?

VGG 的中间特征图成为超分辨率和风格迁移等任务中感知损失的标准。

哪项任务最直接受益于使用感知损失而不是纯粹的 L2?

经过感知损失训练的超分辨率网络会产生更清晰、更真实的纹理,而 L2 往往会产生模糊的平均值。