弗雷谢起始距离
Fréchet 起始距离 (FID) 是判断一组生成图像的真实性和多样性的标准指标。
概述
它比较了深度特征空间中真实图像和生成图像的统计数据——分数越低,假图像看起来更接近真实。
深入探讨
FID,由 Heusel 等人提出。 2017 年,修复了早期 Inception Score 中的一个关键缺陷:它从未将生成的图像与实际数据进行比较。 FID 通过预训练的 Inception-v3 网络输入真实图像和生成图像,并从每个图像的深度池化层中读出 2048 维特征向量。然后,它将每组特征建模为多元高斯,并通过均值向量和协方差矩阵对它们进行汇总。两个高斯之间的距离是用 Fréchet 距离(也称为 2-Wasserstein 距离)计算的。较低的 FID 意味着生成的分布的均值和分布与真实图像紧密匹配,从而捕获保真度(它们看起来真实吗?)和多样性(它们是否涵盖了真实数据的多样性?)。
技术洞察
FID 公式是两个均值向量的平方差加上(协方差之和减去其乘积的矩阵平方根的两倍)的迹。由于 FID 使用完全协方差,因此它会惩罚模糊、不切实际的输出以及模型产生的变化太少的模式崩溃。它对样本大小很敏感——图像太少会使估计值偏高——因此从业者通常会在数万张图像(通常是 50,000 张)上进行计算。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
Fréchet 起始距离的未来
FID 仍然是该领域的默认选择,但其弱点正在推动替代方案的出现。研究人员已经证明它继承了 Inception-v3 的 ImageNet 偏差,并且可能与人类的判断不一致,从而引发了诸如根据 CLIP 特征计算的 FID(有时称为 FDD 或 CMMD)、小样本的内核初始距离 (KID) 以及区分保真度和多样性的精确度/召回率指标等指标。期待更丰富、与特征主干无关且感知一致的评估,特别是当文本到图像和视频生成不再需要单个数字摘要时。
现实世界的实施
对 StyleGAN 等 GAN 进行基准测试,团队在 FFHQ 等数据集上报告 FID,以比较面部生成质量。
通过在检查点计算 FID 来跟踪扩散模型的训练进度,以查看图像质量何时停止改善。
比较 COCO 数据集上的竞争文本到图像模型,其中较低的 FID 被认为是更真实输出的证据。
检测生成器中的模式崩溃,因为当模型产生的图像多样性太少时,FID 的协方差项就会上升。
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Fréchet Inception Distance quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
什么是弗雷谢起始距离?
Fréchet 起始距离 (FID) 是判断一组生成图像的真实性和多样性的标准指标。它比较了深度特征空间中真实图像和生成图像的统计数据——较低的分数意味着赝品看起来更接近真实的图像。
FID 分数较低表明什么?
FID 测量真实特征分布和生成特征分布之间的距离,因此较低的值意味着生成的特征集在保真度和多样性方面更接近真实数据。
标准 FID 使用哪个预训练网络来提取图像特征?
FID 通过预训练的 Inception-v3 网络传递图像,并将其 2048 维池化层特征用于真实图像和生成图像。
FID在比较每组图像特征之前如何总结它们?
每个特征集都被建模为多元高斯分布,FID 计算两个高斯分布之间的 Fréchet (2-Wasserstein) 距离。
FID 解决了 Inception Score 的哪些主要缺点?
Inception Score 仅单独评估生成的图像; FID 通过直接比较生成的图像分布和真实的图像分布对其进行了改进。
为什么当发电机发生模式崩溃时 FID 会上升?
FID 使用特征的完整协方差,因此当模型产生的多样性太少时,其分布会偏离真实数据,从而推高分数。