译自英文

Fréchet inception距离(FID)是一种度量标准,通过使用Inception网络提取真实图像和生成图像的特征,并比较这些特征的统计分布,来评估生成模型生成的图像质量。

弗雷歇初始距离(FID)是一种用于评估生成模型(如生成对抗网络(GAN)或扩散模型)所创建图像质量的指标。它衡量从一组真实图像中提取的特征分布与从一组生成图像中提取的特征分布之间的相似性。FID 于 2017 年提出,并已成为评估图像生成模型的标准基准,包括 StyleGAN 等高清模型以及各种扩散模型。

FID 的灵感来源于早期的初始分数(IS),后者仅评估生成图像的多样性和清晰度。然而,FID 通过同时考虑生成图像与真实数据分布的匹配程度,提供了更全面的比较。较低的 FID 表明生成图像在特征统计方面与真实图像更相似,而较高的 FID 则暗示质量较差或多样性不足。

概述

FID 的目的是衡量生成模型相对于参考数据集(如 ImageNet 或 COCO-2014)所生成图像的多样性和保真度。使用大型且多样的参考集至关重要,因为它代表了模型旨在生成的全部图像范围。生成模型会产生与训练集共享特征但不与任何单一图像完全相同的新颖图像,因此逐像素比较(例如使用 L2 范数)并不充分。

相反,FID 将两组图像视为从两个多维高斯分布中抽取的样本。特征从 Inception v3 网络的倒数第二层池化层中提取,该层捕获关于物体和场景的高层语义信息。这两个高斯分布之间的距离使用弗雷歇距离(也称为 2-瓦瑟斯坦距离)计算。

数学定义

对于 \(\mathbb{R}^n\) 上具有有限均值和协方差的两个概率分布 \(\mu\) 和 \(\nu\),弗雷歇距离定义为:

\[ d_F(\mu, \nu) = \left( \inf_{\gamma \in \Gamma(\mu, \nu)} \int_{\mathbb{R}^n \times \mathbb{R}^n} \|x - y\|^2 \, d\gamma(x, y) \right)^{1/2} \]

其中 \(\Gamma(\mu, \nu)\) 是所有以 \(\mu\) 和 \(\nu\) 为边缘分布的耦合(联合分布)的集合。当两个分布均为高斯分布时,该式简化为:

\[ d_F(\mathcal{N}(\mu, \Sigma), \mathcal{N}(\mu', \Sigma')) = \|\mu - \mu'\|_2^2 + \operatorname{tr}\left( \Sigma + \Sigma' - 2 (\Sigma \Sigma')^{1/2} \right) \]

在实践中,FID 通过从 Inception v3 的最后一个池化层为真实图像集和生成图像集分别提取 2048 维特征向量来计算。然后将这些特征的样本均值和协方差代入上述公式。完美的模型应具有相同的特征分布,从而得到 FID 为 0。

应用与局限性

FID 被广泛用于比较生成模型、调整超参数以及监控训练进度。在许多情况下,它与人类对图像质量的感知具有良好的相关性,但也存在局限性。该指标依赖于 Inception 网络的特征,可能无法捕捉视觉质量的所有方面,并且它假设高斯分布,而这一假设对于复杂的真实世界数据可能不成立。此外,FID 对用于评估的样本数量敏感,因此通常在大规模样本集(例如 10,000 张或更多图像)上计算以确保稳定性。

相关指标

FID 是基于分布的生成模型指标家族的一部分。初始分数关注生成图像类别预测的熵,而核初始距离(KID)采用最大均值差异方法。近期的研究探索了使用 CLIP 嵌入而非 Inception 特征,以更好地对齐语义相似性。尽管存在局限性,FID 仍是生成建模领域的标准工具。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·computer-vision·evaluation-metrics
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史