译自英文

Fréchet inception距离(FID)是一种评估生成图像模型的指标,通过使用Inception网络的深度特征,比较生成图像与真实图像的统计分布。

Fréchet inception distance(FID)是一种用于评估生成模型(如生成对抗网络(GAN)或扩散模型)所创建图像质量的指标。FID于2017年提出,截至2024年已成为评估合成图像生成器的标准指标。它通过测量从深度神经网络提取的特征统计量之间的距离,将生成图像的分布与一组真实图像(称为真实参考集)的分布进行比较。较低的FID分数表示生成图像在质量和多样性上与真实参考图像更相似,分数为0则表示完全匹配。

FID指标受到早期inception score(IS)的启发,但它解决了一个关键局限性:IS仅评估生成图像的分布,而不与真实数据进行比较。相比之下,FID衡量生成分布与真实分布之间的相似性,提供了更全面的评估。它已被广泛用于对StyleGAN1、StyleGAN2和各种扩散模型等模型进行基准测试,并且仍然是生成模型评估中的基石。

概述

FID分数的目的是衡量生成模型相对于参考数据集所创建图像的多样性和保真度。参考数据集可以是ImageNet或COCO-2014,并且应代表模型旨在生成的全部图像多样性。由于生成模型产生的新图像与任何训练示例都不同,因此无法像使用L2范数那样通过逐像素比较来评估质量。

相反,FID将两组图像建模为从两个多维高斯分布中抽取的样本,分别表示为\(\mathcal{N}(\mu, \Sigma)\)(真实图像)和\(\mathcal{N}(\mu', \Sigma')\)(生成图像)。这些分布之间的距离通过2-Wasserstein距离计算,该距离同时考虑了均值和协方差差异。这种方法不仅捕捉单个图像是否看起来逼真,还捕捉生成集是否覆盖了与真实集相同的变异范围。

FID不是直接在像素空间中比较图像,而是使用卷积神经网络(具体为Inception v3架构)来提取高层特征。最深层,即最后一个池化层的2048维激活向量,用于表示每个图像。这些特征对应于现实世界中的对象,如狗品种或飞机,使得比较在语义上比原始像素更有意义。

在通过Inception网络处理所有图像后,计算真实集和生成集的激活向量的均值和协方差。然后,FID距离由以下公式给出:

\[ d_F(\mathcal{N}(\mu, \Sigma), \mathcal{N}(\mu', \Sigma'))^2 = \lVert \mu - \mu' \rVert_2^2 + \operatorname{tr}\left(\Sigma + \Sigma' - 2(\Sigma \Sigma')^{1/2}\right) \]

较高的距离表示生成模型较差,而分数为0表示完美模型,精确复制了真实分布。

正式定义

对于\(\mathbb{R}^n\)上具有有限均值和方差的任意两个概率分布\(\mu\)和\(\nu\),Fréchet距离定义为:

\[ d_F(\mu, \nu) := \left( \inf_{\gamma \in \Gamma(\mu, \nu)} \int_{\mathbb{R}^n \times \mathbb{R}^n} \lVert x - y \rVert^2 \, d\gamma(x, y) \right)^{1/2} \]

其中\(\Gamma(\mu, \nu)\)是所有以\(\mu\)和\(\nu\)为边缘分布的耦合(联合分布)的集合。这是2-Wasserstein距离,当两个分布均为高斯分布时,它具有闭式解。在FID的背景下,分布通过特征向量的经验均值和协方差近似为高斯分布,从而使计算变得可行。

使用Fréchet距离,而不是像Kullback-Leibler散度这样更简单的指标,使FID能够同时捕捉均值偏移和协方差失配,提供了更细致的分布相似性度量。

与Inception Score的比较

FID指标并不取代inception score(IS),而是对其进行补充。实现最佳(最低)FID分数的分类器往往具有更大的样本多样性,而实现最佳(最高)IS分数的分类器往往在单个图像内具有更好的质量。这种区别源于IS仅评估生成图像,奖励产生自信且多样化的类别预测的模型,但不会惩罚生成目标分布之外图像的模型。FID通过与真实参考集进行比较,同时惩罚保真度不足和多样性不足。

在实践中,研究人员通常同时报告FID和IS,以提供模型性能的更全面图景。然而,由于FID与人类对图像质量的感知具有更强的相关性,它已成为许多近期研究中的首选指标。

在生成模型评估中的应用

FID已被用于衡量许多近期模型的质量,包括高分辨率StyleGAN1和StyleGAN2网络,以及扩散模型。例如,StyleGAN2在FFHQ和LSUN等数据集上取得了最先进的FID分数,展示了其生成多样化和逼真图像的能力。扩散模型,如DDPM和基于分数的模型,也使用FID进行了评估,通常取得与GAN相比具有竞争力或更优的分数。

该指标在比较在同一数据集上训练的模型时特别有价值,因为它提供了一种标准化的方式来量化进展。然而,FID对参考数据集的选择和使用的样本数量敏感;使用过少的样本可能导致不稳定的估计。研究人员通常使用数千张图像来计算可靠的FID分数。

局限性与批评

尽管FID被广泛使用,但它存在局限性。它假设特征分布是高斯分布,这在实践中可能不成立,从而导致潜在的不准确性。此外,FID使用固定的Inception网络计算,这可能无法捕捉图像质量的所有方面,尤其是对于自然图像之外的领域(例如,医学或卫星图像)。该指标也可能因样本数量而产生偏差,并且它不提供逐图像的质量评估。

近期工作提出了替代方案,例如使用CLIP嵌入而不是Inception特征,以更好地与语义相似性对齐。这些方法旨在解决FID的一些缺点,但FID仍然是该领域的事实标准。

实现与计算

计算FID涉及几个步骤。首先,选择真实图像的参考数据集,并将所有图像通过预训练的Inception v3网络,以提取2048维特征向量。对生成图像执行相同操作。然后,计算两组特征向量的均值和协方差。最后,使用上述公式计算Fréchet距离。

在实践中,协方差矩阵通常进行正则化以确保数值稳定性,尤其是在样本数量小于特征维度时。开源实现可在PyTorch和TensorFlow等库中获得,使研究人员和从业者易于计算FID。

未来方向

随着生成模型的不断发展,评估指标也必须适应。虽然FID在推动该领域发展方面发挥了重要作用,但关于更稳健和可解释指标的研究仍在进行中。如前所述,使用CLIP嵌入是其中一个方向。此外,正在探索评估其他方面(如公平性或鲁棒性)的指标。尽管如此,FID仍然是Machine learning工具箱中评估生成模型的关键工具。

如需进一步阅读,请参见相关概念,如Inception ScoreGenerative adversarial networkDiffusion modelStyleGAN。FID的发展也与Deep learningComputer vision的进展相关。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:evaluation-metrics·generative-models·computer-vision
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史