Fréchet Inception Distance(FID)是一种用于评估生成模型(如生成对抗网络(GAN)或扩散模型)所生成图像质量的度量标准。它衡量的是从真实图像集合中提取的特征分布与从生成图像集合中提取的特征分布之间的相似性。FID于2017年提出,现已成为评估图像生成模型(包括高分辨率模型如StyleGAN和各种扩散模型)的标准基准。
FID受早期Inception Score(IS)的启发,但IS仅评估生成图像的多样性和清晰度。相比之下,FID提供了更全面的比较,因为它还考虑了生成图像与真实数据分布的匹配程度。FID值越低,表示生成图像在特征统计上越接近真实图像;FID值越高,则表示生成图像质量较差或多样性不足。
概述
FID的目的是衡量生成模型相对于参考数据集(如ImageNet或COCO-2014)所生成图像的多样性和保真度。使用大型且多样的参考集至关重要,因为它代表了模型旨在生成的全部图像范围。生成模型产生的图像与训练集共享特征,但不与任何单一图像完全相同,因此逐像素比较(例如使用L2范数)是不充分的。
相反,FID将两组图像视为从两个多维高斯分布中抽取的样本。特征从Inception v3网络的倒数第二层池化层提取,该层能够捕捉关于物体和场景的高层语义信息。随后,使用Fréchet距离(也称为2-Wasserstein距离)计算这两个高斯分布之间的距离。
数学定义
对于定义在\(\mathbb{R}^n\)上的两个概率分布\(\mu\)和\(\nu\),且它们具有有限的均值和协方差,Fréchet距离定义为:
\[ d_F(\mu, \nu) = \left( \inf_{\gamma \in \Gamma(\mu, \nu)} \int_{\mathbb{R}^n \times \mathbb{R}^n} \|x - y\|^2 \, d\gamma(x, y) \right)^{1/2} \]
其中\(\Gamma(\mu, \nu)\)是所有边缘分布为\(\mu\)和\(\nu\)的联合分布(耦合)的集合。当两个分布均为高斯分布时,该公式简化为:
\[ d_F(\mathcal{N}(\mu, \Sigma), \mathcal{N}(\mu', \Sigma')) = \|\mu - \mu'\|_2^2 + \operatorname{tr}\left( \Sigma + \Sigma' - 2 (\Sigma \Sigma')^{1/2} \right) \]
在实际计算中,FID通过从真实图像集和生成图像集中分别提取2048维特征向量(取自Inception v3的最后一层池化层)来获得。然后,将这些特征的样本均值和协方差代入上述公式。如果模型完美,其特征分布将与真实分布相同,此时FID值为0。
应用与局限性
FID被广泛用于比较生成模型、调整超参数以及监控训练进度。在许多情况下,FID与人类对图像质量的感知有很好的相关性,但它也存在局限性。该度量依赖于Inception网络的特征,这可能无法捕捉视觉质量的所有方面。此外,它假设特征分布为高斯分布,而这一假设对于复杂的真实世界数据可能不成立。另外,FID对用于评估的样本数量较为敏感,因此通常需要在大量样本(例如10,000张或更多图像)上计算以保证稳定性。
相关度量
FID属于用于生成模型的基于分布的度量家族。Inception Score(IS)侧重于生成图像类别预测的熵,而Kernel Inception Distance(KID)则使用最大均值差异方法。近期的研究还探索了使用CLIP嵌入替代Inception特征,以更好地与语义相似性对齐。尽管存在局限性,FID仍然是生成建模领域中的标准评估工具。