Inception Score(初始分数)

译自英文

Inception Score(IS)是评估生成模型所生成图像质量的指标,基于预训练的Inception v3分类器预测标签的置信度和多样性。它广泛应用于生成对抗网络研究中。

Inception Score(IS)是一种用于评估生成式图像模型(如生成对抗网络(GAN))所创建图像质量的算法。它由Tim Salimans及其同事在2016年一篇关于改进GAN训练技术的论文中提出。该分数基于一个独立的、预训练的Inception v3图像分类模型对生成模型生成的样本(通常约为30,000张图像)的输出进行计算。当满足以下条件时,Inception Score达到最大值:Inceptionv3模型对生成图像预测的标签分布的熵最小化(分类模型对每张图像自信地预测单个标签,对应于图像“清晰”或“独特”),并且分类模型的预测在所有可能标签上均匀分布(对应于输出“多样化”)。它已在某种程度上被相关的Fréchet inception distance(FID)所取代。虽然Inception Score仅评估生成图像的分布,但FID将生成图像的分布与一组真实图像(“真实数据”)的分布进行比较。

Inception Score是Generative AI领域中广泛使用的指标,特别是在评估GAN和其他生成模型的性能时。它提供一个单一的标量值,旨在捕捉生成图像的质量和多样性,使其便于比较不同模型或训练过程。然而,它存在已知的局限性,包括对预训练分类器选择的敏感性以及缺乏与真实图像的比较,而FID解决了这些问题。

定义

设存在两个空间,图像空间\(\Omega_X\)和标签空间\(\Omega_Y\)。标签空间是有限的。设\(p_{gen}\)是\(\Omega_X\)上的一个概率分布,我们希望对其进行评判。设判别器为类型为\(p_{dis}:\Omega_X \to M(\Omega_Y)\)的函数,其中\(M(\Omega_Y)\)是\(\Omega_Y\)上所有概率分布的集合。对于任何图像\(x\)和任何标签\(y\),根据判别器,\(p_{dis}(y|x)\)是图像\(x\)具有标签\(y\)的概率。它通常实现为在ImageNet上训练的Inception-v3网络。

相对于\(p_{dis}\)的\(p_{gen}\)的Inception Score定义为:

\[ IS(p_{gen},p_{dis}) := \exp\left(\mathbb{E}_{x\sim p_{gen}}\left[D_{KL}\left(p_{dis}(\cdot|x)\|\int p_{dis}(\cdot|x)p_{gen}(x)dx\right)\right]\right) \]

等价改写包括:

\[ \ln IS(p_{gen},p_{dis}) := \mathbb{E}_{x\sim p_{gen}}\left[D_{KL}\left(p_{dis}(\cdot|x)\|\mathbb{E}_{x\sim p_{gen}}[p_{dis}(\cdot|x)]\right)\right] \]

在实践中,对\(p_{gen}\)的期望通过抽取有限的生成图像样本来近似,标签的边际分布则从该样本中估计。

直觉与解释

Inception Score旨在奖励生成图像的两个属性:清晰度和多样性。清晰度通过分类器的置信度来衡量:如果分类器为每张图像分配高概率给单个标签,则条件标签分布\(p_{dis}(\cdot|x)\)具有低熵,这增加了KL散度。多样性通过边际标签分布的均匀性来衡量:如果生成图像涵盖许多类别,则边际分布接近均匀分布,这也增加了KL散度。应用指数函数是为了使分数更易于解释,数值越高表示质量越好。

该分数以Inception v3模型命名,这是Google开发的用于图像分类的深度卷积神经网络。该模型用作固定的特征提取器,其预测作为人类对图像内容感知的代理。

在生成模型评估中的使用

Inception Score成为评估GAN和其他生成模型的标准指标,特别是在2016年至2018年期间。它被用于许多有影响力的论文中,包括关于渐进式GAN、StyleGAN和其他架构的论文。研究人员会在CIFAR-10和ImageNet等基准数据集上报告IS值,以展示相对于先前工作的改进。

然而,该分数因几个原因受到批评。首先,它不将生成图像与真实图像进行比较,因此生成多样化但不真实图像的模型仍可能获得高分。其次,该分数对所使用的特定预训练分类器敏感;不同版本的Inception v3或不同的训练过程可能产生不同的分数。第三,该分数可能被生成具有某些伪影(分类器误认为是真实物体)的图像的模型所利用。

与Fréchet Inception Distance的关系

Fréchet inception distance(FID)由Martin Heusel及其同事于2017年提出,旨在解决Inception Score的一些局限性。FID使用Inception v3网络的倒数第二层作为特征提取器,计算生成图像和真实图像特征分布之间的Fréchet距离。与IS不同,FID将生成分布与真实图像的参考分布进行比较,提供了更全面的质量和多样性度量。

在实践中,FID已在许多研究环境中基本取代IS成为首选指标,因为它与人类判断的相关性更好,且更不易被利用。尽管如此,IS仍在使用,特别是在没有参考数据集或需要快速简单指标的情况下。

局限性与批评

多项研究强调了Inception Score的局限性。例如,该分数不惩罚模式崩溃,这是GAN常见的失败模式,即模型仅生成少数几个不同的图像。如果生成的图像清晰但不多样,边际标签分布可能仍然有些均匀,如果崩溃的模式恰好跨越许多类别,但在实践中,模式崩溃通常会降低多样性,从而降低分数。然而,该分数无法区分生成所有类别均匀分布的模型和生成每类单张图像且完美清晰的模型。

另一个批评是Inception Score对分类器的选择不是不变的。在不同数据集上训练的不同分类器可能对同一组生成图像产生不同的分数。这使得除非使用完全相同的分类器,否则难以比较不同论文中的分数。

实现细节

要计算Inception Score,通常使用预训练的Inception v3模型,可在TensorFlow或PyTorch等库中获得。将该模型应用于生成的图像样本,并收集softmax输出。然后使用条件标签分布计算与边际分布的KL散度,并取均值的指数。样本大小通常设置为30,000张图像,如原始论文所建议,以减少方差。

在实践中,分数以批次计算以避免内存问题,边际分布从整个样本中估计。计算相对快速,使其适合监控训练进度。

应用与扩展

Inception Score已应用于GAN之外的生成模型,如变分自编码器和扩散模型,尽管随着FID的兴起,其使用有所下降。它也已以各种方式扩展,例如某些工作中使用的修改版Inception Score(mIS),它调整了类别数量或使用不同的分类器。

Machine learningDeep learning的更广泛背景下,Inception Score代表了对生成模型质量进行量化的早期尝试,这仍然是一个开放的挑战。其他指标,如生成模型的精确率和召回率,已被提出以提供更细粒度的信息。

历史背景

Inception Score在Tim Salimans、Ian Goodfellow、Wojciech Zaremba、Vicki Cheung、Alec Radford和Xi Chen于2016年发表的论文《Improved Techniques for Training GANs》中提出。该论文还介绍了其他技术,如特征匹配和小批量判别。由于当时缺乏替代指标,该分数迅速流行起来。

自那时起,生成建模领域已显著发展,出现了更复杂的模型和评估方法。Inception Score仍然是一个历史里程碑,并在许多关于生成模型的教科书和教程中被引用。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-models·evaluation-metrics·machine-learning·computer-vision
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史