Traduit de l'anglais

La distance de Fréchet inception (FID) est une métrique qui évalue la qualité des images générées par des modèles génératifs en comparant les distributions statistiques des caractéristiques extraites d'images réelles et générées à l'aide d'un réseau Inception.

La distance de Fréchet inception (FID) est une métrique utilisée pour évaluer la qualité des images créées par un modèle génératif, tel qu'un réseau antagoniste génératif (GAN) ou un modèle de diffusion. Elle mesure la similarité entre la distribution des caractéristiques extraites d'un ensemble d'images réelles et celle des caractéristiques d'un ensemble d'images générées. La FID a été introduite en 2017 et est devenue une référence standard pour évaluer les modèles de génération d'images, y compris les modèles haute résolution comme StyleGAN et divers modèles de diffusion.

La FID s'inspire de l'indice de inception (IS) antérieur, qui n'évalue que la diversité et la clarté des images générées. Cependant, la FID offre une comparaison plus complète en prenant également en compte la manière dont les images générées correspondent à la distribution des données réelles. Une FID plus faible indique que les images générées sont plus similaires aux images réelles en termes de statistiques de caractéristiques, tandis qu'une FID plus élevée suggère une qualité moindre ou une diversité réduite.

Aperçu

L'objectif de la FID est de mesurer la diversité et la fidélité des images produites par un modèle génératif par rapport à un ensemble de référence, tel que ImageNet ou COCO-2014. L'utilisation d'un ensemble de référence vaste et diversifié est cruciale car il représente la gamme complète d'images que le modèle vise à générer. Les modèles génératifs produisent des images qui partagent des caractéristiques avec l'ensemble d'entraînement mais ne sont identiques à aucune image individuelle, de sorte que les comparaisons pixel par pixel (par exemple, en utilisant la norme L2) sont inadéquates.

Au lieu de cela, la FID modélise les deux ensembles d'images comme s'ils étaient tirés de deux distributions gaussiennes multidimensionnelles. Les caractéristiques sont extraites de la couche de pooling avant-dernière d'un réseau Inception v3, qui capture des informations sémantiques de haut niveau sur les objets et les scènes. La distance entre ces deux distributions gaussiennes est calculée à l'aide de la distance de Fréchet, également connue sous le nom de distance de Wasserstein-2.

Définition mathématique

Pour deux distributions de probabilité \(\mu\) et \(\nu\) sur \(\mathbb{R}^n\) avec des moyennes et des covariances finies, la distance de Fréchet est définie comme :

\[ d_F(\mu, \nu) = \left( \inf_{\gamma \in \Gamma(\mu, \nu)} \int_{\mathbb{R}^n \times \mathbb{R}^n} \|x - y\|^2 \, d\gamma(x, y) \right)^{1/2} \]

où \(\Gamma(\mu, \nu)\) est l'ensemble de tous les couplages (distributions conjointes) avec des marginales \(\mu\) et \(\nu\). Lorsque les deux distributions sont gaussiennes, cela se simplifie en :

\[ d_F(\mathcal{N}(\mu, \Sigma), \mathcal{N}(\mu', \Sigma')) = \|\mu - \mu'\|_2^2 + \operatorname{tr}\left( \Sigma + \Sigma' - 2 (\Sigma \Sigma')^{1/2} \right) \]

En pratique, la FID est calculée en extrayant des vecteurs de caractéristiques à 2048 dimensions de la dernière couche de pooling d'Inception v3 pour les ensembles d'images réelles et générées. La moyenne et la covariance de l'échantillon de ces caractéristiques sont ensuite insérées dans la formule ci-dessus. Un modèle parfait aurait des distributions de caractéristiques identiques, ce qui donnerait une FID de 0.

Applications et limites

La FID est largement utilisée pour comparer les modèles génératifs, ajuster les hyperparamètres et suivre la progression de l'entraînement. Elle corrèle bien avec la perception humaine de la qualité des images dans de nombreux cas, mais elle présente des limites. La métrique repose sur les caractéristiques du réseau Inception, qui peuvent ne pas capturer tous les aspects de la qualité visuelle, et elle suppose des distributions gaussiennes, ce qui peut ne pas être valable pour des données réelles complexes. De plus, la FID peut être sensible au nombre d'échantillons utilisés pour l'évaluation, elle est donc généralement calculée sur un grand ensemble (par exemple, 10 000 images ou plus) pour assurer sa stabilité.

Métriques connexes

La FID fait partie d'une famille de métriques basées sur les distributions pour les modèles génératifs. L'indice de inception se concentre sur l'entropie des prédictions de classe pour les images générées, tandis que la distance de noyau de inception (KID) utilise une approche de divergence maximale moyenne. Des travaux plus récents ont exploré l'utilisation d'embeddings CLIP au lieu des caractéristiques Inception pour mieux s'aligner sur la similarité sémantique. Malgré ses limites, la FID reste un outil standard dans le domaine de la modélisation générative.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:machine-learning·computer-vision·evaluation-metrics
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique