Traduzido do inglês

A distância de Fréchet inception (FID) é uma métrica que avalia a qualidade de imagens geradas por modelos generativos, comparando as distribuições estatísticas de características extraídas de imagens reais e geradas usando uma rede Inception.

A distância de Fréchet inception (FID) é uma métrica usada para avaliar a qualidade de imagens criadas por um modelo generativo, como uma rede adversária generativa (GAN) ou um modelo de difusão. Ela mede a similaridade entre a distribuição de características extraídas de um conjunto de imagens reais e a distribuição de características de um conjunto de imagens geradas. A FID foi introduzida em 2017 e tornou-se um padrão de referência para avaliar modelos de geração de imagens, incluindo modelos de alta resolução como StyleGAN e vários modelos de difusão.

A FID é inspirada na pontuação inception (IS), que avalia apenas a diversidade e a nitidez das imagens geradas. No entanto, a FID fornece uma comparação mais abrangente ao também considerar quão bem as imagens geradas correspondem à distribuição dos dados reais. Uma FID mais baixa indica que as imagens geradas são mais semelhantes às imagens reais em termos de estatísticas de características, enquanto uma FID mais alta sugere menor qualidade ou diversidade.

Visão geral

O objetivo da FID é medir a diversidade e a fidelidade das imagens produzidas por um modelo generativo em relação a um conjunto de dados de referência, como ImageNet ou COCO-2014. Usar um conjunto de referência grande e diversificado é crucial, pois ele representa a gama completa de imagens que o modelo pretende gerar. Modelos generativos produzem imagens novas que compartilham características com o conjunto de treinamento, mas não são idênticas a nenhuma imagem individual, portanto, comparações pixel a pixel (por exemplo, usando a norma L2) são inadequadas.

Em vez disso, a FID modela os dois conjuntos de imagens como se fossem amostrados de duas distribuições gaussianas multidimensionais. As características são extraídas da penúltima camada de pooling de uma rede Inception v3, que captura informações semânticas de alto nível sobre objetos e cenas. A distância entre essas duas distribuições gaussianas é calculada usando a distância de Fréchet, também conhecida como distância de Wasserstein-2.

Definição matemática

Para duas distribuições de probabilidade \(\mu\) e \(\nu\) sobre \(\mathbb{R}^n\) com médias e covariâncias finitas, a distância de Fréchet é definida como:

\[ d_F(\mu, \nu) = \left( \inf_{\gamma \in \Gamma(\mu, \nu)} \int_{\mathbb{R}^n \times \mathbb{R}^n} \|x - y\|^2 \, d\gamma(x, y) \right)^{1/2} \]

onde \(\Gamma(\mu, \nu)\) é o conjunto de todos os acoplamentos (distribuições conjuntas) com marginais \(\mu\) e \(\nu\). Quando ambas as distribuições são gaussianas, isso se simplifica para:

\[ d_F(\mathcal{N}(\mu, \Sigma), \mathcal{N}(\mu', \Sigma')) = \|\mu - \mu'\|_2^2 + \operatorname{tr}\left( \Sigma + \Sigma' - 2 (\Sigma \Sigma')^{1/2} \right) \]

Na prática, a FID é calculada extraindo vetores de características de 2048 dimensões da última camada de pooling da Inception v3 para ambos os conjuntos de imagens reais e geradas. A média e a covariância amostrais dessas características são então inseridas na fórmula acima. Um modelo perfeito teria distribuições de características idênticas, resultando em uma FID de 0.

Aplicações e limitações

A FID é amplamente usada para comparar modelos generativos, ajustar hiperparâmetros e monitorar o progresso do treinamento. Ela se correlaciona bem com a percepção humana de qualidade de imagem em muitos casos, mas tem limitações. A métrica depende das características da rede Inception, que podem não capturar todos os aspectos da qualidade visual, e assume distribuições gaussianas, o que pode não ser válido para dados complexos do mundo real. Além disso, a FID pode ser sensível ao número de amostras usadas na avaliação, por isso é tipicamente calculada em um conjunto grande (por exemplo, 10.000 ou mais imagens) para garantir estabilidade.

Métricas relacionadas

A FID faz parte de uma família de métricas baseadas em distribuição para modelos generativos. A pontuação inception concentra-se na entropia das previsões de classe para imagens geradas, enquanto a distância inception do kernel (KID) usa uma abordagem de discrepância máxima média. Trabalhos mais recentes exploraram o uso de embeddings do CLIP em vez das características da Inception para melhor alinhar com a similaridade semântica. Apesar de suas limitações, a FID continua sendo uma ferramenta padrão no campo da modelagem generativa.

Ver também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:machine-learning·computer-vision·evaluation-metrics
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico