Traducido del inglés

La distancia de Fréchet inception (FID) es una métrica para evaluar modelos generativos de imágenes, comparando la distribución estadística de las imágenes generadas con las imágenes reales mediante características profundas de una red Inception.

La distancia de Fréchet (FID) es una métrica utilizada para evaluar la calidad de las imágenes creadas por un modelo generativo, como una red generativa adversarial (GAN) o un modelo de difusión. Introducida en 2017, la FID se ha convertido en la métrica estándar para evaluar generadores de imágenes sintéticas a partir de 2024. Compara la distribución de las imágenes generadas con la distribución de un conjunto de imágenes reales, conocido como conjunto de verdad fundamental, midiendo la distancia entre sus estadísticas de características extraídas de una red neuronal profunda. Una puntuación FID más baja indica que las imágenes generadas son más similares en calidad y diversidad a las imágenes de referencia reales, y una puntuación de 0 representa una coincidencia perfecta.

La métrica FID se inspiró en la puntuación de inicio (IS) anterior, pero aborda una limitación clave: la IS evalúa únicamente la distribución de las imágenes generadas sin compararla con datos reales. La FID, por el contrario, mide la similitud entre las distribuciones generada y real, proporcionando una evaluación más completa. Se ha adoptado ampliamente para comparar modelos como StyleGAN1, StyleGAN2 y varios modelos de difusión, y sigue siendo una piedra angular en la evaluación de modelos generativos.

Resumen

El propósito de la puntuación FID es medir la diversidad y fidelidad de las imágenes creadas por un modelo generativo en relación con un conjunto de datos de referencia. El conjunto de datos de referencia podría ser ImageNet o COCO-2014, y debe representar la diversidad completa de imágenes que el modelo pretende generar. Debido a que los modelos generativos producen imágenes novedosas que difieren de cualquier ejemplo de entrenamiento, la calidad no puede evaluarse mediante una comparación píxel a píxel, como se hace con la norma L2.

En su lugar, la FID modela los dos conjuntos de imágenes como si se hubieran extraído de dos distribuciones gaussianas multidimensionales, denotadas como \(\mathcal{N}(\mu, \Sigma)\) para las imágenes reales y \(\mathcal{N}(\mu', \Sigma')\) para las imágenes generadas. La distancia entre estas distribuciones se calcula como la distancia de Wasserstein de orden 2, que tiene en cuenta tanto las diferencias de medias como de covarianzas. Este enfoque captura no solo si las imágenes individuales parecen realistas, sino también si el conjunto generado cubre el mismo rango de variación que el conjunto real.

En lugar de comparar imágenes directamente en el espacio de píxeles, la FID utiliza una red neuronal convolucional, específicamente una arquitectura Inception v3, para extraer características de alto nivel. La capa más profunda, un vector de activación de 2048 dimensiones de la última capa de agrupación, se utiliza para representar cada imagen. Estas características corresponden a objetos del mundo real, como razas de perros o aviones, lo que hace que la comparación sea más significativa semánticamente que los píxeles brutos.

Después de procesar todas las imágenes a través de la red Inception, se calculan las medias y covarianzas de los vectores de activación tanto para el conjunto real como para el generado. La distancia FID viene dada entonces por la fórmula:

\[ d_F(\mathcal{N}(\mu, \Sigma), \mathcal{N}(\mu', \Sigma'))^2 = \lVert \mu - \mu' \rVert_2^2 + \operatorname{tr}\left(\Sigma + \Sigma' - 2(\Sigma \Sigma')^{1/2}\right) \]

Distancias más altas indican un modelo generativo más pobre, mientras que una puntuación de 0 indica un modelo perfecto que replica exactamente la distribución real.

Definición Formal

Para dos distribuciones de probabilidad cualesquiera \(\mu\) y \(\nu\) sobre \(\mathbb{R}^n\) con medias y varianzas finitas, la distancia de Fréchet se define como:

\[ d_F(\mu, \nu) := \left( \inf_{\gamma \in \Gamma(\mu, \nu)} \int_{\mathbb{R}^n \times \mathbb{R}^n} \lVert x - y \rVert^2 \, d\gamma(x, y) \right)^{1/2} \]

donde \(\Gamma(\mu, \nu)\) es el conjunto de todos los acoplamientos (distribuciones conjuntas) con marginales \(\mu\) y \(\nu\). Esta es la distancia de Wasserstein de orden 2, que tiene una solución de forma cerrada cuando ambas distribuciones son gaussianas. En el contexto de la FID, las distribuciones se aproximan como gaussianas utilizando las medias y covarianzas empíricas de los vectores de características, lo que hace que el cálculo sea manejable.

El uso de la distancia de Fréchet, en lugar de métricas más simples como la divergencia de Kullback-Leibler, permite a la FID capturar tanto el desplazamiento de la media como el desajuste de la covarianza, proporcionando una medida más matizada de la similitud distribucional.

Comparación con la Puntuación de Inicio

La métrica FID no reemplaza la puntuación de inicio (IS); más bien, la complementa. Los clasificadores que logran la mejor puntuación FID (la más baja) tienden a tener una mayor variedad de muestras, mientras que los clasificadores que logran la mejor puntuación IS (la más alta) tienden a tener una mejor calidad dentro de las imágenes individuales. Esta distinción surge porque la IS evalúa solo las imágenes generadas, recompensando a los modelos que producen predicciones de clase confiables y diversas, pero no penaliza a los modelos que generan imágenes fuera de la distribución objetivo. La FID, al comparar con un conjunto de referencia real, penaliza tanto la falta de fidelidad como la falta de diversidad.

En la práctica, los investigadores a menudo informan tanto la FID como la IS para proporcionar una imagen más completa del rendimiento del modelo. Sin embargo, la FID se ha convertido en la métrica preferida en muchos estudios recientes debido a su correlación más fuerte con la percepción humana de la calidad de la imagen.

Uso en la Evaluación de Modelos Generativos

La FID se ha utilizado para medir la calidad de muchos modelos recientes, incluidas las redes de alta resolución StyleGAN1 y StyleGAN2, y los modelos de difusión. Por ejemplo, StyleGAN2 logró puntuaciones FID de última generación en conjuntos de datos como FFHQ y LSUN, demostrando su capacidad para generar imágenes diversas y realistas. Los modelos de difusión, como DDPM y los modelos basados en puntuaciones, también se han evaluado utilizando la FID, logrando a menudo puntuaciones competitivas o superiores en comparación con las GAN.

La métrica es particularmente valiosa para comparar modelos entrenados en el mismo conjunto de datos, ya que proporciona una forma estandarizada de cuantificar el progreso. Sin embargo, la FID es sensible a la elección del conjunto de datos de referencia y al número de muestras utilizadas; usar muy pocas muestras puede llevar a estimaciones inestables. Los investigadores suelen utilizar miles de imágenes para calcular puntuaciones FID fiables.

Limitaciones y Críticas

A pesar de su uso generalizado, la FID tiene limitaciones. Asume que las distribuciones de características son gaussianas, lo que puede no cumplirse en la práctica, lo que lleva a posibles imprecisiones. Además, la FID se calcula utilizando una red Inception fija, que puede no capturar todos los aspectos de la calidad de la imagen, especialmente para dominios fuera de las imágenes naturales (por ejemplo, imágenes médicas o satelitales). La métrica también puede estar sesgada por el número de muestras, y no proporciona evaluaciones de calidad por imagen.

Trabajos recientes han propuesto alternativas, como el uso de incrustaciones CLIP en lugar de características Inception, para alinearse mejor con la similitud semántica. Estos enfoques buscan abordar algunas de las deficiencias de la FID, pero la FID sigue siendo el estándar de facto en el campo.

Implementación y Cálculo

Calcular la FID implica varios pasos. Primero, se selecciona un conjunto de datos de referencia de imágenes reales, y todas las imágenes se pasan a través de una red Inception v3 preentrenada para extraer los vectores de características de 2048 dimensiones. Lo mismo se hace para las imágenes generadas. Luego se calculan la media y la covarianza de los vectores de características para ambos conjuntos. Finalmente, se calcula la distancia de Fréchet utilizando la fórmula anterior.

En la práctica, las matrices de covarianza a menudo se regularizan para garantizar la estabilidad numérica, especialmente cuando el número de muestras es menor que la dimensión de las características. Existen implementaciones de código abierto en bibliotecas como PyTorch y TensorFlow, lo que facilita el cálculo de la FID para investigadores y profesionales.

Direcciones Futuras

A medida que los modelos generativos continúan evolucionando, las métricas de evaluación también deben adaptarse. Si bien la FID ha sido fundamental para avanzar en el campo, hay investigaciones en curso sobre métricas más robustas e interpretables. El uso de incrustaciones CLIP, como se mencionó, es una de esas direcciones. Además, se están explorando métricas que evalúan otros aspectos, como la equidad o la robustez. No obstante, la FID sigue siendo una herramienta clave en el conjunto de herramientas de aprendizaje automático para evaluar modelos generativos.

Para más lectura, consulte conceptos relacionados como puntuación de inicio, red generativa adversarial, modelo de difusión y StyleGAN. El desarrollo de la FID también está conectado con avances en aprendizaje profundo y visión por computadora.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:evaluation-metrics·generative-models·computer-vision
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial