Índice de Incepción

Traducido del inglés

El Inception Score (IS) es una métrica para evaluar la calidad de las imágenes generadas por modelos generativos, basada en la confianza y diversidad de las etiquetas predichas por un clasificador Inception v3 preentrenado. Se utiliza ampliamente en la investigación de redes generativas adversarias.

El Inception Score (IS) es un algoritmo utilizado para evaluar la calidad de las imágenes creadas por un modelo generativo, como una red generativa adversarial (GAN). Fue introducido en 2016 por Tim Salimans y sus colegas en un artículo sobre técnicas mejoradas para entrenar GANs. La puntuación se calcula a partir de la salida de un modelo de clasificación de imágenes Inception v3 preentrenado, aplicado a una muestra de (típicamente alrededor de 30,000) imágenes generadas por el modelo. El Inception Score se maximiza cuando se cumplen las siguientes condiciones: la entropía de la distribución de etiquetas predichas por el modelo Inception v3 para las imágenes generadas se minimiza (el modelo de clasificación predice con confianza una sola etiqueta para cada imagen, lo que corresponde a imágenes 'nítidas' o 'distintas'), y las predicciones del modelo de clasificación se distribuyen uniformemente entre todas las etiquetas posibles (lo que corresponde a una salida 'diversa'). Ha sido en gran medida superado por la relacionada distancia de Fréchet (FID). Mientras que el Inception Score solo evalúa la distribución de las imágenes generadas, la FID compara la distribución de las imágenes generadas con la distribución de un conjunto de imágenes reales ('verdad fundamental').

Definición

Sean dos espacios, el espacio de imágenes \(\Omega_X\) y el espacio de etiquetas \(\Omega_Y\). El espacio de etiquetas es finito. Sea \(p_{gen}\) una distribución de probabilidad sobre \(\Omega_X\) que deseamos evaluar. Sea un discriminador una función de tipo \(p_{dis}:\Omega_X \to M(\Omega_Y)\), donde \(M(\Omega_Y)\) es el conjunto de todas las distribuciones de probabilidad sobre \(\Omega_Y\). Para cualquier imagen \(x\) y cualquier etiqueta \(y\), sea \(p_{dis}(y|x)\) la probabilidad de que la imagen \(x\) tenga la etiqueta \(y\), según el discriminador. Generalmente se implementa como una red Inception-v3 entrenada en ImageNet.

El Inception Score de \(p_{gen}\) relativo a \(p_{dis}\) se define como:

\[ IS(p_{gen},p_{dis}) := \exp\left(\mathbb{E}_{x\sim p_{gen}}\left[D_{KL}\left(p_{dis}(\cdot|x)\|\int p_{dis}(\cdot|x)p_{gen}(x)dx\right)\right]\right) \]

Las reescrituras equivalentes incluyen:

\[ \ln IS(p_{gen},p_{dis}) := \mathbb{E}_{x\sim p_{gen}}\left[D_{KL}\left(p_{dis}(\cdot|x)\|\mathbb{E}_{x\sim p_{gen}}[p_{dis}(\cdot|x)]\right)\right] \]

En la práctica, la expectativa sobre \(p_{gen}\) se aproxima muestreando un conjunto finito de imágenes generadas, y la distribución marginal de etiquetas se estima a partir de esa muestra.

Interpretación

El Inception Score está diseñado para recompensar dos propiedades de las imágenes generadas: nitidez y diversidad. La nitidez se mide por la confianza del clasificador: si el clasificador asigna una alta probabilidad a una sola etiqueta para cada imagen, la distribución de etiquetas condicional \(p_{dis}(\cdot|x)\) tiene baja entropía, lo que aumenta la divergencia KL. La diversidad se mide por la uniformidad de la distribución marginal de etiquetas: si las imágenes generadas abarcan muchas clases, la distribución marginal es casi uniforme, lo que también aumenta la divergencia KL. Se aplica la función exponencial para facilitar la interpretación de la puntuación, donde un valor más alto indica una mejor calidad.

Uso en la evaluación de modelos generativos

El Inception Score se convirtió en una métrica estándar en la evaluación de GANs y otros modelos generativos, particularmente entre 2016 y 2018. Se utilizó en muchos artículos influyentes, incluidos aquellos sobre GANs progresivas, StyleGAN y otras arquitecturas. Los investigadores informaban los valores de IS en conjuntos de datos de referencia como CIFAR-10 e ImageNet para demostrar mejoras sobre trabajos anteriores.

Sin embargo, la puntuación ha sido criticada por varias razones. Primero, no compara las imágenes generadas con las imágenes reales, por lo que un modelo que produce un conjunto diverso de imágenes poco realistas podría obtener una puntuación alta. Segundo, la puntuación es sensible al clasificador preentrenado específico utilizado; diferentes versiones de Inception v3 o diferentes procedimientos de entrenamiento pueden producir puntuaciones diferentes. Tercero, la puntuación puede ser manipulada por modelos que producen imágenes con ciertos artefactos que el clasificador confunde con objetos reales.

Relación con la distancia de Fréchet

La distancia de Fréchet (FID), introducida en 2017 por Martin Heusel y sus colegas, se desarrolló para abordar algunas de las limitaciones del Inception Score. La FID calcula la distancia de Fréchet entre las distribuciones de características de las imágenes generadas y las reales, utilizando la penúltima capa de la red Inception v3 como extractor de características. A diferencia del IS, la FID compara la distribución generada con una distribución de referencia de imágenes reales, proporcionando una medida más completa de calidad y diversidad.

En la práctica, la FID ha reemplazado en gran medida al IS como la métrica preferida en muchos entornos de investigación, ya que se correlaciona mejor con el juicio humano y es menos propensa a la manipulación. No obstante, el IS sigue en uso, especialmente en contextos donde no se dispone de un conjunto de datos de referencia o cuando se necesita una métrica rápida y sencilla.

Limitaciones y críticas

Varios estudios han señalado las limitaciones del Inception Score. Por ejemplo, la puntuación no penaliza el colapso de modos, un modo de fallo común en las GANs donde el modelo genera solo unas pocas imágenes distintas. Si las imágenes generadas son nítidas pero no diversas, la distribución marginal de etiquetas puede seguir siendo algo uniforme si los modos colapsados abarcan muchas clases, pero en la práctica el colapso de modos a menudo reduce la diversidad y, por tanto, baja la puntuación. Sin embargo, la puntuación no puede distinguir entre un modelo que genera una distribución uniforme de todas las clases y uno que genera una sola imagen por clase con una nitidez perfecta.

Otra crítica es que el Inception Score no es invariante a la elección del clasificador. Diferentes clasificadores entrenados en diferentes conjuntos de datos pueden producir puntuaciones diferentes para el mismo conjunto de imágenes generadas. Esto dificulta la comparación de puntuaciones entre diferentes artículos a menos que se utilice exactamente el mismo clasificador.

Detalles de implementación

Para calcular el Inception Score, normalmente se utiliza un modelo Inception v3 preentrenado, disponible en bibliotecas como TensorFlow o PyTorch. El modelo se aplica a una muestra de imágenes generadas y se recogen las salidas softmax. Las distribuciones de etiquetas condicionales se utilizan entonces para calcular la divergencia KL con la distribución marginal, y se toma la exponencial de la media. El tamaño de la muestra suele fijarse en 30,000 imágenes, como se recomienda en el artículo original, para reducir la varianza.

En la práctica, la puntuación se calcula por lotes para evitar problemas de memoria, y la distribución marginal se estima a partir de toda la muestra. El cálculo es relativamente rápido, lo que lo hace adecuado para supervisar el progreso del entrenamiento.

Aplicaciones y extensiones

El Inception Score se ha aplicado más allá de las GANs a otros modelos generativos, como los autoencoders variacionales y los modelos de difusión, aunque su uso ha disminuido con el auge de la FID. También se ha extendido de diversas maneras, como el Inception Score modificado (mIS) utilizado en algunos trabajos, que ajusta el número de clases o utiliza un clasificador diferente.

En el contexto más amplio del aprendizaje automático y el aprendizaje profundo, el Inception Score representa un intento temprano de cuantificar la calidad de los modelos generativos, un desafío que sigue abierto. Se han propuesto otras métricas, como la precisión y la recuperación para modelos generativos, para proporcionar información más granular.

Contexto histórico

El Inception Score fue introducido en el artículo 'Improved Techniques for Training GANs' de Tim Salimans, Ian Goodfellow, Wojciech Zaremba, Vicki Cheung, Alec Radford y Xi Chen, publicado en 2016. El artículo también introdujo otras técnicas como el emparejamiento de características y la discriminación por mini-lotes. La puntuación ganó popularidad rápidamente debido a su simplicidad y a la falta de métricas alternativas en ese momento.

Desde entonces, el campo de la modelización generativa ha evolucionado significativamente, con el desarrollo de modelos y métodos de evaluación más sofisticados. El Inception Score sigue siendo un hito histórico y todavía se referencia en muchos libros de texto y tutoriales sobre modelos generativos.

Véase también

  • aprendizaje automático
  • red neuronal
  • aprendizaje profundo
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:generative-models·evaluation-metrics·machine-learning·computer-vision
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial