Una red generativa adversarial (GAN) es una clase de marcos de aprendizaje automático y un marco destacado para abordar la IA generativa. El concepto fue desarrollado inicialmente por Ian Goodfellow y sus colegas en junio de 2014. En una GAN, dos redes neuronales compiten entre sí en forma de un juego de suma cero, donde la ganancia de un agente es la pérdida de otro.
Dado un conjunto de entrenamiento, esta técnica aprende a generar nuevos datos con las mismas estadísticas que el conjunto de entrenamiento. Por ejemplo, una GAN entrenada con fotografías puede generar nuevas fotografías que parezcan al menos superficialmente auténticas para observadores humanos, con muchas características realistas. Aunque originalmente se propuso como una forma de modelo generativo para el aprendizaje no supervisado, las GAN también han demostrado ser útiles para el aprendizaje semi-supervisado, el aprendizaje totalmente supervisado y el aprendizaje por refuerzo.
La idea central de una GAN se basa en el entrenamiento "indirecto" a través del discriminador, otra red neuronal que puede decir cuán "realista" parece la entrada, que a su vez también se actualiza dinámicamente. Esto significa que el generador no se entrena para minimizar la distancia a una imagen específica, sino para engañar al discriminador. Esto permite que el modelo aprenda de manera no supervisada. Las GAN son similares al mimetismo en biología evolutiva, con una carrera armamentista evolutiva entre ambas redes.
Arquitectura y Entrenamiento
Una GAN consta de dos componentes principales: un generador y un discriminador. El generador es una red neuronal que toma ruido aleatorio de un espacio latente (a menudo una distribución normal multivariante) y lo mapea a una muestra de datos, como una imagen. El discriminador es otra red neuronal que recibe tanto muestras reales del conjunto de datos de entrenamiento como muestras sintéticas del generador, y produce una probabilidad de que una entrada dada sea real en lugar de generada.
El entrenamiento procede como un juego iterativo. El discriminador se entrena primero en un conjunto de datos conocido para distinguir lo real de lo falso con una precisión aceptable. Luego, el generador se entrena según si logra engañar al discriminador. Se aplican procedimientos independientes de retropropagación a ambas redes: el generador ajusta sus pesos para producir muestras más convincentes, mientras que el discriminador mejora su capacidad para señalar entradas sintéticas. Cuando se usa para la generación de imágenes, el generador suele ser una red neuronal deconvolucional, y el discriminador es una red neuronal convolucional.
La función objetivo para el juego GAN original se define sobre la distribución de referencia (datos reales) y la distribución del generador. El discriminador busca maximizar la log-probabilidad de clasificar correctamente entradas reales y falsas, mientras que el generador busca minimizar el mismo objetivo, intentando efectivamente hacer que el discriminador produzca 1 para muestras generadas. Esta formulación de suma cero impulsa a ambas redes a mejorar hasta que la distribución del generador se aproxime estrechamente a la distribución de referencia.
Formulación Matemática
Formalmente, el juego GAN se define en un espacio de probabilidad (Ω, μ_ref). El conjunto de estrategias del generador es el conjunto de todas las medidas de probabilidad μ_G en Ω, mientras que el conjunto de estrategias del discriminador consiste en núcleos de Markov desde Ω hasta medidas de probabilidad en [0,1]. La función objetivo es:
L(μ_G, μ_D) = E_{x~μ_ref, y~μ_D(x)}[ln y] + E_{x~μ_G, y~μ_D(x)}[ln(1-y)]
El generador busca minimizar este objetivo, aproximándose a μ_G ≈ μ_ref, mientras que el discriminador busca maximizarlo, produciendo valores cercanos a 1 para datos reales y cercanos a 0 para datos generados. Este juego minimax tiene un equilibrio teórico donde el generador replica perfectamente la distribución de referencia y el discriminador no puede hacer mejor que adivinar al azar.
Relación con Otros Modelos Generativos
Las GAN son modelos generativos implícitos, lo que significa que no modelan explícitamente la función de verosimilitud ni proporcionan un medio para encontrar la variable latente correspondiente a una muestra dada, a diferencia de alternativas como los modelos generativos basados en flujo. En comparación con las redes de creencias totalmente visibles como WaveNet y PixelRNN, y los modelos autorregresivos en general, las GAN pueden generar una muestra completa en una sola pasada, en lugar de requerir múltiples pasadas a través de la red.
A diferencia de las máquinas de Boltzmann y la ICA lineal, las GAN no imponen restricciones sobre el tipo de función utilizada por la red. Dado que las redes neuronales son aproximadores universales, las GAN son asintóticamente consistentes. A partir de 2026, los autoencoders variacionales también han demostrado ser aproximadores universales, pero las GAN siguen siendo distintas en su paradigma de entrenamiento adversarial. Este enfoque ha hecho que las GAN sean particularmente efectivas para tareas como la síntesis de imágenes, la transferencia de estilo y el aumento de datos, donde generar muestras realistas de alta dimensión es crítico.
Aplicaciones e Impacto
Las GAN han impulsado avances significativos en aplicaciones de aprendizaje profundo y aprendizaje automático. Se han utilizado ampliamente para generar imágenes realistas, incluyendo rostros, paisajes e imágenes médicas. En la investigación de inteligencia artificial, las GAN han permitido progresos en el aprendizaje semi-supervisado, donde los datos etiquetados son escasos, y en el aprendizaje por refuerzo, donde pueden modelar entornos o generar experiencias de entrenamiento.
El concepto de entrenamiento adversarial también ha influido en otras áreas, como los transformers y los grandes modelos de lenguaje, aunque esas arquitecturas utilizan objetivos de entrenamiento diferentes. Las GAN siguen siendo un marco fundamental en el modelado generativo, con investigación en curso que aborda desafíos como la inestabilidad del entrenamiento y el colapso de modos, donde el generador produce una variedad limitada. Su analogía de carrera armamentista evolutiva continúa inspirando nuevos métodos tanto en el ámbito académico como en la industria.
Limitaciones y Desafíos
A pesar de su poder, las GAN enfrentan varias dificultades conocidas. El entrenamiento puede ser inestable, ya que las dos redes deben mantenerse en equilibrio; si el discriminador se vuelve demasiado fuerte, el generador recibe gradientes que desaparecen, y si se vuelve demasiado débil, el generador puede no aprender de manera efectiva. El colapso de modos es otro problema común, donde el generador produce solo un subconjunto pequeño de las salidas posibles, sin capturar la diversidad completa de los datos de entrenamiento.
Evaluar el rendimiento de las GAN también es no trivial, ya que no hay una verosimilitud explícita que medir. Los investigadores suelen usar métricas como el Inception Score o la Distancia de Inception de Fréchet, pero estas tienen limitaciones. A partir de mediados de la década de 2020, los modelos generativos más nuevos, incluidos los modelos de difusión, han ganado popularidad para algunas tareas, pero las GAN siguen siendo un área activa de investigación, particularmente para aplicaciones en tiempo real y entornos donde la generación de una sola pasada es ventajosa.