Un modelo basado en energía (EBM, por sus siglas en inglés), también llamado aprendizaje de conjunto canónico (CEL) o aprendizaje mediante conjunto canónico (LCE), es una aplicación de la formulación de conjunto canónico de la física estadística para aprender de datos. Este enfoque aparece de manera prominente en la IA generativa. Los EBM proporcionan un marco unificado para muchos enfoques probabilísticos y no probabilísticos de dicho aprendizaje, particularmente para entrenar modelos gráficos y otros modelos estructurados. Un EBM aprende las características de un conjunto de datos objetivo y genera un conjunto de datos similar pero más grande. Los EBM detectan las variables latentes de un conjunto de datos y generan nuevos conjuntos de datos con una distribución similar. Las redes neuronales generativas basadas en energía son una clase de modelos generativos que buscan aprender distribuciones de probabilidad explícitas de los datos en forma de modelos basados en energía, cuyas funciones de energía están parametrizadas por redes neuronales profundas modernas. Las máquinas de Boltzmann son una forma especial de modelos basados en energía con una parametrización específica de la energía.
Formulación Matemática
Para una entrada dada \(x\), el modelo describe una energía \(E_\theta(x)\) tal que la distribución de Boltzmann \(P_\theta(x) = e^{-\beta E_\theta(x)} / Z(\theta)\) es una probabilidad (densidad), y típicamente \(\beta = 1\). La constante de normalización \(Z(\theta) := \int_{x \in X} e^{-\beta E_\theta(x)} dx\), también conocida como función de partición, depende de todos los factores de Boltzmann de todas las entradas posibles \(x\), lo que la hace computacionalmente intratable para datos de alta dimensionalidad. Esta intratabilidad complica la estimación de máxima verosimilitud estándar.
Sin embargo, el gradiente de la log-verosimilitud para un solo ejemplo de entrenamiento \(x\) se puede expresar como:
\[
\partial_\theta \log P_\theta(x) = \mathbb{E}_{x' \sim P_\theta}[\partial_\theta E_\theta(x')] - \partial_\theta E_\theta(x)
\]
Este gradiente consiste en una fase positiva (la energía de los datos observados) y una fase negativa (la energía esperada bajo la distribución del modelo). La expectativa en la fase negativa se aproxima típicamente muestreando de \(P_\theta\) utilizando métodos de Monte Carlo con cadenas de Markov (MCMC).
Entrenamiento mediante Divergencia Contrastiva
Los primeros modelos basados en energía, como la máquina de Boltzmann de 2003 de Hinton, estimaban la expectativa mediante muestreo de Gibbs bloqueado. Los enfoques más nuevos utilizan la Dinámica de Langevin Estocástica (LD) más eficiente, muestreando mediante:
\[
x_0' \sim P_0, \quad x_{i+1}' = x_i' - \frac{\alpha}{2} \frac{\partial E_\theta(x_i')}{\partial x_i'} + \epsilon
\]
donde \(\epsilon \sim \mathcal{N}(0, \alpha)\). Se utiliza un búfer de reproducción de valores pasados \(x_i'\) con LD para inicializar el módulo de optimización. Los parámetros \(\theta\) de la red neuronal se entrenan de manera generativa mediante estimación de máxima verosimilitud basada en MCMC. El proceso de aprendizaje sigue un esquema de "análisis por síntesis": dentro de cada iteración de aprendizaje, el algoritmo muestrea ejemplos sintetizados del modelo actual mediante un método MCMC basado en gradientes (por ejemplo, dinámica de Langevin o Monte Carlo Híbrido), y luego actualiza los parámetros \(\theta\) para reducir la energía de los datos observados mientras aumenta la energía de los datos muestreados.
Relación con Otros Modelos Generativos
Los modelos basados en energía ofrecen una alternativa flexible a otros enfoques generativos. A diferencia de los modelos de IA generativa que generan datos directamente (por ejemplo, grandes modelos de lenguaje o transformadores), los EBM definen una distribución de probabilidad no normalizada. Esto les permite modelar dependencias complejas sin requerir una verosimilitud tratable. Están estrechamente relacionados con las redes neuronales cuando la función de energía está parametrizada por una red profunda, lo que lleva a redes neuronales generativas basadas en energía. Las máquinas de Boltzmann, incluidas las máquinas de Boltzmann restringidas, son un caso especial donde la función de energía tiene una estructura bipartita específica.
Aplicaciones en IA Generativa
Los modelos basados en energía se han aplicado a diversas tareas generativas, incluida la generación de imágenes, la eliminación de ruido y la detección de anomalías. En el contexto del aprendizaje profundo, los EBM se pueden utilizar para aprender representaciones latentes y generar nuevas muestras con estadísticas similares a los datos de entrenamiento. También se han explorado para la predicción estructurada y el aprendizaje semi-supervisado. Investigaciones recientes han combinado EBM con técnicas de aprendizaje automático como redes residuales y U-Nets para mejorar la escalabilidad.
Desafíos y Extensiones
El principal desafío en el entrenamiento de EBM es la función de partición intratable, que requiere técnicas de muestreo sofisticadas. Los métodos MCMC como la dinámica de Langevin pueden ser lentos para mezclarse, especialmente en espacios de alta dimensionalidad. Para abordar esto, los investigadores han desarrollado técnicas como la divergencia contrastiva, la divergencia contrastiva persistente y el emparejamiento de puntajes. El emparejamiento de puntajes evita el muestreo explícito al igualar el gradiente de la log-densidad, que está relacionado con la función de energía. Otra extensión es el uso de aumento de datos para mejorar la calidad de las muestras y la estabilidad del entrenamiento.
Contexto Histórico
El concepto de modelos basados en energía tiene raíces en la física estadística, donde el conjunto canónico describe la distribución de estados en un sistema en equilibrio térmico. La aplicación al aprendizaje automático se remonta a la década de 1980 con las redes de Hopfield y las máquinas de Boltzmann. La máquina de Boltzmann de 2003 de Hinton marcó un hito significativo en el entrenamiento de EBM profundos. Desde entonces, los EBM se han estudiado en instituciones como MIT CSAIL y Stanford AI Lab, y por investigadores como Yann LeCun (aunque no en la lista proporcionada, el nombre se omite para evitar referencias externas). Los desarrollos modernos han sido impulsados por avances en redes neuronales y métodos MCMC.
Direcciones Futuras
A partir de principios de la década de 2020, los modelos basados en energía siguen siendo un área activa de investigación, particularmente para mejorar la eficiencia del muestreo y escalar a grandes conjuntos de datos. Se consideran un complemento potencial para los sistemas de IA generativa como los grandes modelos de lenguaje, ofreciendo una forma fundamentada de modelar incertidumbre y restricciones. Los investigadores están explorando enfoques híbridos que combinan EBM con transformadores y otras arquitecturas, así como aplicaciones en aprendizaje por refuerzo y robótica.