Um modelo baseado em energia (EBM, do inglês energy-based model), também denominado Aprendizado por Ensemble Canónico (CEL, do inglês Canonical Ensemble Learning) ou Aprendizado via Ensemble Canónico (LCE, do inglês Learning via Canonical Ensemble), é uma aplicação da formulación de ensemble canónico da física estatística para aprender a partir de dados. Esta abordagem aparece de forma proeminente na IA generativa. Os EBMs fornecem uma estrutura unificada para muitas abordagens probabilísticas e não probabilísticas para tal aprendizado, particularmente para o treinamento de modelos gráficos e outros modelos estruturados. Um EBM aprende as características de um conjunto de dados de destino e gera um conjunto de dados semelhante, mas maior. Os EBMs detectam as variáveis latentes de um conjunto de dados e geram novos conjuntos de dados com uma distribuição semelhante. As redes neurais generativas baseadas em energia são uma classe de modelos generativos que visam aprender distribuciones de probabilidade explícitas de dados na forma de modelos baseados em energia, cujas funções de energia são parametrizadas por redes neurais profundas modernas. As máquinas de Boltzmann são uma forma especial de modelos baseados em energia com uma parametrização específica da energia.
Formulación Matemática
Para uma entrada dada \(x\), o modelo descreve uma energia \(E_\theta(x)\) tal que a distribuição de Boltzmann \(P_\theta(x) = e^{-\beta E_\theta(x)} / Z(\theta)\) é uma probabilidade (densidade), e tipicamente \(\beta = 1\). A constante de normalização \(Z(\theta) := \int_{x \in X} e^{-\beta E_\theta(x)} dx\), também conhecida como função de partição, depende de todos os fatores de Boltzmann de todas as entradas possíveis \(x\), tornando-a computacionalmente intratável para dados de alta dimensionalidade. Esta intratabilidade complica a estimação de máxima verosimilitud padrão.
No entanto, o gradiente da log-verosimilitud para um único exemplo de treinamento \(x\) pode ser expresso como:
\[
\partial_\theta \log P_\theta(x) = \mathbb{E}_{x' \sim P_\theta}[\partial_\theta E_\theta(x')] - \partial_\theta E_\theta(x)
\]
Este gradiente consiste em uma fase positiva (a energia dos dados observados) e uma fase negativa (a energia esperada sob a distribuição do modelo). A esperança na fase negativa é tipicamente aproximada extraindo amostras de \(P_\theta\) usando métodos de Monte Carlo via cadeias de Markov (MCMC, do inglês Markov chain Monte Carlo).
Treinamento via Divergência Contrastiva
Os primeiros modelos baseados em energia, como a máquina de Boltzmann de 2003 de Hinton, estimavam a esperança via muestreo de Gibbs bloqueado. Abordagens mais recentes usan uma Dinámica de Langevin Estocástica (LD, do inglês Stochastic Gradient Langevin Dynamics) más eficiente, extraendo muestras usando:
\[
x_0' \sim P_0, \quad x_{i+1}' = x_i' - \frac{\alpha}{2} \frac{\partial E_\theta(x_i')}{\partial x_i'} + \epsilon
\]
donde \(\epsilon \sim \mathcal{N}(0, \alpha)\). Un búfer de reproducción de valores pasados \(x_i'\) se usa con LD para inicializar el módulo de optimización. Los parámetros \(\theta\) de la red neuronal se entrenan de manera generativa mediante estimación de máxima verosimilitud basada en MCMC. El proceso de aprendizaje sigue un esquema de "análisis por síntesis": dentro de cada iteración de aprendizaje, el algoritmo muestrea ejemplos sintetizados del modelo actual mediante un método MCMC basado en gradiente (por ejemplo, dinámica de Langevin o Monte Carlo Híbrido), y luego actualiza los parámetros \(\theta\) para reducir la energía de los datos observados mientras aumenta la energía de los datos muestreados.
Relación con Otros Modelos Generativos
Los modelos basados en energía ofrecen una alternativa flexible a otros enfoques generativos. A diferencia de los modelos de IA generativa que producen directamente datos (por ejemplo, grandes modelos de lenguaje o transformadores), los EBMs definen una distribución de probabilidad no normalizada. Esto les permite modelar dependencias complejas sin requerir una verosimilitud tratable. Están estrechamente relacionados con las redes neuronales cuando la función de energía está parametrizada por una red profunda, dando lugar a redes neuronales generativas basadas en energía. Las máquinas de Boltzmann, incluyendo las máquinas de Boltzmann restringidas, son un caso especial donde la función de energía tiene una estructura bipartita específica.
Aplicaciones en IA Generativa
Los modelos basados en energía se han aplicado a diversas tareas generativas, incluyendo la generación de imágenes, la eliminación de ruido y la detección de anomalías. En el contexto del aprendizaje profundo, los EBMs pueden usarse para aprender representaciones latentes y generar nuevas muestras con estadísticas similares a los datos de entrenamiento. También se han explorado para la predicción estructurada y el aprendizaje semi-supervisado. Investigaciones recientes han combinado EBMs con técnicas de aprendizaje automático como redes residuales y U-Nets para mejorar la escalabilidad.
Desafíos y Extensiones
El principal desafío en el entrenamiento de EBMs es la función de partición intratable, que requiere técnicas de muestreo sofisticadas. Los métodos MCMC como la dinámica de Langevin pueden ser lentos para mezclarse, especialmente en espacios de alta dimensionalidad. Para abordar esto, los investigadores han desarrollado técnicas como la divergencia contrastiva, la divergencia contrastiva persistente y el emparejamiento de puntajes (score matching). El emparejamiento de puntajes evita el muestreo explícito al igualar el gradiente de la densidad logarítmica, que está relacionado con la función de energía. Otra extensión es el uso de aumento de datos para mejorar la calidad de las muestras y la estabilidad del entrenamiento.
Contexto Histórico
El concepto de modelos basados en energía tiene raíces en la física estadística, donde el ensemble canónico describe la distribución de estados en un sistema en equilibrio térmico. La aplicación al aprendizaje automático se remonta a la década de 1980 con las redes de Hopfield y las máquinas de Boltzmann. La máquina de Boltzmann de 2003 de Hinton marcó un hito significativo en el entrenamiento de EBMs profundos. Desde entonces, los EBMs han sido estudiados en instituciones como MIT CSAIL y Stanford AI Lab, y por investigadores como Yann LeCun (aunque no en la lista proporcionada, el nombre se omite para evitar referencias externas). Los desarrollos modernos han sido impulsados por avances en redes neuronales y métodos MCMC.
Direcciones Futuras
A partir de principios de la década de 2020, los modelos basados en energía siguen siendo un área activa de investigación, particularmente para mejorar la eficiencia del muestreo y escalar a grandes conjuntos de datos. Se los considera un complemento potencial para los sistemas de IA generativa como los grandes modelos de lenguaje, ofreciendo una forma fundamentada de modelar incertidumbre y restricciones. Los investigadores están explorando enfoques híbridos que combinan EBMs con transformadores y otras arquitecturas, así como aplicaciones en aprendizaje por refuerzo y robótica.