Máquina de Boltzmann restringida

Traducido del inglés

Una máquina de Boltzmann restringida (RBM) es una red neuronal artificial estocástica generativa que aprende una distribución de probabilidad sobre sus entradas utilizando un grafo bipartito de unidades visibles y ocultas. Es una máquina de Boltzmann simplificada que permite un entrenamiento eficiente, ampliamente utilizada en el aprendizaje profundo y el aprendizaje de características.

Una máquina de Boltzmann restringida (RBM) es una red neuronal artificial estocástica generativa que puede aprender una distribución de probabilidad sobre su conjunto de entradas. Es una variante de la máquina de Boltzmann, con la restricción de que sus neuronas forman un grafo bipartito: las conexiones solo existen entre dos grupos de unidades, comúnmente llamadas unidades visibles y ocultas, y no hay conexiones dentro de cada grupo. Esta restricción permite algoritmos de entrenamiento más eficientes que los disponibles para las máquinas de Boltzmann generales, en particular el algoritmo de divergencia contrastiva basado en gradientes.

Las RBM fueron propuestas inicialmente con el nombre de Harmonium por Paul Smolensky en 1986, y ganaron prominencia después de que Geoffrey Hinton y sus colaboradores desarrollaran algoritmos de aprendizaje rápido para ellas a mediados de la década de 2000. Tienen aplicaciones en reducción de dimensionalidad, clasificación, filtrado colaborativo, aprendizaje de características, modelado de temas, inmunología y mecánica cuántica de muchos cuerpos. Las RBM pueden entrenarse de manera supervisada o no supervisada, dependiendo de la tarea, y son un componente clave en las redes de aprendizaje profundo, donde las redes de creencia profundas pueden formarse apilando RBM y, opcionalmente, ajustando la red resultante con descenso de gradiente y retropropagación.

Estructura

El tipo estándar de RBM tiene unidades ocultas y visibles binarias (booleanas). Consiste en una matriz de pesos \(W\) de tamaño \(m \times n\), donde cada elemento de peso \(w_{i,j}\) está asociado con la conexión entre la unidad visible \(v_i\) y la unidad oculta \(h_j\). Además, hay pesos de sesgo \(a_i\) para las unidades visibles y \(b_j\) para las unidades ocultas. La energía de una configuración (par de vectores booleanos) \((v, h)\) se define como:

\[ E(v, h) = -\sum_i a_i v_i - \sum_j b_j h_j - \sum_i \sum_j v_i w_{i,j} h_j \]

o en notación matricial:

\[ E(v, h) = -a^{\mathrm{T}} v - b^{\mathrm{T}} h - v^{\mathrm{T}} W h. \]

Esta función de energía es análoga a la de una red de Hopfield. Como en las máquinas de Boltzmann generales, la distribución de probabilidad conjunta para los vectores visibles y ocultos se define en términos de la función de energía:

\[ P(v, h) = \frac{1}{Z} e^{-E(v, h)} \]

donde \(Z\) es una función de partición, una constante de normalización que asegura que las probabilidades sumen 1. La probabilidad marginal de un vector visible es la suma de \(P(v, h)\) sobre todas las configuraciones posibles de la capa oculta, y viceversa.

Entrenamiento y divergencia contrastiva

Debido a que la estructura de grafo subyacente de una RBM es bipartita, las activaciones de las unidades ocultas son mutuamente independientes dadas las activaciones de las unidades visibles, y, a la inversa, las activaciones de las unidades visibles son mutuamente independientes dadas las activaciones de las unidades ocultas. Esta propiedad simplifica el cálculo de las probabilidades condicionales, lo que permite un entrenamiento eficiente. El algoritmo de entrenamiento más común es la divergencia contrastiva, que aproxima el gradiente de la log-verosimilitud realizando una ejecución corta de cadena de Markov Monte Carlo, típicamente con un paso de muestreo de Gibbs. Este enfoque evita el cálculo intratable de la función de partición \(Z\), que suma sobre todas las configuraciones posibles.

Las RBM pueden entrenarse en modos supervisado y no supervisado. En el aprendizaje no supervisado, el modelo aprende a representar la distribución de los datos de entrada, a menudo para extracción de características o reducción de dimensionalidad. En tareas supervisadas, la RBM puede adaptarse para predecir etiquetas incorporándolas en la capa visible o utilizando una capa de salida separada.

Aplicaciones en el aprendizaje profundo

Las máquinas de Boltzmann restringidas son un componente fundamental en el aprendizaje profundo. Una red de creencia profunda puede formarse apilando múltiples RBM, donde la capa oculta de una RBM sirve como capa visible para la siguiente. Este preentrenamiento por capas permite a la red aprender características jerárquicas de los datos. Después del preentrenamiento, toda la red puede ajustarse finamente utilizando descenso de gradiente y retropropagación, una técnica que fue influyente en el desarrollo de las arquitecturas modernas de aprendizaje profundo.

Las RBM se han aplicado al filtrado colaborativo, donde modelan interacciones usuario-elemento para sistemas de recomendación, y al modelado de temas, donde aprenden temas latentes a partir de corpus de texto. En inmunología, se han utilizado para modelar respuestas del sistema inmunitario, y en mecánica cuántica, se han empleado para representar estados cuánticos de muchos cuerpos.

Relación con otros modelos

Las RBM están estrechamente relacionadas con otros modelos de redes neuronales. Son un caso especial de las máquinas de Boltzmann, que permiten conexiones entre unidades ocultas, pero la restricción bipartita hace que el entrenamiento sea más tratable. También comparten similitudes con las redes de Hopfield en su función de energía, pero las RBM son generativas y estocásticas, mientras que las redes de Hopfield son típicamente deterministas y se utilizan para memoria asociativa. En el contexto más amplio del Machine learning, las RBM se consideran un tipo de modelo generativo, distinto de los modelos discriminativos como las redes neuronales feedforward estándar.

Legado e influencia

El desarrollo de las RBM contribuyó significativamente al resurgimiento del Deep learning a mediados de la década de 2000. Geoffrey Hinton, quien más tarde se convirtió en una figura prominente en Artificial intelligence, utilizó las RBM para demostrar que las redes profundas podían entrenarse de manera efectiva, superando dificultades previas con los métodos basados en gradientes. Este trabajo influyó en arquitecturas posteriores, incluidos los transformers y los grandes modelos de lenguaje, aunque esos modelos utilizan paradigmas de entrenamiento diferentes. Las RBM siguen siendo un modelo teórico importante en el estudio de la IA generativa y todavía se utilizan en aplicaciones especializadas donde su naturaleza probabilística es ventajosa.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:neural-networks·deep-learning·generative-models·machine-learning
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial