Una red de creencia profunda (DBN) es un modelo gráfico generativo, o alternativamente una clase de red neuronal profunda, compuesta de múltiples capas de variables latentes ("unidades ocultas"), con conexiones entre capas pero no entre unidades dentro de cada capa. Cuando se entrena sin supervisión sobre un conjunto de ejemplos, una DBN puede aprender a reconstruir probabilísticamente sus entradas, actuando las capas como detectores de características. Tras este paso de aprendizaje, una DBN puede entrenarse adicionalmente con supervisión para realizar clasificación.
Las DBN pueden verse como una composición de redes simples y no supervisadas, como máquinas de Boltzmann restringidas (RBM) o autoencoders, donde la capa oculta de cada subred sirve como capa visible para la siguiente. Una RBM es un modelo generativo basado en energía, no dirigido, con una capa de entrada visible y una capa oculta, con conexiones entre capas pero no dentro de ellas. Esta composición conduce a un procedimiento de entrenamiento no supervisado, capa por capa, rápido, donde se aplica divergencia contrastiva a cada subred sucesivamente, comenzando desde el par de capas más bajo (la capa visible más baja es un conjunto de entrenamiento).
La observación de que las DBN pueden entrenarse de forma codiciosa, una capa a la vez, condujo a uno de los primeros algoritmos eficaces de aprendizaje profundo. En general, existen muchas implementaciones y usos atractivos de las DBN en aplicaciones y escenarios de la vida real, como la electroencefalografía y el descubrimiento de fármacos.
Contexto histórico
Las redes de creencia profunda surgieron a mediados de la década de 2000 como un avance en el entrenamiento de arquitecturas profundas. Antes de su introducción, entrenar redes neuronales multicapa era notoriamente difícil debido a problemas como el desvanecimiento del gradiente y la lenta convergencia. La estrategia de preentrenamiento codicioso capa por capa introducida con las DBN proporcionó una forma práctica de inicializar redes profundas, que luego podían ajustarse para tareas supervisadas. Este trabajo, asociado principalmente con Geoffrey Hinton y sus colegas de la Universidad de Toronto, revitalizó el interés en el aprendizaje-profundo y sentó las bases para avances posteriores en las arquitecturas de redes-neuronales.
El desarrollo de las DBN se cita a menudo como un hito clave en la historia de la inteligencia-artificial, conectando los primeros trabajos sobre modelos probabilísticos y aprendizaje-automático con el aprendizaje profundo moderno. El éxito de las DBN en tareas como el reconocimiento de dígitos manuscritos y la clasificación de documentos demostró el poder del aprendizaje jerárquico de características, influyendo en modelos posteriores como los autoencoders profundos y las redes convolucionales.
Entrenamiento con divergencia contrastiva
El método de entrenamiento para RBM propuesto por Geoffrey Hinton para su uso con modelos de "Producto de expertos" se denomina divergencia contrastiva (CD). La CD proporciona una aproximación al método de máxima verosimilitud que idealmente se aplicaría para aprender los pesos. En el entrenamiento de una sola RBM, las actualizaciones de pesos se realizan con descenso de gradiente utilizando la ecuación:
w_ij(t+1) = w_ij(t) + η * ∂log(p(v))/∂w_ij
donde p(v) es la probabilidad de un vector visible, dada por p(v) = (1/Z) * Σ_h e^(-E(v,h)), siendo Z la función de partición para la normalización y E(v,h) la función de energía asignada al estado de la red. Una energía más baja indica una configuración más "deseable". El gradiente ∂log(p(v))/∂w_ij tiene la forma simple ⟨v_i h_j⟩_datos - ⟨v_i h_j⟩_modelo, donde ⟨...⟩_p representa los promedios con respecto a la distribución p.
El desafío surge al muestrear ⟨v_i h_j⟩_modelo porque requiere un muestreo de Gibbs extendido. La CD reemplaza este paso ejecutando un muestreo de Gibbs alternante durante n pasos (los valores de n=1 funcionan bien). Después de n pasos, se muestrean los datos y esa muestra se usa en lugar de ⟨v_i h_j⟩_modelo. El procedimiento de CD funciona de la siguiente manera:
- Inicializar las unidades visibles con un vector de entrenamiento.
- Actualizar las unidades ocultas en paralelo dadas las unidades visibles: p(h_j=1|V) = σ(b_j + Σ_i v_i w_ij), donde σ es la función sigmoide y b_j es el sesgo de la unidad oculta j.
- Reconstruir las unidades visibles a partir de las unidades ocultas y, a continuación, actualizar nuevamente las unidades ocultas según la reconstrucción.
- Realizar la actualización de pesos utilizando la diferencia entre las correlaciones originales y reconstruidas.
Este procedimiento se aplica de forma codiciosa, capa por capa, para entrenar una DBN. Después del preentrenamiento, toda la red puede ajustarse mediante retropropagación u otros métodos supervisados.
Aplicaciones e impacto
Las redes de creencia profunda se han aplicado en diversos ámbitos. En el sector sanitario, las DBN se han utilizado para analizar señales de electroencefalografía (EEG), ayudando en la detección de afecciones neurológicas. En el descubrimiento de fármacos, se han empleado para predecir propiedades moleculares e identificar posibles candidatos a fármacos, aprovechando su capacidad para aprender representaciones jerárquicas a partir de datos químicos.
Las DBN también encontraron uso en el reconocimiento del habla, donde sirvieron como modelos acústicos, y en tareas de reconocimiento de imágenes, donde aprendieron características a partir de píxeles en bruto. Su éxito en estas áreas demostró la versatilidad del preentrenamiento generativo, influyendo en desarrollos posteriores de la ia-generativa y los modelos a gran escala.
A pesar de verse eclipsadas por arquitecturas más recientes como los modelos Transformer (architecture), las DBN siguen siendo una herramienta educativa importante para comprender los principios del aprendizaje profundo. Se estudian a menudo en cursos de aprendizaje-automático y aprendizaje-profundo como un ejemplo fundamental de preentrenamiento no supervisado y aprendizaje jerárquico de características.
Limitaciones y evolución
Las DBN presentan varias limitaciones. El entrenamiento puede ser computacionalmente intensivo, especialmente para conjuntos de datos grandes, y la aproximación de divergencia contrastiva puede dar lugar a estimaciones sesgadas. Además, como modelos generativos, son menos escalables que los modelos discriminativos para ciertas tareas. El auge de los modelos basados en Transformer (architecture), particularmente en el procesamiento del lenguaje natural, desvió la atención de las DBN, ya que estas nuevas arquitecturas ofrecían un mejor rendimiento con entrenamiento de extremo a extremo.
No obstante, los principios subyacentes a las DBN -como el preentrenamiento capa por capa y el modelado basado en energía- siguen influyendo en la investigación moderna. Conceptos como los autoencoders y los autoencoders variacionales se basan en ideas similares, y la estrategia de preentrenamiento codicioso se ha adaptado de diversas formas en los flujos de trabajo contemporáneos del aprendizaje profundo.
Legado y lecturas adicionales
Las redes de creencia profunda representan un momento crucial en la evolución de la inteligencia-artificial. Demostraron que las arquitecturas profundas podían entrenarse de manera eficaz, allanando el camino para la revolución del aprendizaje profundo. Investigadores de instituciones como el MIT CSAIL, el Laboratorio de IA de Stanford y la Investigación de IA de Berkeley han construido sobre estos cimientos, contribuyendo al rápido progreso del campo.
Para aquellos interesados en explorar las DBN más a fondo, los artículos originales de Hinton y sus colaboradores proporcionan derivaciones detalladas y resultados experimentales. Los libros de texto sobre aprendizaje-profundo suelen incluir capítulos sobre DBN y RBM, ofreciendo perspectivas tanto teóricas como prácticas. A medida que el campo continúa evolucionando, las lecciones aprendidas de las DBN siguen siendo relevantes, particularmente en áreas como el aprendizaje no supervisado y el modelado generativo.