Una red de creencias profundas convolucional (CDBN) es un tipo de modelo de aprendizaje profundo que integra la extracción jerárquica de características de las redes neuronales convolucionales con el aprendizaje generativo probabilístico de las redes de creencias profundas. Está diseñada para el aprendizaje no supervisado de características de alto nivel a partir de datos bidimensionales, como imágenes, espectrogramas de audio y fotogramas de video. El modelo fue introducido a finales de la década de 2000 como una extensión de las máquinas de Boltzmann restringidas para manejar entradas espacialmente estructuradas a gran escala de manera eficiente.
Las CDBN consisten en múltiples capas de máquinas de Boltzmann restringidas convolucionales (convRBM), donde cada capa aprende características cada vez más abstractas. A diferencia de las redes de creencias profundas totalmente conectadas, las CDBN utilizan campos receptivos locales y pesos compartidos, lo que reduce drásticamente el número de parámetros y permite la escalabilidad a entradas de alta resolución. El modelo se entrena capa por capa utilizando divergencia contrastiva, seguida de un ajuste fino opcional con señales supervisadas.
Arquitectura
El bloque de construcción central de una CDBN es la máquina de Boltzmann restringida convolucional. En una convRBM, la capa visible representa la imagen de entrada, y la capa oculta consiste en mapas de características. Cada mapa de características está conectado a la capa visible mediante un conjunto de pesos de filtro compartidos, también conocidos como núcleos. La capa de agrupación, típicamente de agrupación máxima, reduce la dimensionalidad espacial de las activaciones ocultas, proporcionando invariancia a la traslación y eficiencia computacional.
Una CDBN apila múltiples convRBM, donde la salida agrupada de una capa sirve como entrada visible para la siguiente. Esta estructura jerárquica permite que la red aprenda bordes y texturas de bajo nivel en las primeras capas, y objetos o partes de nivel superior en capas posteriores. La naturaleza probabilística del modelo le permite generar nuevas muestras a partir de la distribución aprendida, una propiedad que no comparten las redes convolucionales discriminativas estándar.
Entrenamiento
El entrenamiento de una CDBN procede de manera codiciosa y capa por capa. Cada convRBM se entrena por separado utilizando divergencia contrastiva, una técnica que aproxima la estimación de máxima verosimilitud. La regla de aprendizaje actualiza los pesos de filtro compartidos y los sesgos basándose en la diferencia entre las estadísticas dependientes de los datos y las dependientes del modelo. Después de que todas las capas se preentrenan, toda la red puede ajustarse finamente mediante retropropagación con datos etiquetados para tareas de clasificación.
Un desafío en el entrenamiento de CDBN es el costo computacional de la inferencia en el modelo gráfico probabilístico, especialmente para imágenes grandes. Para abordar esto, los investigadores han utilizado aproximaciones como la inferencia de campo medio y el muestreo de Gibbs por bloques. Además, el uso de mini-lotes pequeños y momento en el descenso de gradiente estocástico ayuda a estabilizar el entrenamiento.
Aplicaciones
Las CDBN se han aplicado a diversas tareas de visión por computadora, incluido el reconocimiento de objetos, la detección de rostros y la clasificación de escenas. También se han utilizado para el aprendizaje no supervisado de características en dominios como el procesamiento de audio y la imagen médica. A principios de la década de 2010, las CDBN lograron resultados competitivos en conjuntos de datos de referencia como CIFAR-10 y NORB, demostrando su efectividad en aprender representaciones útiles sin datos etiquetados extensos.
Más recientemente, los principios de las CDBN han influido en otros modelos generativos, como los autoencoders variacionales y las redes generativas adversariales, aunque las CDBN en sí mismas se utilizan menos hoy en día debido al auge del aprendizaje profundo de extremo a extremo con entrenamiento supervisado a gran escala.
Relación con otros modelos
Las CDBN comparten similitudes conceptuales con otras arquitecturas profundas. Son una contraparte probabilística de las redes neuronales convolucionales estándar, que son puramente discriminativas. A diferencia de los modelos basados en transformadores como los grandes modelos de lenguaje, las CDBN están diseñadas para datos espaciales y no dependen de mecanismos de atención. La capacidad generativa de las CDBN también las distingue de las típicas redes residuales y U-Nets, que son de avance directo y específicas de tareas.
En el contexto más amplio del aprendizaje automático, las CDBN representan un intento temprano de combinar el preentrenamiento no supervisado con arquitecturas convolucionales, un tema que más tarde influyó en la investigación del aprendizaje profundo en instituciones como la Universidad de Toronto y MIT CSAIL.
Limitaciones y legado
A pesar de su atractivo teórico, las CDBN enfrentan limitaciones prácticas. El entrenamiento es computacionalmente intensivo, y la inferencia probabilística puede ser lenta. Las ganancias de rendimiento sobre las redes convolucionales puramente supervisadas fueron a menudo modestas, especialmente a medida que los grandes conjuntos de datos etiquetados y el entrenamiento acelerado por GPU estuvieron disponibles. Como resultado, las CDBN han sido en gran medida superadas por modelos más simples y escalables.
No obstante, las ideas detrás de las CDBN - el aprendizaje jerárquico de características, la conectividad local y el modelado generativo - siguen siendo influyentes. Son parte de la base histórica del aprendizaje profundo moderno, junto con otros modelos tempranos como las redes neuronales y las redes de creencias profundas. Los investigadores continúan revisitando enfoques generativos para el aprendizaje semi-supervisado y el aprendizaje de representaciones, manteniendo relevante el legado de las CDBN.