Traducido del inglés

DenseNet es una arquitectura de red neuronal convolucional que conecta cada capa con todas las demás capas de manera feed-forward, mejorando el flujo de gradiente y la reutilización de características. Fue introducida en 2017 y ha sido influyente en el aprendizaje profundo.

DenseNet (Red Convolucional Densamente Conectada) es un tipo de red neuronal artificial utilizado principalmente para tareas de reconocimiento de imágenes y visión por computadora. Fue propuesto por Gao Huang, Zhuang Liu, Laurens van der Maaten y Kilian Q. Weinberger en un artículo de 2017 titulado "Redes Convolucionales Densamente Conectadas". La arquitectura se caracteriza por una conectividad densa: dentro de un bloque denso, cada capa recibe los mapas de características de todas las capas anteriores como entradas y pasa su propia salida a todas las capas posteriores. Este diseño contrasta con las redes convolucionales tradicionales, donde las capas se conectan secuencialmente, y con las redes residuales (ResNets), que utilizan conexiones de salto para sumar la entrada de un bloque a su salida.

La idea central de DenseNet es maximizar el flujo de información entre capas, lo que ayuda a aliviar el problema del gradiente desvaneciente en redes profundas. Al concatenar mapas de características en lugar de sumarlos, DenseNet promueve la reutilización de características, reduce el número de parámetros y fomenta un fuerte flujo de gradiente durante el entrenamiento. La arquitectura ha sido ampliamente adoptada en tareas como clasificación de imágenes, segmentación y detección de objetos, y ha influido en diseños de redes posteriores.

Arquitectura

Una DenseNet se compone de varios bloques densos, cada uno con un número de capas. Dentro de un bloque denso, cada capa realiza normalización por lotes, una activación de unidad lineal rectificada (ReLU) y una convolución de 3x3. La salida de cada capa se concatena con las entradas de todas las capas anteriores del bloque, creando un patrón de conectividad densa. Si un bloque tiene \(L\) capas, el número total de conexiones es \(L(L+1)/2\).

Entre bloques densos, se utilizan capas de transición para reducir las dimensiones espaciales y el número de mapas de características. Una capa de transición consiste en normalización por lotes, una convolución de 1x1 y una operación de agrupación promedio de 2x2. El factor de compresión, a menudo establecido en 0.5, controla cuántos mapas de características se retienen después de la transición.

Una tasa de crecimiento \(k\) determina cuántos mapas de características nuevos produce cada capa. Por ejemplo, con \(k=32\), cada capa añade 32 mapas de características a la entrada colectiva. Este parámetro equilibra la capacidad del modelo y el costo computacional. Las variantes comunes de DenseNet incluyen DenseNet-121, DenseNet-169, DenseNet-201 y DenseNet-264, donde el número indica el recuento total de capas.

Matemáticas

En un bloque denso, sea \(x_0\) la entrada al bloque. Para la capa \(\ell\), la entrada es la concatenación de las salidas de todas las capas anteriores: \([x_0, x_1, \dots, x_{\ell-1}]\). La capa calcula una función compuesta \(H_\ell\) (que incluye normalización por lotes, ReLU y convolución) y produce \(x_\ell = H_\ell([x_0, x_1, \dots, x_{\ell-1}])\). Esta operación de concatenación es la diferencia clave con las conexiones residuales, que utilizan suma.

La conectividad densa asegura que cada capa tenga acceso directo a los gradientes de la función de pérdida, mitigando el problema del gradiente desvaneciente. Los autores demostraron que la arquitectura tiene un efecto regularizador, reduciendo el sobreajuste en conjuntos de datos pequeños.

Entrenamiento y Optimización

Las DenseNets se entrenan utilizando técnicas estándar de aprendizaje profundo, como el descenso de gradiente estocástico con momento o el optimizador Adam. Las redes a menudo emplean aumento de datos (por ejemplo, recorte aleatorio, volteo y perturbación de color) para mejorar la generalización. La normalización por lotes se aplica antes de cada activación, lo que estabiliza el entrenamiento y permite tasas de aprendizaje más altas.

En el Desafío de Reconocimiento Visual a Gran Escala de ImageNet (ILSVRC) 2017, DenseNet logró resultados de vanguardia, con una tasa de error top-5 del 5.11% para DenseNet-201, superando arquitecturas anteriores como ResNet. El modelo también demostró eficiencia en parámetros, requiriendo menos parámetros que ResNets comparables para lograr una precisión similar.

Aplicaciones e Impacto

DenseNet se ha aplicado a diversos dominios más allá de la clasificación de imágenes, incluida la segmentación de imágenes médicas, la teledetección y el análisis de video. Sus principios de diseño han inspirado otras arquitecturas, como la red de doble camino (DPN) y la red densa multiescala. El concepto de conectividad densa también se ha explorado en modelos transformer, aunque el enfoque dominante allí sigue siendo las conexiones residuales.

La arquitectura está disponible en marcos populares de aprendizaje profundo, como PyTorch y TensorFlow, y a menudo se utiliza como columna vertebral en modelos de detección de objetos y segmentación. Su éxito contribuyó a la tendencia más amplia de diseñar redes convolucionales cada vez más profundas y eficientes, junto con ResNet y U-Net.

Limitaciones y Extensiones

A pesar de sus fortalezas, DenseNet puede ser intensiva en memoria debido a la concatenación de mapas de características, lo que aumenta los requisitos de almacenamiento intermedio. Los investigadores han propuesto variantes para abordar esto, como DenseNet-BC (cuello de botella y compresión) y redes convolucionales dispersas de subvariedades para datos 3D. La arquitectura también tiende a ser más lenta en inferencia en comparación con algunos diseños más recientes, como EfficientNet.

En general, DenseNet sigue siendo una arquitectura fundamental en visión por computadora, demostrando los beneficios de la conectividad densa para la reutilización de características y el flujo de gradiente. Sus ideas continúan influyendo en el diseño de redes modernas, especialmente en escenarios donde la eficiencia de parámetros y la precisión son críticas.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:deep-learning·computer-vision·convolutional-neural-network·neural-network-architecture
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial