Traducido del inglés

DenseNet es una arquitectura de red neuronal convolucional donde cada capa recibe entradas directas de todas las capas anteriores mediante conectividad densa, mejorando el flujo de gradientes y la reutilización de características. Introducida en 2016, logró resultados de vanguardia en los puntos de referencia de clasificación de imágenes.

DenseNet (Red Convolucional Densamente Conectada) es una arquitectura de red neuronal para el reconocimiento de imágenes que conecta cada capa con todas las demás de manera feed-forward. A diferencia de las redes convolucionales tradicionales con L capas que tienen L conexiones, DenseNet tiene L(L+1)/2 conexiones directas. Para cada capa, los mapas de características de todas las capas precedentes se utilizan como entradas, y sus propios mapas de características se utilizan como entradas para todas las capas subsiguientes. Este patrón de conectividad densa fue introducido en un artículo de 2016 por Gao Huang, Zhuang Liu, Laurens van der Maaten y Kilian Q. Weinberger, y fue presentado en la Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) de 2017.

La arquitectura fue diseñada para abordar el problema del desvanecimiento del gradiente en redes profundas. Al proporcionar caminos cortos desde las capas tempranas hasta las capas posteriores y hasta la función de pérdida, DenseNet facilita el flujo de gradientes durante el entrenamiento. También fomenta la reutilización de características, ya que cada capa recibe conocimiento colectivo de todas las capas precedentes, lo que conduce a modelos más compactos. DenseNet logró resultados notables en los puntos de referencia ImageNet y CIFAR, a menudo requiriendo menos parámetros que arquitecturas comparables como los modelos de aprendizaje profundo basados en conexiones residuales.

Conectividad densa y tasa de crecimiento

En una DenseNet, la capa l-ésima recibe los mapas de características de todas las capas precedentes, x_0, x_1, ..., x_{l-1}, como entrada. La salida de la capa l-ésima se define como x_l = H_l([x_0, x_1, ..., x_{l-1}]), donde [x_0, x_1, ..., x_{l-1}] denota la concatenación de los mapas de características. La función H_l es una operación compuesta que típicamente incluye normalización por lotes, una activación de unidad lineal rectificada (ReLU) y una convolución de 3x3. Esta concatenación, en lugar de la suma, distingue a DenseNet de las redes residuales, que utilizan conexiones de salto aditivas.

Cada capa añade un número fijo de mapas de características, denominado tasa de crecimiento k. Si cada H_l produce k mapas de características, entonces la capa l-ésima tiene k_0 + k*(l-1) mapas de características de entrada, donde k_0 es el número de canales en la imagen de entrada. Las tasas de crecimiento comunes son 12, 24 y 32. Una tasa de crecimiento más pequeña resulta en una red más estrecha, mientras que valores más grandes aumentan la capacidad. La conectividad densa significa que el número total de mapas de características crece cuadráticamente con la profundidad, pero el uso de capas de cuello de botella y compresión ayuda a controlar el tamaño del modelo.

Capas de cuello de botella y compresión

Para mejorar la eficiencia computacional, DenseNet incorpora una capa de cuello de botella en cada H_l para arquitecturas como DenseNet-B. La capa de cuello de botella consiste en normalización por lotes, ReLU, una convolución de 1x1 que reduce el número de mapas de características a 4k, seguida de una convolución de 3x3. Este diseño reduce el número de canales de entrada a la convolución de 3x3, disminuyendo el recuento de parámetros y el costo computacional. Por ejemplo, en DenseNet-BC, el cuello de botella se combina con compresión.

La compresión, denotada por el parámetro theta (con valores menores o iguales a 1), se aplica en las capas de transición. Una capa de transición, colocada entre bloques densos, consiste en normalización por lotes, una convolución de 1x1 y una operación de agrupación promedio de 2x2. La convolución de 1x1 reduce el número de mapas de características por un factor de theta. Cuando theta es menor que 1, la red se denomina DenseNet-C. La combinación de cuello de botella y compresión, DenseNet-BC, demostró ser particularmente efectiva, logrando alta precisión con menos parámetros que otras arquitecturas.

Bloques densos y capas de transición

La red está organizada en bloques densos, donde la conectividad densa se aplica dentro de cada bloque. Entre bloques, las capas de transición controlan el tamaño de los mapas de características. Una arquitectura DenseNet típica para ImageNet, como DenseNet-121, consiste en cuatro bloques densos con 6, 12, 24 y 16 capas respectivamente, con una tasa de crecimiento de 32. La primera capa de convolución antes del primer bloque denso tiene 64 canales. Después del bloque denso final, una capa de agrupación promedio global y un clasificador softmax producen la salida. Las capas de transición entre bloques utilizan compresión para reducir el número de mapas de características, lo que ayuda a reducir la huella de memoria del modelo.

Entrenamiento y rendimiento

Los modelos DenseNet se entrenan utilizando descenso de gradiente estocástico con momento, decaimiento de peso y un programa de tasa de aprendizaje que incluye calentamiento y decaimiento. Técnicas de aumento de datos como recorte aleatorio, volteo y normalización se emplean comúnmente. En el conjunto de datos del Desafío de Reconocimiento Visual a Gran Escala de ImageNet (ILSVRC) 2012, DenseNet-201 logró una tasa de error top-1 del 22.15% y una tasa de error top-5 del 6.20%, lo que fue competitivo con los resultados de vanguardia en ese momento. En CIFAR-10 y CIFAR-100, DenseNet-BC con una tasa de crecimiento de 12 logró tasas de error del 3.46% y 17.18% respectivamente, superando a muchas variantes de redes residuales con menos parámetros.

La conectividad densa también proporciona una forma implícita de supervisión profunda, ya que cada capa tiene acceso directo al gradiente de la función de pérdida. Esta propiedad reduce la necesidad de clasificadores auxiliares. DenseNet ha sido ampliamente adoptada en diversas tareas de visión por computadora, incluyendo segmentación semántica, detección de objetos y análisis de imágenes médicas. Sus principios de diseño han influido en arquitecturas posteriores, como las utilizadas en sistemas de inteligencia artificial para la comprensión de imágenes.

Impacto y variantes

El éxito de DenseNet condujo a varias variantes y extensiones. Por ejemplo, el concepto de conectividad densa se combinó con otros mecanismos en modelos como las Redes de Doble Vía, que fusionan conexiones residuales y densas. En el contexto de la investigación en aprendizaje automático, DenseNet se ha utilizado como columna vertebral para la extracción de características en muchas aplicaciones. Su uso eficiente de parámetros la hace adecuada para el despliegue en dispositivos con recursos limitados, incluidos los de Samsung Electronics y otros fabricantes de hardware móvil. La arquitectura también sirvió como línea base para estudios sobre diseño de redes neuronales, como aquellos que exploran el impacto del ancho, la profundidad y la cardinalidad. Aunque arquitecturas más nuevas como los transformadores se han vuelto dominantes en algunas áreas, DenseNet sigue siendo un modelo fundamental en el diseño de redes convolucionales.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:convolutional-neural-networks·deep-learning·computer-vision·neural-network-architectures
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial