Traduit de l'anglais

DenseNet est une architecture de réseau neuronal convolutif qui connecte chaque couche à toutes les autres couches de manière feed-forward, améliorant ainsi la circulation du gradient et la réutilisation des caractéristiques. Elle a été introduite en 2017 et a exercé une influence notable dans le domaine de l'apprentissage profond.

DenseNet (réseau convolutif densément connecté) est un type de réseau de neurones artificiel utilisé principalement pour la reconnaissance d'images et les tâches de vision par ordinateur. Il a été proposé par Gao Huang, Zhuang Liu, Laurens van der Maaten et Kilian Q. Weinberger dans un article de 2017 intitulé « Densely Connected Convolutional Networks ». L'architecture se caractérise par une connectivité dense : au sein d'un bloc dense, chaque couche reçoit les cartes de caractéristiques de toutes les couches précédentes comme entrées et transmet sa propre sortie à toutes les couches suivantes. Cette conception contraste avec les réseaux convolutifs traditionnels, où les couches sont connectées séquentiellement, et avec les réseaux résiduels (ResNets), qui utilisent des connexions de saut pour additionner l'entrée d'un bloc à sa sortie.

L'idée centrale de DenseNet est de maximiser le flux d'informations entre les couches, ce qui aide à atténuer le problème du gradient vanishing dans les réseaux profonds. En concaténant les cartes de caractéristiques plutôt qu'en les additionnant, DenseNet favorise la réutilisation des caractéristiques, réduit le nombre de paramètres et encourage un fort flux de gradient pendant l'entraînement. L'architecture a été largement adoptée dans des tâches telles que la classification d'images, la segmentation et la détection d'objets, et elle a influencé les conceptions de réseaux ultérieures.

Architecture

Un DenseNet est composé de plusieurs blocs denses, chacun contenant un certain nombre de couches. Au sein d'un bloc dense, chaque couche effectue une normalisation par lots, une activation par unité linéaire rectifiée (ReLU) et une convolution 3x3. La sortie de chaque couche est concaténée avec les entrées de toutes les couches précédentes du bloc, créant un motif de connectivité dense. Si un bloc a \(L\) couches, le nombre total de connexions est \(L(L+1)/2\).

Entre les blocs denses, des couches de transition sont utilisées pour réduire les dimensions spatiales et le nombre de cartes de caractéristiques. Une couche de transition consiste en une normalisation par lots, une convolution 1x1 et une opération de pooling moyen 2x2. Le facteur de compression, souvent fixé à 0,5, contrôle le nombre de cartes de caractéristiques conservées après la transition.

Un taux de croissance \(k\) détermine combien de nouvelles cartes de caractéristiques chaque couche produit. Par exemple, avec \(k=32\), chaque couche ajoute 32 cartes de caractéristiques à l'entrée collective. Ce paramètre équilibre la capacité du modèle et le coût computationnel. Les variantes courantes de DenseNet incluent DenseNet-121, DenseNet-169, DenseNet-201 et DenseNet-264, où le nombre indique le nombre total de couches.

Mathématiques

Dans un bloc dense, soit \(x_0\) l'entrée du bloc. Pour la couche \(\ell\), l'entrée est la concaténation des sorties de toutes les couches précédentes : \([x_0, x_1, \dots, x_{\ell-1}]\). La couche calcule une fonction composite \(H_\ell\) (qui inclut la normalisation par lots, ReLU et la convolution) et produit \(x_\ell = H_\ell([x_0, x_1, \dots, x_{\ell-1}])\). Cette opération de concaténation est la différence clé par rapport aux connexions résiduelles, qui utilisent l'addition.

La connectivité dense garantit que chaque couche a un accès direct aux gradients de la fonction de perte, atténuant ainsi le problème du gradient vanishing. Les auteurs ont montré que l'architecture a un effet régularisant, réduisant le surapprentissage sur les petits ensembles de données.

Entraînement et optimisation

Les DenseNets sont entraînés à l'aide de techniques standard de apprentissage profond, telles que la descente de gradient stochastique avec momentum ou Adam. Les réseaux utilisent souvent de la augmentation de données (par exemple, recadrage aléatoire, retournement et variation de couleur) pour améliorer la généralisation. La normalisation par lots est appliquée avant chaque activation, ce qui stabilise l'entraînement et permet des taux d'apprentissage plus élevés.

Lors du défi de reconnaissance visuelle à grande échelle ImageNet (ILSVRC) 2017, DenseNet a obtenu des résultats de pointe, avec un taux d'erreur top-5 de 5,11 % pour DenseNet-201, surpassant des architectures précédentes comme ResNet. Le modèle a également démontré une efficacité en termes de paramètres, nécessitant moins de paramètres que des ResNets comparables pour atteindre une précision similaire.

Applications et impact

DenseNet a été appliqué à divers domaines au-delà de la classification d'images, notamment la segmentation d'images médicales, la télédétection et l'analyse vidéo. Ses principes de conception ont inspiré d'autres architectures, telles que le réseau à double chemin (DPN) et le réseau dense multi-échelle. Le concept de connectivité dense a également été exploré dans les modèles transformers, bien que l'approche dominante y reste les connexions résiduelles.

L'architecture est disponible dans les frameworks d'apprentissage profond populaires, tels que PyTorch et TensorFlow, et est souvent utilisée comme backbone dans les modèles de détection d'objets et de segmentation. Son succès a contribué à la tendance plus large de conception de réseaux convolutifs de plus en plus profonds et efficaces, aux côtés de ResNet et U-Net.

Limites et extensions

Malgré ses forces, DenseNet peut être gourmand en mémoire en raison de la concaténation des cartes de caractéristiques, ce qui augmente les besoins de stockage intermédiaire. Les chercheurs ont proposé des variantes pour remédier à cela, telles que DenseNet-BC (bottleneck et compression) et les réseaux convolutifs parcimonieux de sous-variétés pour les données 3D. L'architecture a également tendance à être plus lente en inférence par rapport à certaines conceptions plus récentes, comme EfficientNet.

Dans l'ensemble, DenseNet reste une architecture fondamentale en vision par ordinateur, démontrant les avantages de la connectivité dense pour la réutilisation des caractéristiques et le flux de gradient. Ses idées continuent d'influencer la conception moderne des réseaux, en particulier dans les scénarios où l'efficacité des paramètres et la précision sont critiques.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:deep-learning·computer-vision·convolutional-neural-network·neural-network-architecture
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique