Traduit de l'anglais

Les réseaux entièrement convolutifs (FCN) sont une classe de réseaux de neurones profonds conçus pour la segmentation sémantique, remplaçant les couches entièrement connectées par des couches convolutives afin de produire des prédictions de classes au niveau du pixel.

Les réseaux entièrement convolutifs (FCN) sont une classe d'architectures de apprentissage profond conçues pour la segmentation sémantique, la tâche consistant à attribuer une étiquette de classe à chaque pixel d'une image. Contrairement aux réseaux de classification traditionnels qui produisent une seule étiquette pour une image entière, les FCN génèrent une carte de sortie dense de mêmes dimensions spatiales que l'entrée, permettant une compréhension au niveau du pixel. Introduits par Jonathan Long, Evan Shelhamer et Trevor Darrell à l'Université de Californie à Berkeley en 2015, les FCN ont été une contribution fondatrice à la vision par ordinateur moderne, influençant des architectures ultérieures telles que U-Net et bien d'autres.

L'innovation clé des FCN est le remplacement des couches entièrement connectées, typiquement utilisées dans les réseaux de classification comme AlexNet ou VGG, par des couches convolutives. Cela permet au réseau d'accepter des entrées de taille arbitraire et de produire des cartes spatiales plutôt que des vecteurs de longueur fixe. L'architecture comprend généralement un chemin de sous-échantillonnage (encodeur) qui extrait les caractéristiques, suivi d'un chemin de sur-échantillonnage (décodeur) qui restaure la résolution spatiale. Le sur-échantillonnage est souvent effectué à l'aide de convolutions transposées (également appelées déconvolutions) ou d'interpolation bilinéaire, et des connexions de saut peuvent être ajoutées pour affiner les contours.

Architecture et conception

Un FCN est construit sur un réseau de classification de base, tel que VGG-16 ou ResNet, dont les couches entièrement connectées sont converties en convolutions 1x1. Le réseau utilise ensuite une série de couches de convolution transposée pour sur-échantillonner les cartes de caractéristiques jusqu'à la résolution d'entrée. L'article original sur les FCN a introduit trois variantes : FCN-32s, FCN-16s et FCN-8s, qui diffèrent par le nombre de connexions de saut utilisées pour combiner des caractéristiques grossières de haut niveau avec des caractéristiques fines de bas niveau. FCN-8s, qui ajoute des prédictions provenant de couches antérieures, a obtenu la meilleure précision de segmentation parmi les trois.

L'entraînement d'un FCN nécessite une fonction de perte au niveau du pixel, typiquement l'entropie croisée, et utilise des techniques d'optimisation standard telles que la descente de gradient stochastique avec momentum. Les auteurs ont également employé des techniques comme la normalisation par lots et le dropout pour améliorer la convergence et la généralisation.

Applications et impact

Les FCN ont été appliqués à une large gamme de tâches au-delà de la segmentation sémantique, notamment l'analyse d'images médicales, la conduite autonome et la télédétection. En imagerie médicale, les FCN sont utilisés pour segmenter des organes ou des tumeurs dans des scanners CT et IRM, servant souvent de base à des modèles plus avancés comme U-Net. En conduite autonome, les FCN aident à identifier les limites de route, les piétons et les véhicules à partir de flux de caméras, contribuant aux systèmes développés par des entreprises comme Waymo et Tesla Autopilot.

L'impact des FCN s'étend au domaine plus large de l'intelligence artificielle, car ils ont démontré que les réseaux convolutifs peuvent être entraînés de bout en bout pour des tâches de prédiction dense sans nécessiter d'étapes de post-traitement séparées. Ce changement de paradigme a influencé les architectures ultérieures, y compris les modèles encodeur-décodeur et les approches basées sur l'attention.

Limitations et évolution

Malgré leur succès, les FCN présentent des limitations. Ils peuvent produire des cartes de segmentation grossières en raison de la perte de détails spatiaux lors du sous-échantillonnage, et ils peuvent avoir du mal avec les petits objets ou les structures fines. L'utilisation de convolutions transposées peut également introduire des artefacts en damier. Ces problèmes ont motivé le développement d'architectures plus sophistiquées, telles que U-Net avec ses connexions de saut étendues, et des modèles ultérieurs intégrant des mécanismes de multi-têtes d'attention.

Les modèles modernes de segmentation sémantique combinent souvent des encodeurs de style FCN avec des décodeurs transformers, comme on le voit dans des modèles tels que SegFormer, qui exploitent des encodages positionnels et de la attention croisée pour capturer les dépendances à longue portée. Néanmoins, les FCN restent un concept fondamental enseigné dans les cours de vision par ordinateur et une référence pour évaluer de nouvelles méthodes.

Entraînement et optimisation

L'entraînement des FCN nécessite une gestion attentive de la mémoire et du calcul, car les sorties denses sont gourmandes en mémoire. Des techniques telles que l'augmentation de données (par exemple, recadrage aléatoire, retournement) et la planification du taux d'apprentissage sont couramment employées. L'implémentation originale utilisait le framework Caffe et a été entraînée sur le jeu de données PASCAL VOC, atteignant des résultats de pointe à l'époque. Des travaux ultérieurs ont adapté les FCN à d'autres frameworks et jeux de données, notamment COCO et Cityscapes.

En pratique, les FCN sont souvent affinés à partir de réseaux de classification pré-entraînés, ce qui accélère la convergence et améliore la précision. Cette approche d'apprentissage par transfert est standard dans le apprentissage automatique et a été largement adoptée dans la recherche sur les réseaux de neurones.

Héritage

L'introduction des FCN a marqué un tournant dans la vision par ordinateur, démontrant que les réseaux profonds pouvaient résoudre directement des tâches de prédiction dense. Leurs principes sont intégrés dans d'innombrables systèmes modernes, des diagnostics médicaux aux véhicules autonomes. Au milieu des années 2020, les FCN sont toujours référencés dans la littérature académique et servent de brique de base pour des modèles plus avancés, soulignant leur pertinence durable dans la communauté du apprentissage profond.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·semantic-segmentation·deep-learning·neural-network
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique