Réseau de neurones convolutif

Traduit de l'anglais

Un réseau de neurones convolutif (CNN) est un réseau de neurones à propagation avant qui apprend des caractéristiques via l'optimisation de filtres, couramment utilisé pour des données de type grille telles que les images. Il emploie des couches convolutives, de pooling et entièrement connectées pour traiter et prédire à partir de divers types de données.

Un réseau de neurones convolutif (CNN) est un type de réseau de neurones à propagation avant qui apprend des caractéristiques via l'optimisation de filtres (ou noyaux). Ce type de réseau d'apprentissage profond a été appliqué pour traiter et faire des prédictions à partir de nombreux types de données différents, notamment le texte, les images et l'audio. Les CNN sont la norme de facto dans les approches basées sur l'apprentissage profond pour la vision par ordinateur et le traitement d'images, et n'ont que récemment été remplacés dans certains cas par des architectures plus récentes telles que le transformeur.

Les CNN sont également connus sous le nom de réseaux de neurones artificiels invariants par décalage ou invariants par l'espace, en raison de l'architecture à poids partagés des noyaux de convolution ou des filtres qui glissent le long des caractéristiques d'entrée et fournissent des réponses équivariantes par translation appelées cartes de caractéristiques. De manière contre-intuitive, la plupart des réseaux de neurones convolutifs ne sont pas invariants par translation, en raison de l'opération de sous-échantillonnage qu'ils appliquent à l'entrée.

Architecture

Un réseau de neurones convolutif se compose d'une couche d'entrée, de couches cachées et d'une couche de sortie. Dans un réseau de neurones convolutif, les couches cachées incluent une ou plusieurs couches qui effectuent des convolutions. Typiquement, cela inclut une couche qui effectue un produit scalaire du noyau de convolution avec la matrice d'entrée de la couche. Ce produit est généralement le produit intérieur de Frobenius, et sa fonction d'activation est couramment ReLU. Alors que le noyau de convolution glisse le long de la matrice d'entrée de la couche, l'opération de convolution génère une carte de caractéristiques, qui contribue à son tour à l'entrée de la couche suivante. Cela est suivi par d'autres couches telles que les couches de regroupement, les couches entièrement connectées et les couches de normalisation.

Couches convolutives

Dans un CNN, l'entrée est un tenseur de forme : (nombre d'entrées) × (hauteur d'entrée) × (largeur d'entrée) × (canaux d'entrée). Après avoir traversé une couche convolutive, l'image devient abstraite en une carte de caractéristiques, également appelée carte d'activation, de forme : (nombre d'entrées) × (hauteur de la carte de caractéristiques) × (largeur de la carte de caractéristiques) × (canaux de la carte de caractéristiques). Les couches convolutives convoluent l'entrée et transmettent leur résultat à la couche suivante. Cela est similaire à la réponse d'un neurone du cortex visuel à un stimulus spécifique. Chaque neurone convolutif ne traite les données que pour son champ récepteur.

Bien que les réseaux de neurones à propagation avant entièrement connectés puissent être utilisés pour apprendre des caractéristiques et classer des données, cette architecture est généralement impraticable pour des entrées plus grandes (par exemple, des images haute résolution), qui nécessiteraient un nombre massif de neurones car chaque pixel est une caractéristique d'entrée pertinente. Une couche entièrement connectée pour une image de taille 100 × 100 a 10 000 poids pour chaque neurone de la deuxième couche. La convolution réduit le nombre de paramètres libres, permettant au réseau d'être plus profond. Par exemple, en utilisant une région de tuilage de 5 × 5, chacune avec les mêmes poids partagés, seuls 25 neurones sont nécessaires. L'utilisation de poids partagés signifie qu'il y a beaucoup moins de paramètres, ce qui aide à éviter les problèmes de gradients évanescents et de gradients explosifs observés lors de la rétropropagation dans les réseaux de neurones antérieurs.

Pour accélérer le traitement, les couches convolutives standard peuvent être remplacées par des couches convolutives séparables en profondeur, qui sont basées sur une convolution en profondeur suivie d'une convolution ponctuelle. La convolution en profondeur est une convolution spatiale appliquée indépendamment sur chaque canal du tenseur d'entrée, tandis que la convolution ponctuelle est une convolution standard restreinte à l'utilisation de noyaux de 1 × 1.

Couches de regroupement

Les réseaux convolutifs peuvent inclure des couches de regroupement locales et/ou globales ainsi que des couches convolutives traditionnelles. Les couches de regroupement réduisent les dimensions des données en combinant les sorties de groupes de neurones d'une couche en un seul neurone de la couche suivante. Le regroupement local combine de petits groupes, avec des tailles de tuilage telles que 2 × 2 couramment utilisées. Le regroupement global agit sur tous les neurones de la carte de caractéristiques. Il existe deux types courants de regroupement en usage populaire : le maximum et la moyenne. Le regroupement par maximum utilise la valeur maximale de chaque groupe local de neurones dans la carte de caractéristiques, tandis que le regroupement par moyenne prend la valeur moyenne.

Couches entièrement connectées

Les couches entièrement connectées connectent chaque neurone d'une couche à chaque neurone d'une autre couche. Cela est identique à un réseau de neurones à perceptron multicouche traditionnel (MLP). Chaque neurone de la couche entièrement connectée reçoit une entrée de tous les neurones de la couche précédente. Ces entrées sont pondérées et additionnées avec les biais correspondants, puis passent à travers une fonction d'activation pour effectuer une transformation non linéaire, générant la sortie. La matrice aplatie passe à travers une couche entièrement connectée pour classer les images.

Inspiration biologique

Les réseaux convolutifs ont été inspirés par des processus biologiques en ce que le modèle de connectivité entre les neurones ressemble à l'organisation du cortex visuel animal. Les neurones corticaux individuels répondent à des stimuli uniquement dans une région restreinte du champ visuel connue sous le nom de champ récepteur. Les champs récepteurs de différents neurones se chevauchent partiellement de sorte qu'ils couvrent tout le champ visuel. Cette analogie biologique a motivé la conception des couches convolutives, où chaque neurone traite l'entrée d'une région locale, imitant la structure du champ récepteur.

Régularisation et surapprentissage

Les réseaux de neurones à propagation avant sont généralement des réseaux entièrement connectés, c'est-à-dire que chaque neurone d'une couche est connecté à tous les neurones de la couche suivante. La « connectivité complète » de ces réseaux les rend sujets au surapprentissage des données. Les méthodes typiques de régularisation, ou de prévention du surapprentissage, incluent la pénalisation des paramètres pendant l'entraînement (comme la décroissance du poids) ou la réduction de la connectivité (connexions sautées, abandon, etc.). Des ensembles de données robustes augmentent également la probabilité que les CNN apprennent les principes généralisés qui caractérisent un ensemble de données donné plutôt que les biais d'un ensemble peu peuplé. De plus, l'architecture à poids partagés des CNN réduit intrinsèquement le nombre de paramètres, fournissant une forme de régularisation qui aide à atténuer le surapprentissage.

Applications

Certaines applications des CNN incluent la reconnaissance d'images et de vidéos, les systèmes de recommandation, la classification d'images, la segmentation d'images, l'analyse d'images médicales, le traitement du langage naturel, les interfaces cerveau-ordinateur et les séries temporelles financières. En vision par ordinateur, les CNN ont été largement utilisés pour des tâches telles que la détection d'objets, la reconnaissance faciale et la conduite autonome. En traitement du langage naturel, les CNN ont été appliqués à la classification de textes et à l'analyse des sentiments, bien qu'ils aient été largement supplantés par des modèles basés sur le transformeur dans de nombreuses tâches de ce type. La polyvalence des CNN découle de leur capacité à apprendre des caractéristiques hiérarchiques, des bords de bas niveau aux concepts sémantiques de haut niveau.

Avantages et limites

Les CNN utilisent relativement peu de prétraitement par rapport à d'autres algorithmes de classification d'images. Cela signifie que le réseau apprend à optimiser les filtres (ou noyaux) grâce à un apprentissage automatisé, alors que dans les algorithmes traditionnels, ces filtres sont conçus manuellement. Cela simplifie et automatise le processus, améliorant l'efficacité et l'évolutivité, et surmontant les goulots d'étranglement liés à l'intervention humaine. Cependant, les CNN ne sont pas intrinsèquement invariants par translation en raison des opérations de sous-échantillonnage, ce qui peut être une limitation dans certaines tâches. De plus, bien que les CNN aient dominé la vision par ordinateur, des architectures plus récentes telles que les transformeurs ont commencé à les remplacer dans certaines applications, en particulier lorsque des données à grande échelle et des ressources de calcul sont disponibles.

Relation avec d'autres types de réseaux de neurones

Les CNN sont une forme spécialisée de réseau de neurones et un sous-ensemble des architectures de apprentissage profond. Ils diffèrent des réseaux entièrement connectés par leur utilisation de couches convolutives et de regroupement, qui réduisent le nombre de paramètres et permettent une extraction hiérarchique des caractéristiques. Par rapport aux transformeurs, qui reposent sur des mécanismes d'attention, les CNN utilisent des champs récepteurs locaux et des poids partagés, ce qui les rend plus efficaces en termes de paramètres pour les données en forme de grille, mais moins capables de capturer les dépendances à longue portée sans modifications supplémentaires. Malgré l'essor des transformeurs, les CNN restent une architecture fondamentale dans le apprentissage automatique et continuent d'être utilisés dans des modèles hybrides qui combinent des composants convolutifs et basés sur l'attention.

Orientations futures

La recherche continue d'améliorer les CNN, y compris les développements dans les convolutions séparables en profondeur pour l'efficacité, les connexions résiduelles pour traiter les gradients évanescents, et l'intégration avec d'autres architectures. Des techniques telles que la normalisation par lots et l'abandon sont couramment utilisées pour stabiliser l'entraînement et prévenir le surapprentissage. Au début des années 2020, les CNN restent un outil standard en vision par ordinateur, mais leur domination est contestée par les modèles basés sur les transformeurs, en particulier dans les contextes à grande échelle. Les travaux en cours visent à combiner les forces des deux approches, conduisant à des modèles plus robustes et efficaces pour une large gamme d'applications.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:deep-learning·computer-vision·neural-networks
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique