Réseau neuronal capsule

Traduit de l'anglais

Un réseau neuronal à capsules (CapsNet) est un type de réseau neuronal artificiel qui modélise les relations hiérarchiques en ajoutant des structures appelées capsules, lesquelles produisent des vecteurs représentant la présence et la pose d'une entité, visant à mieux imiter l'organisation neuronale biologique.

Un réseau neuronal à capsules (CapsNet) est un type de réseau neuronal artificiel utilisé en apprentissage automatique pour mieux modéliser les relations hiérarchiques dans les données, en particulier dans la reconnaissance d'images. Cette approche tente de se rapprocher davantage de l'organisation neuronale biologique en introduisant des structures appelées capsules, qui sont des groupes de neurones encodant collectivement à la fois la probabilité de présence d'une entité et sa pose (telle que la position, la taille et l'orientation). Les CapsNets ont été développés pour remédier aux limitations des réseaux neuronaux convolutifs (CNN) traditionnels, notamment leur dépendance aux couches de regroupement (pooling) et leur difficulté à gérer les relations spatiales entre les parties d'un objet.

Les CapsNets exploitent le fait que, bien que les changements de point de vue aient des effets non linéaires au niveau des pixels, ils ont des effets linéaires au niveau des parties/objets. Cette propriété permet au réseau de reconnaître des objets indépendamment de leur pose, de manière similaire à l'inversion du rendu d'un objet composé de plusieurs parties. Parmi d'autres avantages, les CapsNets abordent le « problème de Picasso » dans la reconnaissance d'images, où les images contiennent toutes les parties correctes mais dans des relations spatiales incorrectes (par exemple, un visage avec un œil et une bouche échangés).

Histoire

Le concept des réseaux à capsules remonte à 2000, lorsque Geoffrey Hinton et ses collègues ont décrit un système d'imagerie combinant la segmentation et la reconnaissance en un seul processus d'inférence utilisant des arbres d'analyse. Ce système, appelé réseaux de crédibilité, modélisait la distribution conjointe sur les variables latentes et les arbres d'analyse possibles et s'est avéré utile sur la base de données de chiffres manuscrits MNIST. Dans l'idée originale de Hinton, une minicolonne représenterait et détecterait une entité multidimensionnelle.

Un mécanisme de routage dynamique pour les réseaux à capsules a été introduit par Hinton et son équipe en 2017. Cette approche prétendait réduire les taux d'erreur sur MNIST et réduire les tailles d'ensembles d'entraînement, avec des résultats considérablement meilleurs qu'un CNN sur des chiffres fortement superposés. Depuis lors, les CapsNets ont été étudiés pour diverses applications, bien qu'ils n'aient pas été aussi largement adoptés que d'autres architectures comme les transformeurs.

Transformations

En vision par ordinateur, comprendre les transformations est crucial. Un invariant est une propriété d'un objet qui ne change pas sous une transformation, comme l'aire d'un cercle lorsqu'il est déplacé. Un équivariant est une propriété qui change de manière prévisible, comme le centre d'un cercle qui se déplace avec le cercle. Un non-équivariant est une propriété qui ne change pas de manière prévisible, comme le périmètre d'un cercle transformé en ellipse.

Pour la reconnaissance d'objets, la classe d'un objet est généralement invariante sous de nombreuses transformations (un chat reste un chat lorsqu'il est déplacé ou mis à l'échelle), mais d'autres propriétés sont équivariantes, comme le volume d'un chat lorsqu'il est mis à l'échelle. Les propriétés équivariantes, y compris les relations spatiales, sont capturées dans une pose, qui décrit la translation, la rotation, l'échelle et la réflexion.

Les CapsNets non supervisés apprennent une variété linéaire globale entre un objet et sa pose comme une matrice de poids. Cela permet au réseau d'identifier un objet indépendamment de sa pose, plutôt que d'apprendre à reconnaître l'objet avec les relations spatiales incluses. La pose peut également incorporer des propriétés non spatiales, comme la couleur. Multiplier l'objet par la variété positionne l'objet dans l'espace.

Regroupement (Pooling)

Les CapsNets rejettent la stratégie de couche de regroupement des CNN conventionnels, qui réduit la quantité de détails traités aux couches supérieures. Le regroupement fournit une invariance translationnelle et permet plus de types de caractéristiques, mais les partisans des CapsNets soutiennent que le regroupement présente plusieurs inconvénients : il viole la perception de forme biologique en manquant de cadre de coordonnées intrinsèque ; il fournit une invariance (en écartant les informations de position) au lieu d'une équivariance (en désenchevêtrant ces informations) ; il ignore la variété linéaire sous-jacente aux variations d'image ; il route statiquement plutôt que de communiquer des « découvertes » potentielles à des caractéristiques qui peuvent les apprécier ; et il endommage les détecteurs de caractéristiques voisins en supprimant des informations dont ils dépendent.

Au lieu du regroupement, les CapsNets utilisent un routage par accord pour diriger dynamiquement les informations entre les couches, préservant ainsi les informations spatiales détaillées.

Capsules

Une capsule est un ensemble de neurones qui s'activent individuellement pour diverses propriétés d'un type d'objet, telles que la position, la taille et la teinte. Formellement, une capsule produit un vecteur d'activité avec un élément par neurone, contenant la valeur d'instanciation de ce neurone (par exemple, la teinte). Les programmes graphiques utilisent des valeurs d'instanciation pour dessiner des objets, et les CapsNets tentent de les dériver à partir de l'entrée. La probabilité de présence d'une entité est la longueur du vecteur, tandis que l'orientation du vecteur quantifie les propriétés de la capsule.

Les neurones artificiels traditionnels produisent une activation scalaire, mais les CapsNets remplacent les détecteurs de caractéristiques à sortie scalaire par des capsules à sortie vectorielle et le max-pooling par un routage par accord. Parce que les capsules sont indépendantes, lorsque plusieurs capsules s'accordent, la probabilité de détection correcte est beaucoup plus élevée. Par exemple, un cluster minimal de deux capsules considérant une entité à six dimensions s'accorderait à moins de 10 % par hasard seulement une fois sur un million d'essais ; la probabilité d'accord par hasard diminue exponentiellement avec plus de dimensions.

Les capsules des couches supérieures prennent les sorties des capsules des couches inférieures et acceptent celles dont les sorties se regroupent en cluster. Un cluster amène la capsule supérieure à produire une probabilité élevée de présence d'entité et une pose de haute dimension (20-50+). Les capsules de niveau supérieur ignorent les valeurs aberrantes, se concentrant sur les clusters, de manière similaire à la transformée de Hough, au RHT et au RANSAC du traitement d'image numérique classique.

Routage par accord

Le routage par accord est le mécanisme par lequel les sorties d'une capsule (enfant) sont routées vers des capsules de la couche suivante (parent) en fonction de la capacité de l'enfant à prédire les sorties des parents. Sur quelques itérations, la sortie de chaque parent peut converger avec les prédictions de certains enfants et diverger d'autres, indiquant si ce parent est présent ou absent.

Pour chaque parent possible, chaque enfant calcule un vecteur de prédiction en multipliant sa sortie par une matrice de poids entraînée par rétropropagation. La sortie du parent est ensuite calculée comme une somme pondérée des prédictions, où les poids représentent la probabilité qu'un enfant appartienne à ce parent. Un enfant dont les prédictions sont proches de la sortie résultante augmente son coefficient de couplage avec ce parent, tout en le diminuant pour les autres. Ce processus itératif permet au réseau d'allouer dynamiquement les ressources et d'améliorer la précision de reconnaissance.

Liens externes

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-neural-networks·machine-learning·computer-vision·deep-learning
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique