Réseaux de neurones entraînés instantanément

Traduit de l'anglais

Les réseaux de neurones à entraînement instantané sont des réseaux de neurones artificiels à propagation avant qui créent un nouveau neurone caché pour chaque échantillon d'entraînement inédit, utilisant un hyperplan le plus proche pour la généralisation. Proposés pour la première fois par Subhash Kak en 1993, ils ont été appliqués à la recherche web, à la prédiction financière et à la classification de documents.

Les réseaux neuronaux à apprentissage instantané sont une classe de réseaux neuronaux artificiels à propagation avant qui créent un nouveau nœud de neurone caché pour chaque échantillon d'apprentissage nouveau rencontré. Les poids assignés à ce neurone caché nouvellement créé sont conçus pour séparer non seulement l'échantillon d'apprentissage spécifique, mais aussi d'autres échantillons qui se trouvent à proximité, offrant ainsi une forme de généralisation. Cette séparation est obtenue en utilisant l'hyperplan le plus proche qui peut être écrit instantanément, sans optimisation itérative. Dans les deux implémentations les plus importantes, le voisinage de généralisation varie soit avec l'échantillon d'apprentissage (le réseau CC1), soit reste constant (le réseau CC4). Ces réseaux utilisent généralement un codage unaire pour une représentation efficace des ensembles de données d'entrée.

Le concept a été proposé pour la première fois dans un article de 1993 par Subhash Kak. Depuis cette introduction, les réseaux neuronaux à apprentissage instantané ont été suggérés comme modèles d'apprentissage à court terme dans les systèmes biologiques et ont été appliqués à des tâches pratiques telles que la recherche web, la prédiction de séries temporelles financières, la classification instantanée de documents, et comme composants dans les pipelines de apprentissage profond et d'exploration de données. Comme pour la plupart des réseaux neuronaux, leur utilisation normale est sous forme de logiciel, mais ils ont également été implémentés en matériel à l'aide de circuits intégrés à portes programmables (FPGA) et par des implémentations optiques.

Architecture du réseau CC4

Le réseau CC4 est une architecture à propagation avant à trois étages. Sa couche d'entrée contient un nombre de nœuds égal à la taille du vecteur d'apprentissage plus un nœud supplémentaire, qui sert de nœud de biais dont l'entrée est toujours définie à 1. Pour les vecteurs d'entrée binaires, les poids des nœuds d'entrée vers un neurone caché (indexé par j) correspondant à un vecteur entraîné sont définis par une formule spécifique. Pour chaque composante d'entrée xi, le poids wij est défini à -1 si xi est égal à 0, et à +1 si xi est égal à 1. Pour le nœud de biais (i = n+1), le poids est défini à r - s + 1, où r est le rayon de généralisation et s est le poids de Hamming (le nombre de 1) de la séquence binaire.

Les neurones de la couche cachée et les neurones de la couche de sortie utilisent tous deux une fonction d'activation par seuil : ils produisent 1 si la somme pondérée de leurs entrées est 0 ou positive, et 0 si la somme pondérée est négative. De la couche cachée à la couche de sortie, les poids sont soit 1, soit -1, selon que le vecteur correspondant appartient à une classe de sortie donnée. Cette architecture permet au réseau de classer de nouvelles entrées en fonction de leur proximité avec des échantillons d'apprentissage précédemment stockés, le rayon r contrôlant la taille du voisinage de généralisation.

Réseau CC1 et variations

Le réseau CC1 diffère du réseau CC4 en ce que le rayon de généralisation n'est pas constant mais varie avec chaque échantillon d'apprentissage. Cela permet au réseau d'adapter son comportement de généralisation localement, offrant potentiellement de meilleures performances dans les régions de l'espace d'entrée avec une densité de données variable. Le réseau CC4 a également été modifié pour accepter des vecteurs d'entrée non binaires, avec des rayons de généralisation variables, fournissant effectivement une implémentation CC1 dans le cadre CC4. Ces modifications étendent l'applicabilité des réseaux neuronaux à apprentissage instantané au-delà des données purement binaires.

Modèles d'apprentissage instantané connexes

Au-delà des architectures à propagation avant, d'autres modèles de réseaux neuronaux présentent également des capacités d'apprentissage instantané. Le réseau de Willshaw, un type de mémoire associative, peut stocker et récupérer des motifs en une seule présentation. De même, le réseau de Hopfield, un réseau neuronal récurrent utilisé pour la mémoire associative et l'optimisation, peut apprendre des motifs instantanément grâce à une règle d'apprentissage hebbienne en un seul passage. Ces réseaux à rétroaction partagent la propriété d'apprentissage rapide en un seul passage avec les réseaux neuronaux à apprentissage instantané à propagation avant, bien que leurs principes opérationnels et leurs applications diffèrent.

Applications et implémentations

Les réseaux neuronaux à apprentissage instantané ont été appliqués dans plusieurs domaines en raison de leur vitesse d'apprentissage rapide et de leur simplicité. Dans la recherche web, ils ont été utilisés pour la classification instantanée de documents, permettant une catégorisation rapide des pages web ou des résultats de recherche. Dans la prédiction de séries temporelles financières, leur capacité à apprendre de nouveaux points de données sans réentraîner l'ensemble du réseau les rend adaptés à la prévision adaptative. Ils ont également été explorés comme modèles d'apprentissage à court terme en sciences cognitives, où l'acquisition rapide de nouvelles informations est une caractéristique clé. Des implémentations matérielles utilisant des FPGA ont été démontrées, et des implémentations optiques ont été proposées, exploitant la nature parallèle des calculs du réseau.

Voir aussi

Liens externes

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-neural-networks·machine-learning·neural-network-architectures
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique