Le néocognitron est un réseau neuronal artificiel hiérarchique et multicouche proposé par Kunihiko Fukushima en 1979. Il a été conçu pour des tâches de reconnaissance de formes, telles que la reconnaissance de caractères japonais manuscrits, et est largement reconnu comme une inspiration directe pour les réseaux neuronaux convolutifs (CNN). Le modèle s'appuie sur des découvertes neurophysiologiques concernant le cortex visuel et a introduit des concepts clés comme l'extraction de caractéristiques locales et la tolérance aux décalages positionnels, qui restent centraux dans la vision par ordinateur moderne.
Les origines du néocognitron remontent à des travaux antérieurs de Fukushima. En 1969, il a publié une architecture similaire avec des noyaux conçus à la main, basés sur des convolutions observées dans la vision des mammifères. Il l'a affinée en Cognitron en 1975, puis en néocognitron en 1979, qui apprenait tous les noyaux convolutifs par apprentissage non supervisé, qu'il décrivait comme « auto-organisé par "apprentissage sans enseignant" ». Cette évolution a marqué un passage de caractéristiques spécifiées manuellement à des représentations apprises.
Inspiration biologique
Le néocognitron s'est inspiré du modèle du système visuel proposé par David Hubel et Torsten Wiesel en 1959. Leurs recherches sur le cortex strié du chat ont identifié deux types de cellules : les cellules simples, qui répondent à des bords et des barres orientés, et les cellules complexes, qui répondent à des caractéristiques similaires mais avec une plus grande invariance spatiale. Ils ont également proposé un modèle en cascade de ces types de cellules pour la reconnaissance de formes. Le néocognitron est une extension naturelle de cette idée de cascade, implémentant une architecture en couches qui imite le traitement hiérarchique de la voie visuelle.
Architecture et mécanismes
Le néocognitron se compose de plusieurs couches de cellules, les plus importantes étant les cellules S et les cellules C. Les cellules S extraient des caractéristiques locales, comme des bords ou des coins, à partir de leurs champs récepteurs. Les cellules C tolèrent de petites déformations, comme des décalages locaux, dans les caractéristiques détectées par les cellules S. À mesure que les signaux se propagent dans le réseau, les caractéristiques locales sont progressivement intégrées en représentations plus complexes et globales, permettant finalement la classification dans les couches supérieures. Ce principe d'intégration de caractéristiques locales se retrouve également dans d'autres modèles, notamment les réseaux neuronaux convolutifs, la méthode SIFT et la méthode HoG.
Une caractéristique notable du néocognitron est sa capacité à apprendre sans supervision. Les noyaux convolutifs sont auto-organisés par un processus d'apprentissage compétitif, permettant au réseau de découvrir des caractéristiques pertinentes à partir de motifs d'entrée sans données étiquetées. Cela contraste avec les méthodes d'apprentissage supervisé utilisées plus tard dans les CNN modernes.
Variantes et extensions
Différents types de néocognitron ont été développés pour répondre à diverses tâches. Certaines variantes peuvent détecter plusieurs motifs dans la même entrée en utilisant des signaux rétroactifs pour obtenir une attention sélective, permettant au modèle de se concentrer sur des objets ou des régions spécifiques. D'autres extensions ont intégré des améliorations dans les règles d'apprentissage, l'invariance à l'échelle et à la rotation, bien que l'architecture de base reste hiérarchique et biologiquement inspirée.
Héritage et influence
Le néocognitron est considéré comme un modèle fondateur dans l'intelligence artificielle et l'apprentissage automatique. Sa conception hiérarchique et convolutive a directement influencé le développement des CNN, qui sont devenus une pierre angulaire de la vision par ordinateur moderne et du apprentissage profond. Bien que le néocognitron lui-même soit moins couramment utilisé aujourd'hui, ses principes - champs récepteurs locaux, poids partagés et extraction hiérarchique de caractéristiques - sont intégrés dans pratiquement toutes les architectures convolutives contemporaines. Le modèle a également contribué à une meilleure compréhension de la manière dont la vision biologique peut informer les modèles computationnels.