Le perceptron est un algorithme d'apprentissage supervisé pour les classificateurs binaires, une fonction qui décide si une entrée, représentée par un vecteur de nombres, appartient à une classe spécifique. C'est un type de classificateur linéaire, effectuant des prédictions basées sur une fonction de prédiction linéaire qui combine un ensemble de poids avec le vecteur de caractéristiques. Le perceptron a été introduit par Frank Rosenblatt dans un article de 1958, qui détaillait son architecture et sa procédure d'apprentissage, et il est devenu l'un des modèles les plus anciens et les plus influents de l'histoire de l'intelligence artificielle et de l'apprentissage automatique.
L'article de 1958 décrivait un réseau de trois types de cellules : les unités sensorielles (S), d'association (A) et de réponse (R). Rosenblatt a présenté ce travail lors du premier symposium international sur l'IA, Mechanisation of Thought Processes, tenu en novembre 1958. L'article et les démonstrations qui ont suivi ont suscité à la fois enthousiasme et controverse, posant les bases des développements ultérieurs dans les réseaux de neurones et l'apprentissage profond.
Contexte et développement
Le neurone artificiel et le réseau de neurones artificiels ont été conçus pour la première fois en 1943 par Warren McCulloch et Walter Pitts dans leur article fondateur « A Logical Calculus of the Ideas Immanent in Nervous Activity ». En 1957, Rosenblatt, travaillant au Cornell Aeronautical Laboratory, a simulé le perceptron sur un IBM 704. Il était plus intéressé par les implémentations matérielles et a obtenu un financement de la branche des systèmes d'information du Bureau de la recherche navale des États-Unis et du Rome Air Development Center pour construire un ordinateur analogique sur mesure, le Mark I Perceptron. L'équipe de Rosenblatt a assemblé et testé la machine au Cornell Aeronautical Laboratory à Buffalo, New York, entre juin 1959 et le 14 décembre 1959. Sa première démonstration publique a eu lieu le 23 juin 1960.
Le projet a été financé sous les contrats Nonr-401(40) « Cognitive Systems Research Program » (1959-1970) et Nonr-2381(00) « Project PARA » (1957-1963), PARA signifiant « Perceiving and Recognition Automata ». En 1959, l'Institute for Defense Analysis a accordé un contrat de 10 000 dollars, et en septembre 1961, le Bureau de la recherche navale avait accordé d'autres contrats totalisant 153 000 dollars, avec 108 000 dollars engagés pour 1962. Le responsable de la recherche de l'ONR, Marvin Denicoff, a noté que l'ONR, plutôt que l'ARPA, avait financé le projet parce qu'il était peu susceptible de produire des résultats technologiques à court terme ; le financement de l'ARPA atteignait généralement des millions de dollars, tandis que les contrats de l'ONR étaient de l'ordre de dizaines de milliers. Pendant ce temps, J.C.R. Licklider, chef de l'IPTO à l'ARPA, avait été intéressé par les méthodes inspirées de la biologie dans les années 1950, mais au milieu des années 1960, il est devenu ouvertement critique à leur égard, favorisant l'approche logique de l'IA de Simon et Newell.
Machine Mark I Perceptron
Le perceptron était destiné à être une machine, pas seulement un programme. Bien que sa première implémentation ait été un logiciel pour l'IBM 704, il a ensuite été construit comme un matériel sur mesure, le Mark I Perceptron, conçu pour la reconnaissance d'images. La machine se trouve maintenant au Smithsonian National Museum of American History. Le Mark I Perceptron avait trois couches :
- Un réseau de 400 photocellules disposées en grille 20x20, appelées « unités sensorielles » (unités S), ou « rétine d'entrée ». Chaque unité S pouvait se connecter à jusqu'à 40 unités A.
- Une couche cachée de 512 perceptrons, appelée « unités d'association » (unités A).
- Une couche de sortie de huit perceptrons, appelée « unités de réponse » (unités R).
Rosenblatt a appelé ce réseau à trois couches l'alpha-perceptron, pour le distinguer d'autres modèles. Les unités S étaient connectées aux unités A de manière aléatoire via un panneau de connexion, en utilisant une table de nombres aléatoires, pour « éliminer tout biais intentionnel particulier dans le perceptron ». Les poids de connexion étaient fixes, non appris. Rosenblatt insistait sur les connexions aléatoires parce qu'il croyait que la rétine était connectée de manière aléatoire au cortex visuel, et il voulait que la machine ressemble à la perception visuelle humaine. Les unités A étaient connectées aux unités R avec des poids ajustables encodés dans des potentiomètres, et les mises à jour de poids pendant l'apprentissage étaient effectuées par des moteurs électriques.
Lors d'une conférence de presse de 1958 organisée par la marine américaine, Rosenblatt a fait des déclarations qui ont provoqué une controverse passionnée dans la communauté naissante de l'IA. Sur la base de ses remarques, The New York Times a rapporté que le perceptron était « l'embryon d'un ordinateur électronique que [la marine] espère capable de marcher, parler, voir, écrire, se reproduire et être conscient de son existence ». De 1960 à 1964, la division photo de la Central Intelligence Agency a étudié l'utilisation du Mark I Perceptron pour reconnaître des cibles silhouettées d'intérêt militaire, telles que des avions et des navires, dans des photos aériennes.
Principes de la neurodynamique (1962)
Rosenblatt a décrit ses expériences avec de nombreuses variantes du perceptron dans le livre Principles of Neurodynamics (1962), une version publiée d'un rapport de 1961. Parmi les variantes figuraient :
- « Couplage croisé » : connexions entre unités de la même couche, éventuellement avec des boucles fermées.
- « Rétrocouplage » : connexions d'unités d'une couche ultérieure à des unités d'une couche précédente.
- Perceptrons à quatre couches où les deux dernières couches avaient des poids ajustables, donc un véritable perceptron multicouche.
- Intégration de délais temporels aux unités de perceptron pour permettre le traitement de données séquentielles.
- Analyse de l'audio au lieu d'images.
La machine a été expédiée de Cornell au Smithsonian en 1967 dans le cadre d'un transfert gouvernemental administré par le Bureau de la recherche navale.
Perceptrons (1969) et limites
Bien que le perceptron ait semblé prometteur au départ, il a rapidement été prouvé que les perceptrons à une seule couche ne pouvaient pas être entraînés à reconnaître de nombreuses classes de motifs. Cela a provoqué une stagnation du domaine de la recherche sur les réseaux de neurones pendant de nombreuses années, jusqu'à ce qu'il soit reconnu qu'un réseau de neurones feedforward avec deux couches ou plus (un perceptron multicouche) avait une puissance de traitement supérieure à celle des perceptrons à une seule couche. Les perceptrons à une seule couche ne sont capables d'apprendre que des motifs linéairement séparables. Pour une tâche de classification avec une fonction d'activation par paliers, un seul nœud produit une seule ligne de séparation ; plus de nœuds peuvent créer plus de lignes, mais ces lignes doivent être combinées pour former des classifications plus complexes. Une deuxième couche de perceptrons, ou même de nœuds linéaires, est suffisante pour résoudre de nombreux problèmes autrement non séparables.
En 1969, le livre influent Perceptrons de Marvin Minsky et Seymour Papert a montré qu'il était impossible pour ces classes de réseaux d'apprendre une fonction XOR. Ce résultat, souvent mal interprété comme s'appliquant à tous les réseaux de neurones, a contribué à un déclin de la recherche sur les réseaux de neurones dans les années 1970, une période parfois appelée « hiver de l'IA ». L'héritage du perceptron a cependant persisté, et ses concepts sous-tendent les architectures modernes de réseaux de neurones, y compris les transformeurs utilisés dans les grands modèles de langage et les systèmes d'IA générative développés par des organisations telles que OpenAI, Google DeepMind et Anthropic.
Héritage et impact
L'article sur le perceptron et la machine Mark I ont établi des idées fondamentales dans l'apprentissage automatique, y compris l'utilisation de poids ajustables, l'apprentissage itératif et les architectures en couches. Le travail de Rosenblatt a influencé des développements ultérieurs tels que l'optimiseur Adam, la Backpropagation (bien que non détaillée ici) et les réseaux résiduels. Les limites du perceptron ont souligné la nécessité de réseaux multicouches, ce qui a finalement conduit à la révolution de l'apprentissage profond. Aujourd'hui, le perceptron reste un exemple canonique dans les cours d'introduction à l'IA, et ses principes sont intégrés dans des accélérateurs matériels modernes comme AWS Trainium et les TPU de Google Cloud, ainsi que dans la recherche dans des institutions telles que MIT CSAIL et Stanford AI Lab.
L'article de 1958 est largement considéré comme une étape importante dans l'histoire de l'intelligence artificielle, marquant la transition des modèles théoriques de neurones vers des algorithmes d'apprentissage pratiques. Son influence persiste dans la recherche contemporaine en IA, de l'apprentissage profond à l'apprentissage par renforcement et au-delà.