Das Perzeptron ist ein Algorithmus für das überwachte Lernen von binären Klassifikatoren, eine Funktion, die entscheidet, ob eine Eingabe, dargestellt durch einen Vektor von Zahlen, zu einer bestimmten Klasse gehört. Es ist eine Art linearer Klassifikator, der Vorhersagen auf der Grundlage einer linearen Vorhersagefunktion trifft, die eine Reihe von Gewichten mit dem Merkmalsvektor kombiniert. Das Perzeptron wurde von Frank Rosenblatt in einem Artikel von 1958 eingeführt, der seine Architektur und seinen Lernprozess detailliert beschrieb, und es wurde zu einem der frühesten und einflussreichsten Modelle in der Geschichte der künstlichen Intelligenz und des maschinellen Lernens.
Der Artikel von 1958 beschrieb ein Netzwerk aus drei Arten von Zellen: sensorische (S), Assoziations- (A) und Antwort-Einheiten (R). Rosenblatt präsentierte die Arbeit auf dem ersten internationalen Symposium über KI, Mechanisation of Thought Processes, das im November 1958 stattfand. Der Artikel und die anschließenden Demonstrationen lösten sowohl Begeisterung als auch Kontroversen aus und legten den Grundstein für spätere Entwicklungen in neuronalen Netzen und Deep Learning.
Hintergrund und Entwicklung
Das künstliche Neuron und das künstliche neuronale Netz wurden erstmals 1943 von Warren McCulloch und Walter Pitts in ihrem wegweisenden Artikel "A Logical Calculus of the Ideas Immanent in Nervous Activity" konzipiert. 1957 simulierte Rosenblatt, der am Cornell Aeronautical Laboratory arbeitete, das Perzeptron auf einem IBM 704. Er war mehr an Hardware-Implementierungen interessiert und erhielt Mittel von der Information Systems Branch des United States Office of Naval Research und dem Rome Air Development Center, um einen speziellen Analogcomputer, das Mark I Perceptron, zu bauen. Rosenblatts Team montierte und testete die Maschine am Cornell Aeronautical Laboratory in Buffalo, New York, zwischen Juni 1959 und dem 14. Dezember 1959. Ihre erste öffentliche Vorführung fand am 23. Juni 1960 statt.
Das Projekt wurde unter den Verträgen Nonr-401(40) "Cognitive Systems Research Program" (1959-1970) und Nonr-2381(00) "Project PARA" (1957-1963) finanziert, wobei PARA für "Perceiving and Recognition Automata" stand. 1959 vergab das Institute for Defense Analysis einen Vertrag über 10.000 US-Dollar, und bis September 1961 hatte das Office of Naval Research weitere Verträge in Höhe von insgesamt 153.000 US-Dollar vergeben, wobei 108.000 US-Dollar für 1962 zugesagt waren. Der ONR-Forschungsleiter Marvin Denicoff bemerkte, dass ONR und nicht ARPA das Projekt finanzierte, weil es unwahrscheinlich war, kurzfristige technologische Ergebnisse zu erzielen; ARPA-Finanzierungen erreichten typischerweise Millionenbeträge, während ONR-Verträge in der Größenordnung von Zehntausenden lagen. In der Zwischenzeit war J.C.R. Licklider, Leiter des IPTO bei ARPA, in den 1950er Jahren an biologisch inspirierten Methoden interessiert, wurde aber Mitte der 1960er Jahre offen kritisch gegenüber ihnen und bevorzugte den logischen KI-Ansatz von Simon und Newell.
Mark I Perceptron-Maschine
Das Perzeptron sollte eine Maschine sein, nicht nur ein Programm. Während seine erste Implementierung Software für den IBM 704 war, wurde es anschließend als kundenspezifische Hardware gebaut, das Mark I Perceptron, das für die Bilderkennung entwickelt wurde. Die Maschine befindet sich heute im Smithsonian National Museum of American History. Das Mark I Perceptron hatte drei Schichten:
- Ein Array von 400 Fotozellen, angeordnet in einem 20x20-Raster, genannt "sensorische Einheiten" (S-Einheiten) oder "Eingabe-Retina". Jede S-Einheit konnte mit bis zu 40 A-Einheiten verbunden werden.
- Eine versteckte Schicht von 512 Perzeptronen, genannt "Assoziationseinheiten" (A-Einheiten).
- Eine Ausgabeschicht von acht Perzeptronen, genannt "Antwort-Einheiten" (R-Einheiten).
Rosenblatt nannte dieses dreischichtige Netzwerk das Alpha-Perzeptron, um es von anderen Modellen zu unterscheiden. Die S-Einheiten wurden über eine Stecktafel unter Verwendung einer Tabelle von Zufallszahlen zufällig mit den A-Einheiten verbunden, um "jede besondere absichtliche Verzerrung im Perzeptron zu eliminieren". Die Verbindungsgewichte waren fest, nicht gelernt. Rosenblatt bestand auf zufälligen Verbindungen, weil er glaubte, dass die Netzhaut zufällig mit dem visuellen Kortex verbunden ist, und er wollte, dass die Maschine der menschlichen visuellen Wahrnehmung ähnelt. Die A-Einheiten waren mit den R-Einheiten über einstellbare Gewichte verbunden, die in Potentiometern kodiert waren, und Gewichtsaktualisierungen während des Lernens wurden von Elektromotoren durchgeführt.
In einer Pressekonferenz von 1958, die von der US-Marine organisiert wurde, machte Rosenblatt Aussagen, die in der aufkeimenden KI-Gemeinschaft heftige Kontroversen auslösten. Basierend auf seinen Bemerkungen berichtete The New York Times, dass das Perzeptron "der Embryo eines elektronischen Computers sei, von dem [die Marine] erwartet, dass er gehen, sprechen, sehen, schreiben, sich reproduzieren und sich seiner Existenz bewusst sein kann". Von 1960 bis 1964 untersuchte die Fotoabteilung der Central Intelligence Agency die Verwendung des Mark I Perceptron zur Erkennung militärisch interessanter Silhouettenziele, wie Flugzeuge und Schiffe, in Luftbildern.
Prinzipien der Neurodynamik (1962)
Rosenblatt beschrieb seine Experimente mit vielen Varianten des Perzeptrons in dem Buch Principles of Neurodynamics (1962), einer veröffentlichten Version eines Berichts von 1961. Zu den Varianten gehörten:
- "Kreuzkopplung": Verbindungen zwischen Einheiten innerhalb derselben Schicht, möglicherweise mit geschlossenen Schleifen.
- "Rückkopplung": Verbindungen von Einheiten in einer späteren Schicht zu Einheiten in einer früheren Schicht.
- Vierschichtige Perzeptronen, bei denen die letzten beiden Schichten einstellbare Gewichte hatten, also ein echtes mehrschichtiges Perzeptron.
- Einbeziehung von Zeitverzögerungen in Perzeptron-Einheiten, um die Verarbeitung sequenzieller Daten zu ermöglichen.
- Analyse von Audio anstelle von Bildern.
Die Maschine wurde 1967 unter einer von der Regierung verwalteten Übertragung, die vom Office of Naval Research verwaltet wurde, von Cornell an das Smithsonian verschifft.
Perceptrons (1969) und Einschränkungen
Obwohl das Perzeptron zunächst vielversprechend schien, wurde schnell bewiesen, dass einschichtige Perzeptronen nicht trainiert werden konnten, um viele Klassen von Mustern zu erkennen. Dies führte dazu, dass das Gebiet der neuronalen Netzwerkforschung viele Jahre lang stagnierte, bis erkannt wurde, dass ein vorwärtsgerichtetes neuronales Netzwerk mit zwei oder mehr Schichten (ein mehrschichtiges Perzeptron) eine größere Verarbeitungsleistung hatte als einschichtige Perzeptronen. Einschichtige Perzeptronen sind nur in der Lage, linear trennbare Muster zu lernen. Für eine Klassifikationsaufgabe mit einer Schrittaktivierungsfunktion erzeugt ein einzelner Knoten eine einzelne Trennlinie; mehr Knoten können mehr Linien erzeugen, aber diese Linien müssen kombiniert werden, um komplexere Klassifikationen zu bilden. Eine zweite Schicht von Perzeptronen oder sogar linearen Knoten reicht aus, um viele sonst nicht trennbare Probleme zu lösen.
1969 zeigte das einflussreiche Buch Perceptrons von Marvin Minsky und Seymour Papert, dass es für diese Klassen von Netzwerken unmöglich war, eine XOR-Funktion zu lernen. Dieses Ergebnis, das oft fälschlicherweise als auf alle neuronalen Netzwerke anwendbar interpretiert wird, trug zu einem Rückgang der neuronalen Netzwerkforschung in den 1970er Jahren bei, einer Zeit, die manchmal als "KI-Winter" bezeichnet wird. Das Vermächtnis des Perzeptrons blieb jedoch bestehen, und seine Konzepte bilden die Grundlage moderner neuronaler Netzwerkarchitekturen, einschließlich Transformatoren, die in großen Sprachmodellen und generativen KI-Systemen verwendet werden, die von Organisationen wie OpenAI, Google DeepMind und Anthropic entwickelt wurden.
Vermächtnis und Auswirkungen
Der Perzeptron-Artikel und die Mark I-Maschine etablierten grundlegende Ideen im maschinellen Lernen, einschließlich der Verwendung einstellbarer Gewichte, iterativen Lernens und geschichteter Architekturen. Rosenblatts Arbeit beeinflusste spätere Entwicklungen wie den Adam-Optimierer, Backpropagation (obwohl hier nicht detailliert) und Residualnetzwerke. Die Einschränkungen des Perzeptrons unterstrichen die Notwendigkeit mehrschichtiger Netzwerke, was schließlich zur Deep-Learning-Revolution führte. Heute bleibt das Perzeptron ein kanonisches Beispiel in einführenden KI-Kursen, und seine Prinzipien sind in modernen Hardware-Beschleunigern wie AWS Trainium und Google Cloud TPUs sowie in der Forschung an Institutionen wie MIT CSAIL und Stanford AI Lab eingebettet.
Der Artikel von 1958 wird weithin als Meilenstein in der Geschichte der künstlichen Intelligenz angesehen, der den Übergang von theoretischen Modellen von Neuronen zu praktischen Lernalgorithmen markiert. Sein Einfluss besteht in der zeitgenössischen KI-Forschung fort, von Deep Learning bis zu Verstärkungslernen und darüber hinaus.