Ein neuronales Netz ist ein Rechenmodell, das aus miteinander verbundenen Schichten einfacher Verarbeitungseinheiten besteht, lose inspiriert von biologischen Neuronen, deren Verbindungsstärken, auch Gewichte genannt, durch Training angepasst werden, um eine gewünschte Funktion anzunähern. Neuronale Netze bilden die zentrale Rechenstruktur hinter modernem Deep Learning und damit auch hinter den meisten heutigen Systemen der künstlichen Intelligenz.
Geschichte
Das früheste trainierbare neuronale Modell war das Perzeptron, eingeführt 1958, das mit einer einzelnen Schicht anpassbarer Gewichte einfache Muster klassifizieren konnte. Seine Einschränkungen, dokumentiert in einer Kritik von 1969, trugen zu einem breiten Verlust an Forschungsförderung bei, der als KI-Winter bekannt wurde. Das Interesse an mehrschichtigen Netzen erwachte in den 1980er Jahren mit der Popularisierung von Backpropagation, einem Algorithmus zur effizienten Berechnung, wie jedes Gewicht in einem Netzwerk geändert werden sollte, um Fehler zu reduzieren, was das praktische Training von Netzen mit verborgenen Schichten ermöglichte. Neuronale Netze entwickelten sich von einer Nischentechnik zum dominierenden Ansatz in der KI nach dem Erfolg von AlexNet im Jahr 2012, der zeigte, dass Netze mit vielen Schichten, trainiert auf großen Datensätzen mit Grafikprozessoren, frühere Methoden bei realen Aufgaben deutlich übertreffen konnten.
Struktur
Ein neuronales Netz ist in Schichten von Einheiten, auch Neuronen genannt, organisiert, wobei jede eine gewichtete Summe ihrer Eingaben berechnet und das Ergebnis durch eine nichtlineare Aktivierungsfunktion leitet, bevor es an die nächste Schicht gesendet wird. Netze mit vielen solcher Schichten zwischen Eingabe und Ausgabe werden als "tief" bezeichnet, was dem Deep Learning seinen Namen gibt. Während des Trainings misst eine Verlustfunktion die Abweichung zwischen der Ausgabe des Netzes und dem gewünschten Ergebnis, und Gradientenabstieg passt die Gewichte iterativ an, um diese Abweichung zu verringern, wobei Backpropagation die notwendigen Gradienten effizient über alle Schichten gleichzeitig liefert.
Architekturfamilien
Verschiedene Netzwerkarchitekturen eignen sich für verschiedene Arten von Daten. Faltungsneuronale Netze verwenden gemeinsame, räumlich lokale Filter und sind gut für Bilder geeignet. Rekurrente neuronale Netze, einschließlich der LSTM-Variante, verarbeiten Sequenzen Schritt für Schritt und wurden historisch für Text und Sprache verwendet, bevor sie durch die Transformer-Architektur verdrängt wurden, die ganze Sequenzen parallel mithilfe von Aufmerksamkeit verarbeitet. Generative Architekturen wie das Generative Adversarial Network und das Diffusionsmodell wenden neuronale Netze auf die Aufgabe an, neue Daten zu erzeugen, anstatt sie nur zu klassifizieren oder vorherzusagen.
Einschränkungen und Interpretierbarkeit
Neuronale Netze werden oft als "Black Boxes" kritisiert: Ihre internen Darstellungen sind für Menschen schwer zu inspizieren oder zu erklären, selbst wenn ihre Ausgaben genau sind. Dies hat ein Forschungsfeld motiviert, das manchmal als Interpretierbarkeit bezeichnet wird und versucht, zu rekonstruieren, was einzelne Komponenten eines trainierten Netzes repräsentieren. Trotz dieser Undurchsichtigkeit bleiben neuronale Netze das dominierende Werkzeug in Vision, Sprache, Audio und zunehmend auch in Robotik und wissenschaftlichen Anwendungen, hauptsächlich weil ihre Leistung weiterhin vorhersehbar mit mehr Daten, mehr Parametern und mehr Rechenleistung verbessert wird.