In künstlichen neuronalen Netzen ist eine verborgene Schicht eine Schicht künstlicher Neuronen, die sich zwischen der Eingabeschicht und der Ausgabeschicht befindet. Der Begriff „verborgen“ spiegelt wider, dass diese Schichten nicht direkt mit der externen Umgebung interagieren; ihre Aktivierungen sind intern im Netzwerk. Die einfachsten Architekturen, die verborgene Schichten enthalten, sind mehrschichtige Perzeptren (MLPs), bei denen jedes Neuron in einer verborgenen Schicht gewichtete Eingaben von der vorherigen Schicht erhält, eine Aktivierungsfunktion anwendet und seine Ausgabe an die nächste Schicht weitergibt.
Ein Netzwerk ohne verborgene Schicht, wie ein einlagiges Perzeptron, ist im Wesentlichen ein lineares Modell. Es kann nur Daten trennen, die linear separierbar sind. Das Hinzufügen einer oder mehrerer verborgener Schichten, kombiniert mit nichtlinearen Aktivierungsfunktionen, führt in das Modell eine Nichtlinearität ein. Dies ermöglicht dem Netzwerk, komplexe, nichtlineare Funktionen zu approximieren, was ein grundlegendes maschinelles Lernen deep Learning Anwendungen zugrunde liegt.
Rolle beim Lernen und Training
In der typischen Praxis des maschinellen Lernens werden die Gewichte und Bias aller Schichten, einschließlich der versteckten Schichten, initialisiert, oft mit zufälligen Werten oder unter Verwendung von Schemen wie Gewichtsinitialisierung. Während des Trainings werden diese Parameter iterativ über Backpropagation aktualisiert, eine Methode, die Gradienten einer Verlustfunktion in Bezug auf jeden Parameter berechnet. Die versteckten Schichten lernen schrittweise Zwischenrepräsentationen der Eingabedaten und transformieren rohe Merkmale in abstrakter e Formen für den letztendlichen Ausgang.
Die Tiefe eines Netzwerks, definiert durch die Anzahl der versteckten Schichten, ist ein Schlüsselfaktor für seine Kapazität. Tiefe Netzwerke mit vielen versteckten Schichten können hierarchische Merkmale erfassen, wie sie in neuronalen Netzen-Architekturen für die Bilderkennung oder das Verständnis natürlicher Sprache (natural language processing) auftreten. Tiefere Netzwerke bringen jedoch auch Herausforderungen wie verschwindende Gradienten mit sich, die durch Techniken wie Batch-Normalisierung, Layer-Normalisierung und Residual-Netzwerk-Verbindungen angegangen wurden.
Typen und Variationen
Die versteckten Schichten können je nach Netzwerkarchitektur unterschiedlich strukturiert sein. In vollständig verbundenen Schichten ist jedes Neuron mit allen Neuronen der vorherigen Schicht verbunden, was bei MLPs üblich ist. Faltende (convolutional) Schichten, die bei Bildaufgaben verwendet werden, wenden Filter lokal an und teilen Gewichtungen. Wiederkehrende (recurrent) Schichten, die sich in Sequenzmodellen finden, halten einen internen Zustand über Zeitschritte. In Transformator-Modellen enthalten die versteckten Schichten oft [[multi-head-attention|Multi-Kopf-Aufmerksamkeits