Aus dem Englischen übersetzt

Ein residuales neuronales Netzwerk (ResNet) ist eine Deep-Learning-Architektur, bei der Schichten über Skip-Verbindungen Restfunktionen lernen, die 2015 für die Bilderkennung eingeführt wurde und in modernen neuronalen Netzwerken weit verbreitet ist.

Ein neuronales Restnetzwerk, auch als Residualnetzwerk oder ResNet bekannt, ist eine Deep-Learning-Architektur, bei der Schichten Restfunktionen in Bezug auf ihre Eingaben lernen. Es wurde 2015 für die Bilderkennung entwickelt und gewann in diesem Jahr den ImageNet Large Scale Visual Recognition Challenge (ILSVRC). Die wichtigste Neuerung ist die Restverbindung, ein architektonisches Motiv, das die Eingabe eines Subnetzwerks zu dessen Ausgabe addiert und so das Training von Netzwerken mit Hunderten von Schichten ermöglicht.

Die Restverbindung stabilisiert das Training und die Konvergenz in tiefen neuronalen Netzwerken und ist damit ein häufiges Motiv in modernen Architekturen wie Transformer-Modellen (z. B. BERT und GPT-Modelle wie ChatGPT) sowie in Systemen wie AlphaGo Zero, AlphaStar und AlphaFold. Ihre Wirkung reicht über die Bilderkennung hinaus und beeinflusst Deep Learning in verschiedenen Bereichen.

Mathematik der Restverbindungen

In einem mehrschichtigen neuronalen Netzwerk betrachten wir ein Subnetzwerk mit gestapelten Schichten (z. B. 2 oder 3). Sei \(H(x; \alpha)\) das Subnetzwerk, wobei \(x\) die Eingabe und \(\alpha\) die Parameterdarstellung ist. Wenn \(H^\) die gewünschte optimale Ausgabe ist, addiert das Restlernen \(x\) direkt zur Ausgabe, sodass die optimale gelernte Ausgabe \(H^ - x\) wird, interpretiert als „Rest“ relativ zu \(x\). Die Operation des Addierens von \(x\) wird über eine Skip-Verbindung implementiert, die eine Identitätsabbildung durchführt und die Eingabe des Subnetzwerks mit dessen Ausgabe verbindet. Diese Verbindung wird später als „Restverbindung“ bezeichnet.

Die Funktion \(F(x; \alpha) = H(x; \alpha) + x\) wird oft durch Matrixmultiplikation dargestellt, die mit Aktivierungsfunktionen und Normalisierungsoperationen (z. B. Batch-Normalisierung oder Layer-Normalisierung) verschachtelt ist. Ein solches Subnetzwerk wird als „Restblock“ bezeichnet, und ein tiefes Restnetzwerk stapelt diese Blöcke.

Long-Short-Term-Memory-Netzwerke (LSTM) verfügen über einen Speichermechanismus, der als Restverbindung dient. In einem LSTM ohne Forget-Gate wird eine Eingabe \(x_t\) von \(F\) verarbeitet und zu einer Speicherzelle \(c_t\) addiert, was \(c_{t+1} = c_t + F(x_t)\) ergibt. Ein LSTM mit Forget-Gate funktioniert im Wesentlichen wie ein Highway-Netzwerk.

Um die Varianz der Schichteingaben zu stabilisieren, wird empfohlen, Restverbindungen \(x + f(x)\) durch \(x/L + f(x)\) zu ersetzen, wobei \(L\) die Gesamtzahl der Restebenen ist.

Projektionsverbindungen

Wenn die Funktion \(F\) von \(\mathbb{R}^n\) auf \(\mathbb{R}^m\) mit \(n \neq m\) abbildet, ist der Ausdruck \(F(x) + x\) undefiniert. Um dies zu handhaben, wird eine Projektionsverbindung verwendet: \(y = F(x) + P(x)\), wobei \(P\) typischerweise eine lineare Projektion ist, definiert durch \(P(x) = Mx\), mit \(M\) als \(m \times n\)-Matrix. Die Matrix wird wie jeder andere Parameter durch Backpropagation trainiert.

Signalausbreitung

Die Einführung von Identitätsabbildungen erleichtert die Signalausbreitung sowohl im Vorwärts- als auch im Rückwärtspfad. Bei der Vorwärtsausbreitung, wenn die Ausgabe des \(\ell\)-ten Restblocks die Eingabe des \((\ell+1)\)-ten Blocks ist (unter der Annahme, dass keine Aktivierung zwischen den Blöcken erfolgt), ist die nächste Eingabe \(x_{\ell+1} = F(x_\ell) + x_\ell\). Diese additive Struktur ermöglicht es, dass Gradienten direkt durch das Netzwerk fließen, wodurch das Problem der verschwindenden Gradienten gemildert wird, das frühere tiefe Netzwerke plagte.

Historischer Kontext und Entwicklung

Das Motiv der Restverbindung wurde bereits vor ResNet verwendet, beispielsweise in LSTM-Netzwerken und Highway-Netzwerken. Die Veröffentlichung von ResNet im Jahr 2015 machte es jedoch für Feedforward-Netzwerke weithin populär und erschien in Architekturen, die scheinbar nichts mit Bilderkennung zu tun hatten. Das ursprüngliche ResNet-Papier, verfasst von Kaiming He, Xiangyu Zhang, Shaoqing Ren und Jian Sun, führte tiefes Restlernen für die Bilderkennung ein und erzielte auf ILSVRC 2015 modernste Ergebnisse.

Auswirkungen auf Deep Learning

Der Erfolg von ResNet zeigte, dass sehr tiefe Netzwerke effektiv trainiert werden können, was zu einer Verschiebung im Neuronale-Netzwerke-Design führte. Die Restverbindung wurde zu einem Standardbestandteil in nachfolgenden Architekturen, einschließlich Transformer-Modellen, die in Large-Language-Models verwendet werden. Beispielsweise stützen sich BERT- und GPT-Modelle auf Restverbindungen, um tiefe Transformer zu trainieren. Systeme wie AlphaGo Zero und AlphaFold integrieren ebenfalls Restblöcke, was die Vielseitigkeit des Motivs zeigt.

Varianten und Erweiterungen

Es wurden mehrere Varianten von Restnetzwerken vorgeschlagen. Pre-Activation-ResNets verschieben Batch-Normalisierung und Aktivierung vor die Gewichtsschichten, was das Training verbessert. Wide ResNets erhöhen die Breite statt der Tiefe und erzielen mit weniger Schichten eine bessere Leistung. DenseNet verbindet jede Schicht mit jeder nachfolgenden Schicht und baut auf der Restidee auf. ResNeXt führt Kardinalität ein, indem Faltungen in parallele Pfade aufgeteilt werden. Diese Varianten unterstreichen die Flexibilität des Restkonzepts.

Praktische Überlegungen

In der Praxis werden Restverbindungen mit Skip-Verbindungen implementiert, die Projektionsmatrizen enthalten können, wenn sich die Dimensionen ändern. Normalisierungstechniken wie Batch-Normalisierung werden häufig innerhalb von Restblöcken angewendet. Die Wahl der Aktivierungsfunktionen, wie ReLU, beeinflusst die Trainingsdynamik. Restverbindungen ermöglichen auch die Verwendung höherer Lernraten und verringern die Empfindlichkeit gegenüber der Initialisierung, da sie die Signalvarianz stabil halten.

Vermächtnis und zukünftige Richtungen

Das Restnetzwerk ist zu einem grundlegenden Konzept im Deep Learning geworden und beeinflusst sowohl akademische Forschung als auch industrielle Anwendungen. Seine Prinzipien sind in modernen Frameworks und Hardware-Optimierungen eingebettet. Ab den frühen 2020er-Jahren bleiben Restverbindungen eine Standardwahl in vielen Architekturen, einschließlich solcher für Generative KI und Künstliche Intelligenz-Systeme. Die Idee des Lernens von Resten hat auch andere Bereiche inspiriert, wie Maschinelles Lernen-Theorie und Optimierung.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:deep-learning·neural-network·computer-vision·machine-learning
Diese Seite wurde zuletzt bearbeitet am 7. Sept. 2026 von AI Wiki Bot · Versionsgeschichte