Aus dem Englischen übersetzt

LeNet-5 ist ein wegweisendes konvolutionelles neuronales Netzwerk, das 1998 bei den AT&T Bell Laboratories für die Erkennung handgeschriebener Ziffern entwickelt wurde und historisch bedeutsam im Deep Learning ist.

LeNet-5 ist eine Architektur für faltende neuronale Netze, die von einer Forschungsgruppe bei AT&T Bell Laboratories um Yann LeCun entwickelt und 1998 veröffentlicht wurde. Es ist die bekannteste Version der LeNet-Serie, die für das Lesen kleiner Graustufenbilder von handgeschriebenen Ziffern und Buchstaben entwickelt wurde. LeNet-5 ist historisch bedeutsam als eines der frühesten faltenden neuronalen Netze und ein grundlegender Beitrag zur Entwicklung des Deep Learnings, der viele moderne Architekturen beeinflusst hat.

Faltende neuronale Netze sind eine Art von vorwärtsgerichteten neuronalen Netzen, deren künstliche Neuronen auf einen Teil der umgebenden Zellen im Abdeckungsbereich reagieren können und bei der Verarbeitung großer Bilder gut abschneiden. LeNet-5 veranschaulicht dies, indem es faltende Schichten zur Extraktion räumlicher Merkmale, Pooling-Schichten zur Unterabtastung und vollständig verbundene Schichten zur Klassifikation verwendet. Sein Erfolg in praktischen Anwendungen, wie dem Lesen von Millionen von Schecks pro Tag, zeigte die Tragfähigkeit neuronaler Netze in realen Aufgaben.

Entwicklungsgeschichte

Die Ursprünge von LeNet reichen bis ins Jahr 1988 zurück, als Yann LeCun der Abteilung für Adaptive Systemforschung bei AT&T Bell Laboratories in Holmdel, New Jersey, beitrat, die von Lawrence D. Jackel geleitet wurde. Ende November 1988 veröffentlichten John S. Denker und Kollegen ein neuronales Netzdesign zur Erkennung handgeschriebener Postleitzahlen, obwohl dessen frühe Schichten manuell abgestimmt waren. Im Jahr 1989 wandten LeCun und sein Team den Backpropagation-Algorithmus erstmals auf praktische Anwendungen an, indem sie faltende neuronale Netze mit Backpropagation kombinierten, um handgeschriebene Zahlen zu lesen. Dieser Prototyp, später LeNet-1 genannt, wurde erfolgreich zur Identifizierung handgeschriebener Postleitzahlen des US-Postdienstes eingesetzt und erreichte eine Fehlerrate von nur 1 % bei einer Rückweisungsrate von etwa 9 %.

In den folgenden vier Jahren wurde die Forschung fortgesetzt, was 1994 zur Entwicklung der MNIST-Datenbank führte. LeNet-1 war für diesen neuen Datensatz zu klein, was die Erstellung von LeNet-4 anregte. Bis 1998 beschrieben Yann LeCun, Leon Bottou, Yoshua Bengio und Patrick Haffner LeNet-5 in einem Artikel, der auch praktische Anwendungen zeigte, darunter Systeme zur Erkennung handgeschriebener Zeichen und Modelle, die Millionen von Schecks pro Tag lesen konnten. Diese Arbeit weckte großes Interesse an der Forschung zu neuronalen Netzen, und obwohl sich moderne Architekturen unterscheiden, diente LeNet als Ausgangspunkt für viele spätere Designs.

Architektur

LeNet-5 enthält mehrere Motive, die in modernen faltenden neuronalen Netzen üblich sind, darunter faltende Schichten, Pooling-Schichten und vollständig verbundene Schichten. Jede faltende Schicht umfasst drei Teile: Faltung, Pooling und eine nichtlineare Aktivierungsfunktion, typischerweise die Tanh-Funktion. Das Netzwerk verwendet Faltung zur Extraktion räumlicher Merkmale, mit dem Konzept rezeptiver Felder, und verwendet durchschnittliches Pooling zur Unterabtastung. Die letzten Schichten sind vollständig verbunden für die Klassifikation, und dünn besetzte Verbindungen zwischen Schichten reduzieren die Rechenkomplexität.

Der Bericht von 1989 von LeCun et al. führte Netzwerke mit den Bezeichnungen Net-1 bis Net-5 ein, mit verschiedenen Verfeinerungen, die zum LeNet-5 von 1998 führten. Die Benennung ist inkonsistent, und es ist unklar, worauf sich LeNet-2 und LeNet-3 beziehen könnten. LeNet-1, LeNet-4 und LeNet-5 sind gut dokumentiert, aber die Zwischenversionen sind es nicht.

Frühe Prototypen

Das erste neuronale Netz, das 1988 von der LeCun-Gruppe veröffentlicht wurde, war ein hybrider Ansatz. Seine erste Stufe skalierte, entzerrte und skeletierte das Eingabebild. Die zweite Stufe verwendete eine faltende Schicht mit 18 handgestalteten Kernen, und die dritte Stufe war ein vollständig verbundenes Netz mit einer verborgenen Schicht. Der Datensatz bestand aus handgeschriebenen Ziffernbildern, die aus tatsächlicher US-Post extrahiert wurden, demselben Datensatz, der im berühmten Bericht von 1989 verwendet wurde.

Net-1 bis Net-5

Der Bericht von 1989 beschrieb Net-1 bis Net-5, alle mit vollständig verbundenen letzten Schichten. Das ursprüngliche Papier erklärt die Padding-Strategie nicht, und alle Zellen haben unabhängige Bias-Werte, einschließlich der Ausgabezellen faltender Schichten.

  • Net-1: Keine verborgene Schicht, vollständig verbunden, Abbildung von (16×16) auf 10 Ausgaben.
  • Net-2: Eine verborgene vollständig verbundene Schicht mit 12 verborgenen Einheiten, Abbildung von (16×16) auf 12 auf 10.
  • Net-3: Zwei verborgene faltende Schichten, Abbildung von (16×16) auf (8×8) auf (4×4) auf 10, mit lokal verbundenen Schichten unter Verwendung von 3×3-Eingabeformen und Schrittweite 2.
  • Net-4: Zwei verborgene Schichten, die erste faltend und die zweite lokal verbunden, Abbildung von (16×16) auf (8×8×2) auf (4×4) auf 10, wobei die Faltungsschicht 2 Kerne der Form 3×3 und Schrittweite 2 hat.
  • Net-5: Die endgültige Version, LeNet-5, verfeinerte diese Konzepte zu einer tieferen Architektur mit mehreren faltenden und Pooling-Schichten, die in vollständig verbundenen Schichten zur Klassifikation gipfelt.

Einfluss und Vermächtnis

Die Designprinzipien von LeNet-5, wie faltende Merkmalsextraktion und Unterabtastung, wurden grundlegend für das Deep Learning. Es zeigte, dass die Minimierung der Anzahl freier Parameter in einem neuronalen Netz die Generalisierung verbessern kann, eine wichtige Erkenntnis für spätere Architekturen. Der Erfolg des Netzwerks beim Lesen handgeschriebener Schecks an Geldautomaten und Postleitzahlen beeinflusste sowohl akademische Forschung als auch kommerzielle Anwendungen. Obwohl sich moderne neuronale Netze erheblich weiterentwickelt haben, bleibt LeNet-5 ein historischer Meilenstein, der oft als Vorläufer zeitgenössischer Deep-Learning-Modelle und als Katalysator für die breitere Einführung von Neuronalen-Netze-Ansätzen im maschinellen Lernen und in der künstlichen Intelligenz zitiert wird.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:convolutional-neural-networks·deep-learning·neural-network-architectures·handwritten-digit-recognition
Diese Seite wurde zuletzt bearbeitet am 12. Sept. 2026 von AI Wiki Bot · Versionsgeschichte