Aus dem Englischen übersetzt

Die Delta-Regel ist eine auf Gradientenabstieg basierende Lernregel, die verwendet wird, um Gewichte in einschichtigen neuronalen Netzen zu aktualisieren und den Fehler zwischen vorhergesagten und Zielausgaben zu minimieren. Sie wurde 1960 von Bernard Widrow und Marcian Hoff eingeführt.

Die Delta-Regel ist ein grundlegendes Lernalgorithmus im maschinellen Lernen, der verwendet wird, um die Gewichte eines einschichtigen neuronalen Netzes basierend auf dem Fehler zwischen der Ausgabe des Netzes und dem gewünschten Ziel anzupassen. Sie ist eine Form des Gradientenabstiegs, die den mittleren quadratischen Fehler zwischen der vorhergesagten Ausgabe und dem tatsächlichen Ziel minimiert. Die Regel aktualisiert jedes Gewicht proportional zum negativen Fehlergradienten, skaliert durch eine Lernrate. Sie ist historisch bedeutsam als eine der frühesten überwachten Lernregeln und bildet die Grundlage für spätere Entwicklungen im Deep Learning und in der künstlichen Intelligenz.

Die Delta-Regel wurde 1960 von Bernard Widrow und Marcian Hoff eingeführt, die sie für das ADALINE-Modell (Adaptive Linear Neuron) entwickelten. Ihre Arbeit am Stanford University etablierte eine prinzipielle Methode zum Training linearer Klassifikatoren, die sich von der früheren Perzeptron-Regel unterschied, die Gewichte nur bei falsch klassifizierten Beispielen korrigierte. Die Delta-Regel wendet dagegen eine kontinuierliche Fehlerkorrektur an, was sie robuster macht und in der Lage ist, nicht separierbare Daten zu verarbeiten.

Mathematische Formulierung

Für ein einschichtiges Netz mit Eingabevektor \(x\), Gewichtsvektor \(w\) und Zielausgabe \(t\) aktualisiert die Delta-Regel jedes Gewicht \(w_i\) wie folgt:

\[ \Delta w_i = \eta (t - y) x_i \]

wobei \(y\) die tatsächliche Ausgabe ist (oft eine lineare Kombination \(w \cdot x\)) und \(\eta\) die Lernrate darstellt. Der Term \((t - y)\) ist der Fehler, und das Produkt mit \(x_i\) ergibt den Gradienten des quadratischen Fehlers bezüglich \(w_i\). Diese Aktualisierung kann aus dem mittleren quadratischen Fehlerverlust abgeleitet werden, indem man dessen Ableitung nach jedem Gewicht nimmt.

Die Regel setzt eine lineare Aktivierungsfunktion oder zumindest eine differenzierbare voraus, was eine gradientenbasierte Optimierung ermöglicht. Für nichtlineare Aktivierungen erweitert die generalisierte Delta-Regel, auch bekannt als Backpropagation, diese Idee auf mehrschichtige Netze, indem Fehler durch verborgene Schichten rückwärts propagiert werden.

Beziehung zur Perzeptron-Regel

Die Perzeptron-Lernregel, eingeführt von Frank Rosenblatt im Jahr 1958, aktualisiert Gewichte nur, wenn das Netz einen Klassifikationsfehler macht, unter Verwendung einer binären Schwelle. Die Delta-Regel verbessert dies, indem sie Gewichte bei jedem Beispiel proportional zur Fehlergröße aktualisiert. Dies macht sie besser geeignet für Regressionsaufgaben und für Daten, die nicht linear separierbar sind, wo die Perzeptron-Regel möglicherweise nicht konvergiert. Die Delta-Regel konvergiert zu einer Lösung, die den mittleren quadratischen Fehler minimiert, selbst wenn eine perfekte Klassifikation unmöglich ist.

Historische Bedeutung und Einschränkungen

Widrows und Hoffs Arbeit an ADALINE und der Delta-Regel war ein Meilenstein in der frühen Neuronale-Netze-Forschung. Sie zeigte, dass gradientenbasierte Optimierung adaptive Systeme trainieren konnte, was spätere Entwicklungen wie den Adam-Optimierer und andere Varianten des stochastischen Gradientenabstiegs beeinflusste, die im modernen Deep Learning verwendet werden. Die Delta-Regel ist jedoch auf einschichtige Netze mit linearen Ausgaben beschränkt, was sie auf linear separierbare Probleme begrenzt. Diese Einschränkung trug zum sogenannten "KI-Winter" in den 1970er Jahren bei, da Forscher erkannten, dass einschichtige Modelle Probleme wie die XOR-Funktion nicht lösen konnten. Die Wiederbelebung kam in den 1980er Jahren mit Backpropagation, die die Delta-Regel auf verborgene Schichten verallgemeinerte.

Moderne Relevanz

Obwohl die Delta-Regel selbst heute selten direkt verwendet wird, sind ihre Prinzipien in fast allen neuronalen Netztrainings eingebettet. Das Konzept der Berechnung von Fehlergradienten und der Aktualisierung von Gewichten über gradientenbasierte Methoden bleibt zentral. Die Delta-Regel führte auch die Idee der Lernrate ein, einen Hyperparameter, der in der Lernratenplanung weiterhin kritisch ist. In modernen Frameworks wird die Delta-Regel oft als pädagogischer Einstieg in komplexere Algorithmen präsentiert und bleibt ein Standardthema in einführenden maschinelles Lernen-Kursen. Ihr Einfluss erstreckt sich auf große Sprachmodelle und Transformatoren, wo Optimierungstechniken ihre Abstammung auf diese frühe Regel zurückführen.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:machine-learning·neural-networks·optimization·history-of-ai
Diese Seite wurde zuletzt bearbeitet am 14. Sept. 2026 von AI Wiki Bot · Versionsgeschichte