Aus dem Englischen übersetzt

Instanzbasiertes Lernen ist eine Familie von Algorithmen des maschinellen Lernens, die Trainingsinstanzen im Speicher ablegen und neue Instanzen zum Zeitpunkt der Vorhersage mit ihnen vergleichen, wobei die Berechnung bis zum Bedarfsfall aufgeschoben wird. Es ist auch als speicherbasiertes oder träges Lernen bekannt.

Instanzbasiertes Lernen, auch als speicherbasiertes Lernen bezeichnet, ist eine Familie von Machine-Learning-Algorithmen, die Vorhersagen treffen, indem sie neue Probleminstanzen mit zuvor gesehenen Trainingsinstanzen vergleichen, die im Speicher abgelegt sind. Da die Berechnung aufgeschoben wird, bis eine neue Instanz beobachtet wird, werden diese Algorithmen manchmal als „träge“ bezeichnet. Dies steht im Gegensatz zu eifrigen Lernmethoden, die während des Trainings ein generalisiertes Modell aufbauen und die Rohdaten anschließend verwerfen.

Der Ansatz wird als instanzbasiert bezeichnet, weil er Hypothesen direkt aus den Trainingsinstanzen selbst konstruiert, anstatt eine separate Funktion oder Regelmenge abzuleiten. Er ist eine Kernmethode in Bereichen wie Mustererkennung und Data Mining und bildet die Grundlage für viele praktische Systeme, in denen Trainingsdaten reichlich vorhanden sind, aber die Interpretierbarkeit des Modells weniger kritisch ist.

Methode

Ein Beispiel für einen instanzbasierten Lernalgorithmus ist der k-Nearest-Neighbors-Algorithmus (k-NN). Er speichert eine Teilmenge seines Trainingssatzes; bei der Vorhersage eines Werts oder einer Klasse für eine neue Instanz berechnet er Distanzen oder Ähnlichkeiten zwischen dieser Instanz und den Trainingsinstanzen, um eine Entscheidung zu treffen. Für die Klassifikation können die k nächsten Instanzen durch Mehrheitsabstimmung oder distanzgewichtete Abstimmung kombiniert werden; für die Regression können ihre Zielwerte durch einen Mittelwert oder gewichteten Mittelwert kombiniert werden.

Die Wahl der Distanzmetrik und der Merkmalsskalierung kann verändern, welche Instanzen als nächste identifiziert werden. Häufige Metriken umfassen die euklidische Distanz, die Manhattan-Distanz und die Minkowski-Distanz, die beide verallgemeinert. Merkmalsskalierung, wie Normalisierung oder Standardisierung, stellt sicher, dass Dimensionen mit größeren Bereichen die Distanzberechnung nicht dominieren. Weitere instanzbasierte Methoden umfassen lokal gewichtete Regression, fallbasiertes Schließen und Curriculum-Learning-Varianten, die Trainingsbeispiele nach Schwierigkeit organisieren.

Recheneigenschaften

Die Hypothesenkomplexität kann mit den Daten wachsen. Im schlimmsten Fall ist eine Hypothese eine Liste von n Trainingselementen, und die Rechenkomplexität der Klassifizierung einer einzelnen neuen Instanz beträgt O(n), wenn die Kosten für den Vergleich zweier Instanzen als konstant behandelt werden. Das Aufschieben der Berechnung macht das Training kostengünstig, verlagert die Berechnung jedoch auf den Zeitpunkt der Vorhersage.

Für einen einfachen k-NN-Klassifikator mit einer einfachen Minkowski-Distanz benötigt eine erschöpfende Suche über n gespeicherte Stichproben, die durch d Merkmale beschrieben werden, O(dn) Zeit. Ein ausbalancierter k-d-Baum kann die Abrufzeit auf O(d log n) reduzieren, obwohl dieser Vorteil mit zunehmender Anzahl von Merkmalen abnimmt. In hochdimensionalen Räumen kann der „Fluch der Dimensionalität“ die Leistung verschlechtern, da Distanzen weniger unterscheidungsfähig werden. Um den Speicherbedarf für Trainingsinstanzen und die Empfindlichkeit gegenüber Rauschen im Trainingssatz zu reduzieren, wurden Instanzreduktionsalgorithmen vorgeschlagen, wie kondensierte nächste Nachbarn und bearbeitete nächste Nachbarn, die redundante oder verrauschte Punkte entfernen.

Anwendungen und Varianten

Instanzbasiertes Lernen wird häufig in Empfehlungssystemen, medizinischer Diagnose und Anomalieerkennung eingesetzt. In Anwendungen der künstlichen Intelligenz dient es als Basislinie zur Bewertung komplexerer Modelle wie Deep-Learning-Netzwerke. Varianten umfassen gewichtetes k-NN, bei dem nähere Nachbarn einen größeren Einfluss haben, und prototypbasierte Methoden, die Trainingsdaten in repräsentative Exemplare clustern. Für groß angelegte Datensätze werden häufig approximative Verfahren zur Suche nach nächsten Nachbarn, wie locality-sensitive Hashing, eingesetzt, um den Abruf zu beschleunigen.

Beziehung zu anderen Lernparadigmen

Im Gegensatz zu neuronalen Netzen oder Transformatoren, die in modernen großen Sprachmodellen verwendet werden, erfordern instanzbasierte Methoden keine iterative Optimierung über Parameter. Sie sind nicht-parametrisch, was bedeutet, dass die Modellkomplexität mit der Anzahl der Trainingsinstanzen wächst. Dies macht sie einfach mit neuen Daten zu aktualisieren, aber speicherintensiv für massive Datensätze. Im Gegensatz dazu komprimieren eifrige Lernmethoden wie Residualnetzwerke oder U-Net-Architekturen Informationen in Parameter fester Größe, was eine schnellere Inferenz ermöglicht, aber ein erneutes Training für Aktualisierungen erfordert.

Einschränkungen und Erweiterungen

Eine wesentliche Einschränkung sind die Rechenkosten zum Zeitpunkt der Vorhersage, insbesondere bei hochdimensionalen Daten. Instanzreduktion und Indexstrukturen mildern dies, führen jedoch Overhead ein. Die Empfindlichkeit gegenüber irrelevanten Merkmalen und Rauschen kann durch Merkmalsgewichtung oder Distanzmetrik-Lernen adressiert werden. Erweiterungen wie Datenaugmentation können synthetische Instanzen erzeugen, um die Robustheit zu verbessern. In der Praxis bleibt instanzbasiertes Lernen ein wertvolles Werkzeug für kleine bis mittelgroße Datensätze und für Probleme, bei denen Interpretierbarkeit und inkrementelles Lernen Priorität haben.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:machine-learning·lazy-learning·k-nearest-neighbors
Diese Seite wurde zuletzt bearbeitet am 14. Sept. 2026 von AI Wiki Bot · Versionsgeschichte