Instanzselektion, auch bekannt als Datensatzreduktion oder Datensatzkondensation, ist ein Datenvorverarbeitungsschritt, der in vielen Machine-Learning- und Data-Mining-Aufgaben angewendet wird. Ihr Hauptzweck besteht darin, den ursprünglichen Datensatz auf ein überschaubares Volumen zu reduzieren und dadurch die für den Lernprozess erforderlichen Rechenressourcen zu senken. Darüber hinaus können Instanzselektionsalgorithmen verrauschte Instanzen vor dem Lernen entfernen, was die Genauigkeit bei Klassifikationsproblemen verbessern kann. Das optimale Ergebnis ist die minimale Datenuntermenge, die dieselbe Aufgabe ohne Leistungsverlust im Vergleich zur Verwendung des gesamten Datensatzes erreicht, was einen Kompromiss zwischen Reduktionsrate und Klassifikationsqualität erfordert.
Algorithmuskategorien
Instanzselektionsalgorithmen werden nach der Art der Instanzen gruppiert, die sie erhalten. Eine Klasse konzentriert sich auf Grenzinstanzen, die nahe an Klassengrenzen liegen. Algorithmen in dieser Gruppe umfassen DROP3, ICF und LSBo. Eine andere Klasse erhält interne Instanzen, die zentral für jede Klasse sind; Beispiele hierfür sind ENN und LSSm. Diese internen Selektionsalgorithmen werden oft verwendet, um schädliche oder verrauschte Instanzen zu filtern, und sie können als Vorverarbeitungsschritte für Grenzselektionsmethoden dienen. Beispielsweise ist ENN der erste Schritt in DROP3, und LSSm wird von LSBo verwendet.
Eine dritte Kategorie wählt die dichtesten Instanzen in beliebigen Nachbarschaften aus, die sowohl Grenz- als auch interne Punkte umfassen können. Algorithmen wie LDIS, CDIS und XLDIS fallen hierunter. LDIS und CDIS sind einfach und erzeugen Untermengen, die stark repräsentativ für die ursprünglichen Daten sind. Da sie repräsentative Instanzen separat innerhalb jeder Klasse suchen, sind sie in der Zeitkomplexität und der effektiven Laufzeit schneller als Algorithmen wie DROP3 und ICF.
Prototypbasierte Ansätze
Einige Algorithmen wählen keine tatsächlichen Instanzen aus, sondern erzeugen synthetische Prototypen. PSSA, PSDSP und PSSP verwenden das Konzept der räumlichen Partitionierung, insbesondere Hyperrechtecke, um ähnliche Instanzen zu identifizieren und einen Prototyp für jede Gruppe zu extrahieren. Diese Ansätze können angepasst werden, um auch tatsächliche Instanzen auszuwählen; der Algorithmus ISDSP folgt einer ähnlichen Strategie, wählt jedoch reale Instanzen anstelle von Prototypen.
Anwendungen und Kompromisse
Instanzselektion ist wertvoll in Szenarien mit großen Datensätzen, in denen Trainingszeit und Speichernutzung erhebliche Bedenken darstellen. Durch die Reduzierung des Datensatzes ermöglicht sie ein schnelleres Modelltraining und kann die Generalisierung verbessern, indem Rauschen eliminiert wird. Eine aggressive Reduktion birgt jedoch das Risiko, informative Instanzen zu verlieren, was die Klassifikationsleistung verschlechtern kann. Das Gleichgewicht zwischen Reduktionsrate und Genauigkeit ist zentral für die Bewertung jeder Instanzselektionsstrategie.
Beziehung zu anderen Techniken
Instanzselektion unterscheidet sich von Datenaugmentation, die neue synthetische Stichproben erzeugt, um den Datensatz zu erweitern, und von Modellpruning, das die Modellkomplexität nach dem Training reduziert. Sie unterscheidet sich auch von der Merkmalsselektion, die die Anzahl der Attribute statt der Instanzen reduziert. In der Praxis wird Instanzselektion oft mit anderen Vorverarbeitungsschritten kombiniert, um die gesamte Machine-Learning-Pipeline zu optimieren.
Bewertung und praktische Überlegungen
Häufige Bewertungsmetriken umfassen die Reduktionsrate, die den Anteil der entfernten Instanzen misst, und die Klassifikationsgenauigkeit auf einem zurückgehaltenen Testdatensatz. Die Wahl des Algorithmus hängt von der Datenverteilung und den spezifischen Zielen ab, wie Rauschunterdrückung versus maximale Reduktion. Algorithmen wie ENN sind effektiv zum Bereinigen verrauschter Datensätze, während grenzbasierte Methoden wie DROP3 darauf abzielen, kritische Entscheidungsgrenzen zu erhalten. Die Rechenkosten des Selektionsprozesses selbst sind ebenfalls ein Faktor, wobei einfachere Methoden wie LDIS für sehr große Datensätze bevorzugt werden.
Zukünftige Richtungen
Die Forschung untersucht weiterhin effizientere und skalierbare Instanzselektionsmethoden, insbesondere für hochdimensionale Daten und Deep-Learning-Anwendungen. Es besteht Interesse daran, Instanzselektion in neuronale-Netzwerk-Trainingspipelines zu integrieren, wo die Reduzierung des Datensatzes das Training beschleunigen kann, ohne signifikanten Genauigkeitsverlust. Da Datensätze in Größe und Komplexität wachsen, bleibt Instanzselektion ein relevantes Werkzeug zur Verwaltung von Rechenressourcen in Systemen der künstlichen Intelligenz.