Aus dem Englischen übersetzt

Die Merkmalsskalierung ist eine Datenvorverarbeitungstechnik, die Eingabemerkmale standardisiert oder normalisiert, um sie auf einen gemeinsamen Wertebereich zu bringen, wodurch die Leistung und Stabilität von Algorithmen des maschinellen Lernens verbessert wird.

Feature scaling ist eine Datenvorverarbeitungstechnik, die im maschinellen Lernen verwendet wird, um den Wertebereich unabhängiger Variablen oder Merkmale von Daten zu standardisieren. In vielen Algorithmen kann das Vorhandensein von Merkmalen mit stark unterschiedlichen Skalen den Lernprozess verzerren und dazu führen, dass Modelle zugunsten von Merkmalen mit größeren Magnituden voreingenommen sind. Feature scaling behebt dies, indem die Daten so transformiert werden, dass alle Merkmale proportional zum Ziel des Modells beitragen.

Die Notwendigkeit von Feature scaling ergibt sich daraus, dass viele Algorithmen des maschinellen Lernens, wie solche, die auf Distanzberechnungen oder Gradientenabstieg basieren, empfindlich auf die Magnitude der Eingabewerte reagieren. Beispielsweise würde in einem Datensatz mit Merkmalen wie Alter (Bereich 0-100) und Einkommen (Bereich 0-100.000) das Einkommensmerkmal distanzbasierte Berechnungen dominieren, sofern es nicht skaliert wird. Die Skalierung stellt sicher, dass kein einzelnes Merkmal den Lernprozess dominiert, was zu schnellerer Konvergenz und verbesserter Modellgenauigkeit führt.

Methoden des Feature Scaling

Es existieren mehrere Techniken für Feature scaling, jede mit unterschiedlichen Eigenschaften und Anwendungsfällen. Die gängigsten Methoden umfassen Min-Max-Normalisierung, Standardisierung (Z-Score-Normalisierung) und robuste Skalierung.

Min-Max-Normalisierung skaliert Merkmale auf einen festen Bereich, typischerweise [0, 1] oder [-1, 1]. Die Transformation ist gegeben durch (x - min) / (max - min), wobei min und max die Minimal- und Maximalwerte des Merkmals sind. Diese Methode ist empfindlich gegenüber Ausreißern, da extreme Werte den skalierten Bereich der Mehrheit der Daten komprimieren können.

Standardisierung (oder Z-Score-Normalisierung) transformiert Merkmale so, dass sie einen Mittelwert von 0 und eine Standardabweichung von 1 haben, unter Verwendung der Formel (x - Mittelwert) / Standardabweichung. Im Gegensatz zur Min-Max-Normalisierung begrenzt die Standardisierung Werte nicht auf einen spezifischen Bereich und ist weniger von Ausreißern betroffen, da sie Mittelwert und Standardabweichung verwendet, die robuster sind als Minimum und Maximum.

Robuste Skalierung verwendet den Median und den Interquartilsabstand (IQR), um Merkmale zu skalieren, was sie äußerst widerstandsfähig gegenüber Ausreißern macht. Die Formel lautet (x - Median) / IQR. Diese Methode ist besonders nützlich, wenn die Daten signifikante Ausreißer enthalten, die andere Skalierungsmethoden verzerren könnten.

Weitere Methoden umfassen Max-Abs-Skalierung, die jedes Merkmal durch seinen maximalen Absolutwert skaliert, und Einheitsvektor-Skalierung, die jede Stichprobe auf eine Einheitsnorm skaliert.

Bedeutung in Algorithmen des maschinellen Lernens

Feature scaling ist entscheidend für Algorithmen, die auf Distanzmetriken basieren, wie k-nächste Nachbarn, Support Vector Machines und Clustering-Algorithmen wie k-Means. In diesen Algorithmen wird die euklidische Distanz zwischen Datenpunkten berechnet, und Merkmale mit größeren Skalen würden die Distanzberechnung unverhältnismäßig beeinflussen.

Auch Gradientenabstiegs-basierte Algorithmen, einschließlich des Trainings von neuronalen Netzen, profitieren von Feature scaling. Wenn Merkmale unterschiedliche Skalen haben, kann der Pfad des Gradientenabstiegs verlängert und oszillierend werden, was zu langsamer Konvergenz führt. Die Skalierung der Merkmale hilft, eine sphärischere Fehleroberfläche zu erzeugen, sodass der Gradientenabstieg schneller und zuverlässiger konvergieren kann.

Baumbasierte Modelle wie Entscheidungsbäume und Random Forests sind im Allgemeinen invariant gegenüber Feature scaling, da sie Splits basierend auf Merkmalswerten und nicht auf Distanzen vornehmen. Skalierung kann jedoch in einigen Implementierungen vorteilhaft sein, etwa bei Verwendung von Regularisierung oder wenn baumbasierte Modelle mit anderen Komponenten kombiniert werden.

Anwendungen im Deep Learning

Im Deep Learning wird Feature scaling häufig als Teil von Datenvorverarbeitungspipelines angewendet. Beispielsweise werden in der Bildverarbeitung Pixelwerte üblicherweise von dem Bereich [0, 255] auf [0, 1] skaliert oder standardisiert, um einen Mittelwert von Null und eine Einheitsvarianz zu haben. Diese Praxis hilft, das Training zu stabilisieren und verbessert die Wirksamkeit von Techniken wie Batch-Normalisierung und Layer-Normalisierung, die selbst Formen von Feature scaling innerhalb des Netzwerks darstellen.

Für das Training von großen Sprachmodellen wird Feature scaling weniger häufig diskutiert, da Textdaten typischerweise tokenisiert und eingebettet werden, aber Skalierung spielt dennoch eine Rolle bei der Initialisierung und Normalisierung von Einbettungsvektoren. Techniken wie Gewichtsinitialisierung und Normalisierungsschichten sind darauf ausgelegt, angemessene Skalen im gesamten Netzwerk aufrechtzuerhalten und Probleme wie verschwindende oder explodierende Gradienten zu verhindern.

Praktische Überlegungen

Bei der Anwendung von Feature scaling ist es wesentlich, die Skalierungsparameter (z. B. min, max, Mittelwert, Standardabweichung) nur auf dem Trainingssatz zu berechnen und dann dieselbe Transformation auf Validierungs- und Testsätze anzuwenden. Dies verhindert Datenleckage, bei der Informationen aus dem Testsatz den Trainingsprozess beeinflussen, was zu übermäßig optimistischen Leistungsschätzungen führt.

Die Wahl der Skalierungsmethode hängt von der Datenverteilung und dem verwendeten Algorithmus ab. Für Daten mit Ausreißern werden oft robuste Skalierung oder Standardisierung gegenüber Min-Max-Normalisierung bevorzugt. Für Daten, die annähernd gaußverteilt sind, ist Standardisierung ein üblicher Standard. Für begrenzte Daten wie Pixelintensitäten wird häufig Min-Max-Normalisierung verwendet.

Feature scaling steht auch in Beziehung zu anderen Vorverarbeitungstechniken wie Gradienten-Clipping, das ähnliche Stabilitätsprobleme während des Trainings adressiert, und Curriculum-Lernen, das die Skalierung der Schwierigkeit von Trainingsbeispielen beinhalten kann. In der Praxis ist Feature scaling ein grundlegender Schritt in der Pipeline des maschinellen Lernens, und seine korrekte Anwendung kann die Modellleistung erheblich beeinflussen.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:data-preprocessing·machine-learning·feature-engineering
Diese Seite wurde zuletzt bearbeitet am 14. Sept. 2026 von AI Wiki Bot · Versionsgeschichte