Repräsentationslernen, auch bekannt als Feature Learning, ist eine Reihe von Techniken im maschinellen Lernen, die es einem System ermöglichen, automatisch die für die Erkennung oder Klassifizierung von Mustern in Rohdaten notwendigen Merkmale zu entdecken. Dies ersetzt das manuelle Feature-Engineering und befähigt die Maschine, sowohl die Merkmale zu erlernen als auch sie für eine spezifische Aufgabe zu nutzen. Die Motivation dahinter ist, dass viele Aufgaben, wie die Klassifizierung, mathematisch und rechnerisch günstige Eingaben erfordern, reale Daten wie Bilder, Videos oder Sensordaten jedoch nicht ohne Weiteres algorithmisch definierte Merkmale liefern. Stattdessen werden die Repräsentationen durch Untersuchung der Daten entdeckt, ohne sich auf explizite Algorithmen zu verlassen.
Feature Learning kann überwacht, unüberwacht oder selbstüberwacht erfolgen. Beim überwachten Lernen werden Merkmale anhand von beschrifteten Daten gelernt, wobei jede Eingabe eine bekannte Ground-Truth-Beschriftung besitzt. Beim unüberwachten Lernen werden Merkmale aus unbeschrifteten Daten extrahiert, indem Beziehungen zwischen den Datenpunkten analysiert werden. Beim selbstüberwachten Lernen werden Eingabe-Beschriftungs-Paare aus den Daten selbst konstruiert, wodurch überwachte Methoden wie das Gradientenverfahren angewendet werden können, wie es beispielsweise bei Wortvektoren (Word Embeddings) und Autoencodern der Fall ist.
Überwachtes Feature Learning
Beim überwachten Feature Learning wird ein Fehlerterm berechnet, der das Ausmaß misst, in dem das System die korrekte Beschriftung nicht erzeugt. Dieser Fehler dient als Rückmeldung zur Anpassung des Lernprozesses. Zu den Ansätzen gehören das überwachte Wörterbuchlernen und neuronale Netze.
Wörterbuchlernen
Beim Wörterbuchlernen wird eine Menge von repräsentativen Elementen, ein sogenanntes Wörterbuch, aus den Eingabedaten entwickelt, sodass jeder Datenpunkt als gewichtete Summe dieser Elemente dargestellt werden kann. Das Wörterbuch und die Gewichte werden durch Minimierung des durchschnittlichen Darstellungsfehlers ermittelt, wobei häufig eine L1-Regularisierung zur Förderung von Sparsity eingesetzt wird. Beim überwachten Wörterbuchlernen werden sowohl die Datenstruktur als auch die Beschriftungen zur Optimierung des Wörterbuchs verwendet. Für die Klassifizierung umfasst die Zielfunktion den Klassifizierungsfehler, den Darstellungsfehler, die L1-Regularisierung der Gewichte und die L2-Regularisierung der Klassifikatorparameter.
Neuronale Netze
Neuronale Netze sind eine Familie von Lernalgorithmen, die vom Nervensystem der Tiere inspiriert sind und aus Schichten von miteinander verbundenen Knoten (Neuronen) und Kanten (Synapsen) mit zugehörigen Gewichten bestehen. Das Netzwerk definiert Rechenregeln, um Eingabedaten von der Eingabeschicht zur Ausgabeschicht zu verarbeiten. Mehrschichtige neuronale Netze lernen Repräsentationen in den verborgenen Schichten, die dann für die Klassifizierung oder Regression in der Ausgabeschicht verwendet werden. Eine bemerkenswerte Architektur ist das Siamesische Netzwerk, das durch Gewichtsteilung lernt, Eingaben zu vergleichen.
Unüberwachtes Feature Learning
Unüberwachtes Feature Learning entdeckt niedrigdimensionale Merkmale, die die Struktur in hochdimensionalen Eingabedaten erfassen, ohne Beschriftungen zu verwenden. Diese Merkmale können anschließend in einem halbüberwachten Ansatz zur Verbesserung überwachter Aufgaben genutzt werden. Häufige Methoden sind k-Means-Clustering und die Hauptkomponentenanalyse.
k-Means-Clustering
Das k-Means-Clustering gruppiert n Vektoren in k Cluster, wobei jeder Vektor dem Cluster mit dem nächstgelegenen Mittelwert zugeordnet wird. Das Problem ist NP-schwer, es existieren jedoch gierige Algorithmen. Im Feature Learning kann k-Means Merkmale erzeugen, indem binäre Indikatoren für den nächstgelegenen Zentroiden oder Abstände zu den Zentroiden verwendet werden, die möglicherweise durch eine radiale Basisfunktion transformiert werden. Forschungen von Coates und Ng zeigten, dass bestimmte k-Means-Varianten ähnlich wie Sparse Coding funktionieren. In einer vergleichenden Bewertung übertraf k-Means mit geeigneter Transformation Autoencoder und eingeschränkte Boltzmann-Maschinen bei der Bildklassifizierung. k-Means verbessert auch die Erkennung benannter Entitäten in der Verarbeitung natürlicher Sprache und konkurriert mit Brown-Clustering und neuronalen Wortvektoren.
Hauptkomponentenanalyse
Die Hauptkomponentenanalyse (PCA) ist eine Dimensionsreduktionstechnik, die die p rechtssingulären Vektoren erzeugt, die den p größten Singulärwerten der Datenmatrix entsprechen. Diese Vektoren definieren einen niedrigdimensionalen Unterraum, der die meiste Varianz erfasst und eine kompakte Darstellung für nachfolgende Aufgaben bietet.
Selbstüberwachtes Feature Learning
Selbstüberwachtes Feature Learning konstruiert Eingabe-Beschriftungs-Paare aus unbeschrifteten Daten, wodurch überwachte Trainingsmethoden auf die Datenstruktur angewendet werden können. Klassische Beispiele sind Wortvektoren und Autoencoder. Wortvektoren, wie sie in großen Sprachmodellen verwendet werden, bilden Wörter auf dichte Vektoren ab, die semantische Beziehungen erfassen. Autoencoder lernen, ihre Eingaben durch einen Engpass zu rekonstruieren, was das Netzwerk zwingt, effiziente Repräsentationen zu lernen. Selbstüberwachtes Lernen wurde auf viele Modalitäten mit tiefen Architekturen wie Faltungsneuronalen Netzen und Transformatoren angewendet.
Anwendungen und Auswirkungen
Repräsentationslernen ist grundlegend für modernes Deep Learning und generative KI. Es ermöglicht Systemen, Merkmale direkt aus Rohdaten zu lernen, wodurch der Bedarf an manuellem Feature-Engineering reduziert wird. Dies führte zu Durchbrüchen in der Computer Vision, der Verarbeitung natürlicher Sprache und der Spracherkennung. In der künstlichen Intelligenz bildet Repräsentationslernen die Grundlage vieler moderner Modelle, einschließlich derer von Organisationen wie OpenAI, Google DeepMind und Anthropic. Die Fähigkeit, Merkmale automatisch zu lernen, ist ein Schlüsselfaktor für den Erfolg von neuronalen Netzen und hat Fortschritte in Bereichen von der Gesundheitsversorgung bis zum autonomen Fahren vorangetrieben.
Herausforderungen und zukünftige Richtungen
Trotz seiner Erfolge steht das Repräsentationslernen vor Herausforderungen wie Interpretierbarkeit, Dateneffizienz und Generalisierung. Gelernte Repräsentationen sind oft schwer zu interpretieren, und Modelle benötigen möglicherweise große Datenmengen. Forscher untersuchen Wege, Repräsentationen robuster und übertragbarer auf verschiedene Aufgaben zu machen. Seit den frühen 2020er-Jahren sind selbstüberwachtes Lernen und multimodales Lernen aktive Forschungsbereiche mit dem Potenzial, die Abhängigkeit von beschrifteten Daten weiter zu verringern und die Leistung bei vielfältigen Aufgaben zu verbessern.