Explicit Semantic Analysis (ESA) ist eine vektorale Repräsentation von Text, die in der Verarbeitung natürlicher Sprache und im Information Retrieval verwendet wird. Sie stellt einzelne Wörter oder ganze Dokumente als Vektoren in einem hochdimensionalen Raum dar, wobei jede Dimension einem explizit von Menschen definierten Konzept entspricht, wie beispielsweise einem Wikipedia-Artikel. Die Technik wurde von Evgeniy Gabrilovich und Shaul Markovitch entwickelt, um die Textklassifikation zu verbessern und die semantische Verwandtschaft zwischen Texten mithilfe der Kosinus-Ähnlichkeit zu berechnen. Der Name steht im Gegensatz zur latenten semantischen Analyse (LSA), da die Verwendung einer Wissensbasis bei ESA die Zuordnung von menschenlesbaren Beschriftungen zu den Konzepten ermöglicht, die den Vektorraum bilden.
ESA funktioniert, indem sie ein Dokumentkorpus als Wissensbasis nutzt. In ihrer grundlegenden Form wird ein Wort als Spaltenvektor in der Termhäufigkeits-Inverse-Dokumenthäufigkeits-Matrix (tf-idf) des Korpus dargestellt, und ein Dokument wird als Schwerpunkt der Vektoren seiner enthaltenen Wörter repräsentiert. Obwohl die englische Wikipedia das typische Korpus ist, wurden auch andere Sammlungen wie das Open Directory Project verwendet.
Modell
Die grundlegende ESA-Variante beginnt mit einer Sammlung von Texten, wie beispielsweise allen Wikipedia-Artikeln, die N Dokumente umfasst. Jedes Dokument wird in einen "Bag of Words" - ein Termhäufigkeits-Histogramm - umgewandelt und in einem invertierten Index gespeichert. Für ein bestimmtes Wort gibt der invertierte Index die Menge der Dokumente zurück, die dieses Wort enthalten, wobei jedes Dokument basierend darauf bewertet wird, wie oft das Wort vorkommt, gewichtet durch die Gesamtzahl der Wörter im Dokument. Mathematisch gesehen ist diese Ausgabe ein N-dimensionaler Vektor von Wort-Dokument-Bewertungen, wobei Dokumente, die das Wort nicht enthalten, eine Bewertung von null erhalten.
Um die Verwandtschaft zweier Wörter zu berechnen, werden ihre Vektoren u und v mithilfe der Kosinus-Ähnlichkeit verglichen: sim(u, v) = (u · v) / (||u|| ||v||). Dies ergibt eine numerische Schätzung der semantischen Verwandtschaft. Das Schema erweitert sich von einzelnen Wörtern auf Texte mit mehreren Wörtern, indem die Vektoren aller Wörter im Text summiert werden, was eine Darstellung auf Dokumentebene erzeugt.
Analyse
ESA wurde ursprünglich unter der Annahme postuliert, dass die Wissensbasis topisch orthogonale Konzepte enthält. Maik Anderka und Benno Stein zeigten jedoch später, dass ESA auch die Leistung des Information Retrieval verbessert, wenn sie auf dem Reuters-Korpus von Nachrichtenartikeln basiert, das die Orthogonalitätseigenschaft nicht erfüllt. In ihren Experimenten dienten Nachrichtenmeldungen als "Konzepte". Diese Beobachtung wurde durch Verbindungen zwischen ESA und dem verallgemeinerten Vektorraummodell erklärt. Gabrilovich und Markovitch antworteten darauf, dass das Ergebnis von Anderka und Stein mit einer einzigen Anwendung von ESA für Textähnlichkeit und einer kleinen, homogenen Testkollektion von nur 50 Nachrichtendokumenten erzielt wurde.
Anwendungen
Wortverwandtschaft
ESA wird von seinen Autoren als Maß für semantische Verwandtschaft betrachtet, im Gegensatz zur semantischen Ähnlichkeit. Bei Benchmark-Datensätzen für Wortverwandtschaft übertrifft ESA andere Algorithmen, einschließlich WordNet-basierter Maße für semantische Ähnlichkeit und neuronaler Sprachmodelle mit Skip-Gram-Architektur wie Word2vec. Der Ansatz wurde in Textklassifikationsaufgaben angewendet, bei denen die konzeptbasierte Darstellung die Klassifikationsgenauigkeit verbessert.
Dokumentverwandtschaft
ESA wird in kommerziellen Softwarepaketen zur Berechnung der Verwandtschaft von Dokumenten verwendet. Domänenspezifische Einschränkungen des ESA-Modells werden manchmal angewendet, um ein robusteres Dokument-Matching in spezialisierten Bereichen zu ermöglichen. Die Fähigkeit der Technik, interpretierbare Konzeptvektoren zu erzeugen, macht sie wertvoll für Anwendungen, die transparente Darstellungen von Textinhalten erfordern.
Erweiterungen
Cross-language Explicit Semantic Analysis (CL-ESA) ist eine mehrsprachige Verallgemeinerung von ESA. CL-ESA nutzt eine dokumentenausgerichtete mehrsprachige Referenzsammlung, wiederum typischerweise Wikipedia, um ein Dokument als sprachunabhängigen Konzeptvektor darzustellen. Die Verwandtschaft zweier Dokumente in verschiedenen Sprachen wird durch die Kosinus-Ähnlichkeit zwischen ihren entsprechenden Vektordarstellungen bewertet. Diese Erweiterung ermöglicht das sprachübergreifende Information Retrieval und den Vergleich von Texten über Sprachgrenzen hinweg.
ESA wurde auch mit breiteren Entwicklungen im Bereich maschinelles Lernen und künstliche Intelligenz in Verbindung gebracht, insbesondere im Kontext von Verarbeitung natürlicher Sprache. Ihr expliziter, interpretierbarer Konzeptraum unterscheidet sie von späteren Deep-Learning-Ansätzen wie neuronalen Netzwerk-Einbettungen, obwohl beide darauf abzielen, semantische Beziehungen in Texten zu erfassen. Die Methode bleibt als grundlegende Technik für die semantische Darstellung relevant und ergänzt neuere Modelle wie große Sprachmodelle und Transformer-Architekturen.