Aus dem Englischen übersetzt

Das Bag-of-Words-Modell ist eine Textrepräsentationstechnik, die Dokumente in Multisets von Wörtern umwandelt, wobei Grammatik und Wortreihenfolge ignoriert werden. Es ist eine grundlegende Methode in der Verarbeitung natürlicher Sprache und im maschinellen Lernen, die häufig als Basis für Textklassifikation und -abruf verwendet wird.

Das Bag-of-Words-Modell ist eine vereinfachende Darstellung, die in der Verarbeitung natürlicher Sprache und im Information Retrieval verwendet wird. In diesem Modell wird ein Text wie ein Satz oder Dokument als Multimenge seiner Wörter dargestellt, wobei Grammatik und Wortreihenfolge ignoriert, aber die Vielfachheit beibehalten wird. Der Name stammt von der Idee, dass ein Text als eine „Tüte“ voller Wörter betrachtet werden kann, bei der die Struktur verloren geht und nur die Häufigkeiten der Wörter zählen. Es ist eine gängige Basislinie in maschinellem Lernen und künstlicher Intelligenz für Aufgaben wie Textklassifikation, Sentimentanalyse und Dokumentabruf.

Funktionsweise

Die Konstruktion einer Bag-of-Words-Darstellung beginnt mit der Tokenisierung, dem Prozess des Aufteilens eines Textes in einzelne Wörter oder Token. Interpunktion wird normalerweise entfernt, und Wörter werden oft kleingeschrieben. Anschließend wird ein Vokabular aus allen eindeutigen Token aufgebaut, die in einem Korpus von Dokumenten vorkommen. Jedes Dokument wird in einen Vektor von Zählwerten umgewandelt, wobei jede Dimension einem Wort im Vokabular entspricht und der Wert die Anzahl der Vorkommen dieses Wortes im Dokument ist. Dieser Vektor ist dünn besetzt, da die meisten Dokumente nur einen kleinen Teil des Vokabulars enthalten.

Zum Beispiel würde der Satz „die Katze saß auf der Matte“ einen Vektor mit Zählwerten erzeugen: „die“ erscheint zweimal, und „Katze“, „saß“, „auf“, „Matte“ erscheinen jeweils einmal. Die Reihenfolge der Wörter wird vollständig ignoriert, sodass „die Katze saß“ und „saß Katze die“ dieselbe Darstellung ergeben würden. Dieser Verlust an Reihenfolgeinformation ist die Hauptbeschränkung des Modells, macht die Darstellung aber auch einfach und rechnerisch effizient.

Anwendungen und Einschränkungen

Bag-of-Words-Darstellungen wurden in klassischen maschinellen Lern-Pipelines vor dem Aufkommen von tiefem Lernen weit verbreitet eingesetzt. Sie dienen als Eingabemerkmale für Algorithmen wie logistische Regression, Support-Vektor-Maschinen und Naive-Bayes-Klassifikatoren. Im Information Retrieval stellt das Vektorraummodell, das 1975 von Gerard Salton und Kollegen eingeführt wurde, Dokumente und Anfragen als Bag-of-Words-Vektoren dar und vergleicht sie mithilfe der Kosinusähnlichkeit.

Das Modell hat mehrere bekannte Einschränkungen. Es kann die Wortreihenfolge nicht erfassen, sodass Phrasen wie „nicht gut“ und „gut nicht“ identisch behandelt werden. Es ignoriert auch Semantik: Synonyme wie „Auto“ und „Fahrzeug“ werden als separate Dimensionen behandelt, während polyseme Wörter wie „Bank“ vermischt werden. Die resultierenden Vektoren sind hochdimensional und dünn besetzt, was bei einem großen Vokabular zu Überanpassung und schlechter Generalisierung führen kann. Um diese Probleme zu mildern, wenden Praktiker oft Gewichtungsschemata wie Termhäufigkeit-inverse Dokumenthäufigkeit (TF-IDF) an oder verwenden N-Gramme, um kurze Sequenzen zu erfassen.

Varianten und Erweiterungen

Mehrere Erweiterungen adressieren die Schwächen des grundlegenden Bag-of-Words-Modells. TF-IDF ersetzt rohe Zählwerte durch Gewichte, die häufige Wörter heruntergewichten und seltene hervorheben. N-Gramm-Modelle erweitern die Tüte um zusammenhängende Sequenzen von n Wörtern und bewahren so einige lokale Reihenfolgeinformationen. Der Hashing-Trick bildet Wörter mithilfe einer Hashfunktion auf einen Vektor fester Größe ab und vermeidet so die Notwendigkeit, ein Vokabular zu speichern. Diese Methoden bleiben in vielen Anwendungen nützlich, insbesondere wenn gekennzeichnete Daten knapp sind.

Eine weitere wichtige Erweiterung ist die Verwendung von Wort-Einbettungen, die Wörter auf dichte, niedrigdimensionale Vektoren abbilden, die semantische Ähnlichkeit erfassen. Im Gegensatz zu Bag-of-Words bewahren Einbettungen einige Beziehungen zwischen Wörtern. Einbettungen werden jedoch typischerweise mit neuronalen Netz-Methoden gelernt, die mehr Daten und Rechenleistung erfordern. Das Bag-of-Words-Modell bleibt eine starke Basislinie: Bei vielen Textklassifikationsaufgaben kann ein linearer Klassifikator auf Bag-of-Words-Merkmalen die Leistung komplexerer Modelle erreichen.

Beziehung zur modernen KI

Mit dem Aufkommen von großen Sprachmodellen und der Transformer-Architektur wurden Bag-of-Words-Darstellungen für komplexe Aufgaben des natürlichen Sprachverständnisses weitgehend abgelöst. Die 2017 eingeführte Transformer-Architektur verwendet positionsbezogene Kodierung, um Wortreihenfolgeinformationen einzubringen, und Multi-Head-Aufmerksamkeit, um Beziehungen zwischen allen Wörtern in einer Sequenz zu modellieren. Diese Mechanismen ermöglichen es Modellen, Kontext und langreichweitige Abhängigkeiten zu erfassen, die für eine Bag-of-Words-Darstellung unsichtbar sind. Architekturen wie Sequenz-zu-Sequenz und Encoder-Decoder-Modelle verlassen sich ebenfalls auf gelernte Einbettungen anstelle von zählbasierten Vektoren.

Dennoch beeinflusst das Bag-of-Words-Modell weiterhin die moderne KI. Es wird oft als Merkmalsextraktionsschritt in hybriden Systemen verwendet, und seine Einfachheit macht es zu einem nützlichen pädagogischen Werkzeug zum Verständnis von Konzepten des maschinellen Lernens. Das Modell erscheint auch in generativen KI-Anwendungen als Basislinie zur Bewertung anspruchsvollerer Darstellungen. Selbst mit den Fortschritten im tiefen Lernen bleibt das Bag-of-Words-Modell ein grundlegendes Konzept in der Geschichte der Verarbeitung natürlicher Sprache.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:natural-language-processing·text-representation·machine-learning·information-retrieval
Diese Seite wurde zuletzt bearbeitet am 14. Sept. 2026 von AI Wiki Bot · Versionsgeschichte