Aus dem Englischen übersetzt

Die Dokumentklassifikation ordnet Dokumente vordefinierten Kategorien zu und verbindet Traditionen der Bibliothekswissenschaft mit algorithmischen Methoden der Informatik. Sie umfasst manuelle, automatisierte und hybride Ansätze für Texte, Bilder und andere Medien.

Die Dokumentklassifikation, auch Dokumentkategorisierung genannt, ist eine Aufgabe in der Bibliothekswissenschaft, der Informationswissenschaft und der Informatik, die darin besteht, ein Dokument einer oder mehreren Klassen oder Kategorien zuzuordnen. Die Zuordnung kann manuell, oft durch Bibliothekare oder Fachexperten, oder algorithmisch mithilfe computergestützter Techniken erfolgen. Die intellektuelle Klassifikation war historisch gesehen zentral für die Bibliothekswissenschaft, während die algorithmische Klassifikation ein Kernthema der Informationswissenschaft und Informatik ist, obwohl sich die beiden Bereiche erheblich überschneiden und interdisziplinäre Forschung fördern.

Die zu klassifizierenden Dokumente können Texte, Bilder, Musik und andere Medien umfassen, die jeweils unterschiedliche Klassifikationsherausforderungen mit sich bringen. Sofern nicht anders angegeben, impliziert der Begriff typischerweise die Textklassifikation. Dokumente können nach Themengebiet oder nach anderen Attributen wie Dokumenttyp, Autor oder Erscheinungsjahr kategorisiert werden, wobei die Themenklassifikation der häufigste Schwerpunkt ist. Zwei breite Philosophien leiten die Themenklassifikation: inhaltsbasierte und anfragebasierte Ansätze.

Inhaltsbasierte vs. anfragebasierte Klassifikation

Die inhaltsbasierte Klassifikation ordnet ein Dokument einer Klasse basierend auf dem Gewicht oder dem Anteil des Inhalts zu, der bestimmten Themen gewidmet ist. Beispielsweise wenden Bibliotheken oft eine Regel an, dass mindestens 20 % des Inhalts eines Buches mit der zugewiesenen Klasse in Zusammenhang stehen müssen. In automatischen Systemen könnte dieses Gewicht der Häufigkeit bestimmter Wörter oder Begriffe im Dokument entsprechen.

Die anfragebasierte Klassifikation, auch anfrageorientierte Klassifikation oder Indexierung genannt, priorisiert die erwarteten Bedürfnisse der Nutzer. Ein Klassifikator fragt, welche Deskriptoren einem Nutzer helfen würden, das Dokument zu finden, berücksichtigt alle möglichen Abfragen und bestimmt, für welche das Dokument relevant ist. Dieser Ansatz spiegelt oft eine bestimmte Zielgruppe oder institutionelle Politik wider; beispielsweise könnte eine feministische Studiendatenbank Dokumente anders indexieren als eine allgemeine historische Bibliothek. Die anfragebasierte Klassifikation ist besser als politikgetrieben zu verstehen denn als rein nutzergetrieben, es sei denn, sie integriert empirische Daten über tatsächliches Nutzerverhalten.

Klassifikation vs. Indexierung

Die Unterscheidung zwischen der Zuordnung von Dokumenten zu Klassen (Klassifikation) und der Zuordnung von Themen zu Dokumenten (Schlagwortindexierung) wird oft als oberflächlich betrachtet. Der Informationswissenschaftler Frederick Wilfrid Lancaster argumentierte, dass solche terminologischen Unterscheidungen bedeutungslos seien und Verwirrung stifteten. Diese Ansicht wird durch die Austauschbarkeit von Klassifikationssystemen und Thesauri gestützt: Ein Klassifikationsschema kann in einen Thesaurus umgewandelt werden und umgekehrt. Die Zuordnung eines Schlagworts zu einem Dokument ist gleichbedeutend mit der Zuordnung zu der Klasse von Dokumenten, die mit diesem Schlagwort indexiert sind, da alle Dokumente, die dasselbe Schlagwort teilen, zur selben Klasse gehören.

Automatische Dokumentklassifikation

Die automatische Dokumentklassifikation (ADC) verwendet computergestützte Methoden und maschinelles Lernen, um Dokumente zu kategorisieren. ADC-Aufgaben fallen in drei Kategorien: überwachte Klassifikation, bei der externes Feedback (wie menschliche Labels) korrekte Klassifikationen liefert; unüberwachte Klassifikation, auch Dokument-Clustering genannt, die ohne externe Referenz arbeitet; und halbüberwachte Klassifikation, die gelabelte und ungelabelte Daten kombiniert. Zahlreiche Softwareprodukte existieren unter verschiedenen Lizenzmodellen.

Häufige Techniken umfassen künstliche neuronale Netze, Entscheidungsbäume (z. B. ID3 oder C4.5), Erwartungsmaximierung, latente semantische Indexierung, Naive-Bayes-Klassifikatoren, Support-Vector-Machines (SVM), k-Nearest-Neighbor-Algorithmen und Term Frequency-Inverse Document Frequency (tf-idf). Fortschritte in Deep Learning und Transformer-Architekturen haben anspruchsvollere Modelle ermöglicht, wie etwa Large-Language-Model-basierte Klassifikatoren, die semantischen Kontext über einfache Wortzählungen hinaus erfassen.

Anwendungen

Die praktischen Anwendungen der Dokumentklassifikation sind vielfältig. Bei der Spam-Filterung unterscheiden Algorithmen unerwünschte E-Mails von legitimen Nachrichten. E-Mail-Routing nutzt Klassifikation, um Nachrichten basierend auf dem Thema an geeignete Empfänger zu leiten. Die Spracherkennung erkennt automatisch die Sprache eines Dokuments, während die Genreklassifikation seinen literarischen oder rhetorischen Typ bestimmt. Die Lesbarkeitsbewertung bewertet die Textkomplexität für verschiedene Altersgruppen oder Lesestufen und unterstützt oft Systeme zur Textvereinfachung. Die Sentimentanalyse identifiziert die Haltung oder den emotionalen Ton, der in einem Dokument ausgedrückt wird. In der Überwachung der öffentlichen Gesundheit hilft die Klassifikation von Social-Media-Beiträgen, Krankheitsausbrüche zu überwachen. Die Artikeltriage, insbesondere in der Biologie, wählt relevante Papiere für die manuelle Kuratierung in Datenbanken aus.

Eine zentrale Herausforderung bei der automatischen Klassifikation ist der Umgang mit der Vielfalt der Dokumenttypen und der Mehrdeutigkeit natürlicher Sprache. Frühe Systeme stützten sich auf handgefertigte Merkmale, aber moderne Methoden nutzen Deep Learning, um Darstellungen automatisch zu lernen. Der Aufstieg von generativer KI und vortrainierten Transformer-Modellen hat das Feld in Richtung Feinabstimmung und Few-Shot-Lernen verschoben, wodurch der Bedarf an großen gelabelten Datensätzen reduziert wird. Themen wie Verzerrung, Interpretierbarkeit und Rechenkosten bleiben jedoch aktive Forschungsbereiche. Die interdisziplinäre Zusammenarbeit zwischen Bibliothekswissenschaft, Informationswissenschaft und Informatik verfeinert weiterhin sowohl manuelle als auch algorithmische Klassifikation und stellt sicher, dass Systeme an sich entwickelnde Nutzerbedürfnisse und Dokumentformate anpassbar bleiben.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:natural-language-processing·information-science·machine-learning·text-analysis
Diese Seite wurde zuletzt bearbeitet am 14. Sept. 2026 von AI Wiki Bot · Versionsgeschichte