Classification de documents

Traduit de l'anglais

La classification de documents assigne des documents à des catégories prédéfinies, combinant les traditions de la bibliothéconomie avec les méthodes algorithmiques de l'informatique. Elle couvre les approches manuelles, automatisées et hybrides pour les textes, les images et d'autres médias.

La classification de documents, également appelée catégorisation de documents, est une tâche en bibliothéconomie, en science de l'information et en informatique qui consiste à assigner un document à une ou plusieurs classes ou catégories. Cette assignation peut être effectuée manuellement, souvent par des bibliothécaires ou des experts de domaine, ou algorithmiquement à l'aide de techniques computationnelles. La classification intellectuelle a historiquement été centrale en bibliothéconomie, tandis que la classification algorithmique est un sujet fondamental en science de l'information et en informatique, bien que les deux domaines se chevauchent considérablement et favorisent la recherche interdisciplinaire.

Les documents à classer peuvent inclure des textes, des images, de la musique et d'autres médias, chacun présentant des défis de classification distincts. Sauf indication contraire, le terme implique généralement la classification de textes. Les documents peuvent être catégorisés par sujet ou par d'autres attributs tels que le type de document, l'auteur ou l'année de publication, mais la classification par sujet est l'objectif le plus courant. Deux grandes philosophies guident la classification par sujet : les approches basées sur le contenu et celles basées sur la demande.

Classification basée sur le contenu vs. basée sur la demande

La classification basée sur le contenu assigne un document à une classe en fonction du poids ou de la proportion du contenu consacré à des sujets particuliers. Par exemple, les bibliothèques appliquent souvent une règle selon laquelle au moins 20 % du contenu d'un livre doit se rapporter à la classe assignée. Dans les systèmes automatiques, ce poids peut correspondre à la fréquence de certains mots ou termes dans le document.

La classification basée sur la demande, également connue sous le nom de classification ou d'indexation orientée vers la demande, privilégie les besoins anticipés des utilisateurs. Un classificateur se demande quels descripteurs aideraient un utilisateur à trouver le document, en considérant toutes les requêtes possibles et en déterminant pour lesquelles le document est pertinent. Cette approche reflète souvent un public spécifique ou une politique institutionnelle ; par exemple, une base de données d'études féministes pourrait indexer les documents différemment d'une bibliothèque historique générale. La classification basée sur la demande est mieux comprise comme étant guidée par des politiques plutôt que purement par les utilisateurs, à moins qu'elle n'intègre des données empiriques sur le comportement réel des utilisateurs.

Classification vs. indexation

La distinction entre assigner des documents à des classes (classification) et assigner des sujets à des documents (indexation par sujet) est souvent considérée comme superficielle. Le spécialiste en science de l'information Frederick Wilfrid Lancaster a soutenu que de telles distinctions terminologiques sont dénuées de sens et causent de la confusion. Cette opinion est soutenue par l'interchangeabilité des systèmes de classification et des thésaurus : un schéma de classification peut être transformé en thésaurus et vice versa. Assigner un terme de sujet à un document équivaut à l'assigner à la classe des documents indexés par ce terme, puisque tous les documents partageant le même terme appartiennent à la même classe.

Classification automatique de documents

La classification automatique de documents (CAD) utilise des méthodes computationnelles et l'apprentissage automatique pour catégoriser les documents. Les tâches de CAD se répartissent en trois catégories : la classification supervisée, où une rétroaction externe (comme des étiquettes humaines) fournit les classifications correctes ; la classification non supervisée, également appelée regroupement de documents, qui fonctionne sans référence externe ; et la classification semi-supervisée, qui combine des données étiquetées et non étiquetées. De nombreux produits logiciels existent sous divers modèles de licence.

Les techniques courantes incluent les approches de réseau de neurones artificiel, les arbres de décision (par exemple, ID3 ou C4.5), la maximisation de l'espérance, l'indexation sémantique latente, les classificateurs naïfs de Bayes, les machines à vecteurs de support (SVM), les algorithmes des k plus proches voisins et la fréquence de terme - fréquence inverse de document (tf-idf). Les avancées dans l'apprentissage profond et les architectures de transformeur ont permis des modèles plus sophistiqués, tels que les classificateurs basés sur les grands modèles de langage qui capturent le contexte sémantique au-delà des simples comptages de mots.

Applications

Les applications pratiques de la classification de documents sont diverses. Dans le filtrage du courrier indésirable, les algorithmes distinguent les messages non sollicités des messages légitimes. Le routage du courrier électronique utilise la classification pour diriger les messages vers les destinataires appropriés en fonction du sujet. L'identification de la langue détecte automatiquement la langue d'un document, tandis que la classification par genre détermine son type littéraire ou rhétorique. L'évaluation de la lisibilité évalue la complexité du texte pour différents groupes d'âge ou niveaux de lecture, soutenant souvent les systèmes de simplification de texte. L'analyse des sentiments identifie l'attitude ou le ton émotionnel exprimé dans un document. Dans la surveillance de la santé publique, la classification des publications sur les réseaux sociaux aide à surveiller les épidémies. Le tri d'articles, en particulier en biologie, sélectionne les articles pertinents pour la curation manuelle dans les bases de données.

Défis et tendances

Un défi clé dans la classification automatique est de gérer la diversité des types de documents et l'ambiguïté du langage naturel. Les premiers systèmes reposaient sur des caractéristiques conçues à la main, mais les méthodes modernes exploitent l'apprentissage profond pour apprendre des représentations automatiquement. L'essor de l'IA générative et des modèles de transformeur pré-entraînés a déplacé le domaine vers le réglage fin et l'apprentissage en quelques exemples, réduisant le besoin de vastes ensembles de données étiquetées. Cependant, des problèmes comme le biais, l'interprétabilité et le coût computationnel restent des domaines de recherche actifs. La collaboration interdisciplinaire entre la bibliothéconomie, la science de l'information et l'informatique continue d'affiner les classifications manuelles et algorithmiques, garantissant que les systèmes restent adaptables aux besoins évolutifs des utilisateurs et aux formats de documents.

Liens externes

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:natural-language-processing·information-science·machine-learning·text-analysis
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique