Traduit de l'anglais

Reuters-21578 est un ensemble de données de référence classique pour la catégorisation de textes, comprenant 21 578 articles de presse Reuters de 1987, largement utilisé pour évaluer les systèmes d'apprentissage automatique et de recherche d'informations. Il inclut des documents étiquetés organisés en plusieurs catégories, servant de norme pour la recherche en traitement du langage naturel.

Reuters-21578 est un ensemble de données de référence classique pour la catégorisation de textes, composé de 21 578 articles de presse du service de dépêches Reuters, publiés en 1987. Il a constitué pendant des décennies une pierre angulaire pour l'évaluation des algorithmes d'apprentissage automatique et de recherche d'informations. L'ensemble de données est distribué avec une répartition standard entre entraînement et test, utilisant généralement la répartition « ModApte », qui réserve 9 603 documents pour l'entraînement et 3 299 pour le test, tout en écartant une partie des documents ayant plusieurs thèmes ou aucun thème. Chaque article se voit attribuer une ou plusieurs étiquettes thématiques parmi un ensemble de 135 catégories, incluant les indicateurs économiques, les acquisitions d'entreprises et les matières premières agricoles.

L'ensemble de données provient du corpus Reuters-22173, compilé dans les années 1990 à des fins de recherche. La version -21578 a été créée pour remédier aux incohérences et fournir une référence plus propre et plus largement adoptée. Il a été hébergé sur plusieurs plateformes, notamment le référentiel d'apprentissage automatique de l'UCI et divers sites web de cours académiques, devenant une norme de facto pour les expériences de classification de textes.

Contexte historique et création

Reuters-21578 a été dérivé d'une collection plus vaste de dépêches Reuters, principalement de 1987. La compilation initiale faisait partie de projets à l'Université du Massachusetts et dans d'autres institutions, visant à fournir un corpus réaliste pour l'évaluation des systèmes de recherche d'informations. L'ensemble de données complet contenait à l'origine plus de 21 000 documents, mais des étapes de prétraitement ont supprimé ceux présentant des étiquettes manquantes ou ambiguës, aboutissant aux 21 578 articles utilisés aujourd'hui. La répartition ModApte, nommée d'après les chercheurs David D. Lewis et Marc Ringuette, qui ont utilisé l'acronyme des auteurs du rapport technique (ModApte), est devenue le protocole d'évaluation standard, garantissant la comparabilité entre les études.

La structure de l'ensemble de données suit le format typique des dépêches, incluant un titre, un corps de texte et des métadonnées telles que la date et l'auteur, bien que la plupart des évaluations se concentrent sur le corps étiqueté thématiquement. Les étiquettes thématiques ont été attribuées manuellement par les rédacteurs de Reuters, fournissant une vérité terrain de haute qualité pour les tâches de classification.

Rôle de référence dans l'apprentissage automatique

Reuters-21578 a joué un rôle déterminant dans l'avancement de l'apprentissage automatique pour la classification de textes. Les premiers travaux de la fin des années 1990 et des années 2000 ont utilisé cet ensemble de données pour comparer des algorithmes tels que les classifieurs naïfs bayésiens, les machines à vecteurs de support et les arbres de décision. Par exemple, une étude marquante de Joachims en 1998 a démontré que les machines à vecteurs de support obtenaient des performances supérieures sur cette référence, avec des scores F1 micro-moyennés d'environ 0,86 pour les 10 principales catégories, contre environ 0,82 pour les k plus proches voisins et 0,72 pour le classifieur naïf bayésien. Ces résultats ont contribué à établir les SVM comme un outil puissant pour les données textuelles de haute dimension.

Les chercheurs ont également utilisé l'ensemble de données pour explorer des techniques de sélection de caractéristiques, telles que les statistiques du chi-carré et le gain d'information, qui ont considérablement amélioré la précision de classification en réduisant le bruit. La taille modérée de l'ensemble de données et sa structure d'étiquettes claire en faisaient un outil idéal pour prototyper des méthodes avant de les étendre à des corpus plus vastes.

Influence sur le traitement automatique du langage naturel

Dans le domaine plus large du traitement automatique du langage naturel, Reuters-21578 a fourni une évaluation standard pour les premiers modèles de réseaux de neurones. Les architectures pré-transformeurs, telles que les réseaux de neurones convolutifs pour le texte (par exemple, le modèle de 2014 de Kim Yoon) et les réseaux récurrents, ont été testées sur cet ensemble de données pour démontrer leur efficacité. Par exemple, l'article de Kim de 2014 sur les CNN pour la classification de phrases a rapporté un micro-F1 de 0,872 sur Reuters-21578, surpassant légèrement les SVM traditionnels avec un noyau linéaire (0,855). Cela a contribué à stimuler l'intérêt pour l'apprentissage profond dans la classification de textes structurés.

Plus tard, avec l'avènement des grands modèles de langage et des approches de fine-tuning, Reuters-21578 est resté un test de validation rapide pour les nouvelles architectures, bien que sa petite taille l'ait limité à des expériences de stade précoce. L'ensemble de données est souvent utilisé pour évaluer les techniques d'intégration de mots et l'apprentissage par transfert, où des modèles pré-entraînés sont affinés sur la répartition ModApte.

Caractéristiques des données et prétraitement

L'ensemble de données comprend 21 578 articles, mais tous ne contiennent pas le texte intégral. La longueur moyenne des documents est d'environ 200 mots. Les étiquettes ne sont pas mutuellement exclusives ; un document peut appartenir à plusieurs catégories, comme « earn » et « acq ». En pratique, de nombreuses études transforment le problème en classification binaire pour chaque catégorie ou se concentrent sur les 10 catégories les plus fréquentes, qui couvrent la majorité des documents. La distribution est asymétrique, la catégorie « earn » comptant environ 3 776 documents d'entraînement, tandis que de nombreuses catégories ont moins de 10 exemples, ce qui pose des défis pour la classification des classes rares.

Le prétraitement implique généralement la tokenisation, la conversion en minuscules, la suppression des mots vides et la racinisation. L'ensemble de données est souvent utilisé comme tâche de classification binaire ou multi-étiquettes, avec des métriques telles que la précision, le rappel et le score F1 (moyenné micro et macro).

Héritage et utilisation continue

Bien que des ensembles de données plus récents tels que 20 Newsgroups et AG News aient émergé, Reuters-21578 reste une référence pour comprendre les problèmes fondamentaux de la classification de textes. Il est fréquemment utilisé dans les cours académiques sur l'intelligence artificielle et la recherche d'informations pour enseigner aux étudiants comment construire et évaluer des classifieurs. Son importance historique est reconnue dans la littérature, souvent citée dans les enquêtes sur la catégorisation de textes.

Au début des années 2020, l'ensemble de données est librement disponible à des fins de recherche, avec une citation appropriée des sources originales. Il a également inspiré des versions dérivées, telles que Reuters-21578 avec un prétraitement ajouté ou différentes répartitions, mais la répartition ModApte originale reste la référence la plus courante. La longévité de cette référence souligne sa qualité et la clarté de son étiquetage, en faisant un outil durable pour une recherche reproductible.

Références et lectures complémentaires

Les chercheurs citent généralement le rapport technique de David D. Lewis, « Reuters-21578 Text Categorization Test Collection, Distribution 1.0 » (1997), qui décrit la construction de l'ensemble de données et son utilisation prévue. Pour une perspective historique, l'article de 1992 de Lewis et Ringuette a introduit la répartition ModApte dans le contexte des classifieurs probabilistes. Ces documents fournissent la base principale de la provenance de l'ensemble de données.

Voir aussi

  • Machine learning pour les algorithmes appliqués à cet ensemble de données.
  • Neural network pour les modèles d'apprentissage profond testés sur celui-ci.
  • Data Augmentation pour les méthodes utilisées afin d'améliorer les performances de classification.

En résumé, Reuters-21578 est un ensemble de données fondateur qui a façonné le domaine de la catégorisation de textes, offrant un banc d'essai stable et bien documenté qui continue d'informer la recherche moderne en TAL.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:text-categorization·dataset·machine-learning·nlp
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique