Traduit de l'anglais

AG News est un jeu de données de classification d'articles de presse à grande échelle, contenant plus de 120 000 titres et descriptions de nouvelles en anglais, utilisé pour évaluer les algorithmes de classification de texte en apprentissage automatique.

AG News est un jeu de données de référence largement utilisé pour la classification d'articles de presse. Il contient plus de 120 000 titres et courtes descriptions d'actualités en anglais, chacun étant assigné à l'une des quatre classes : Monde, Sports, Affaires et Science/Technologie. Le jeu de données a été dérivé d'un corpus plus vaste d'articles de presse collectés par le moteur de recherche académique AG's Corpus, et il est devenu un banc d'essai standard pour évaluer les modèles de classification de texte dans apprentissage automatique et traitement du langage naturel.

Le jeu de données se distingue par sa simplicité et son échelle, ce qui en fait un point de départ courant pour les chercheurs et les praticiens explorant les approches apprentissage profond de la catégorisation de texte. Chaque échantillon se compose d'un titre et d'une description, avec l'étiquette de classe indiquant le sujet. Les quatre classes sont équilibrées, avec environ 30 000 exemples d'entraînement par classe et 1 900 exemples de test par classe, fournissant une mesure fiable de la performance des modèles.

Historique et Origine

Le jeu de données AG News a été introduit en 2015 dans le cadre d'un projet de recherche mené par Xiang Zhang et ses collègues à l'Université de New York. Les chercheurs ont extrait des articles de presse du AG's Corpus, une collection de plus d'un million d'articles provenant de plus de 2 000 sources d'actualités. Ils ont sélectionné des articles appartenant à l'une des quatre catégories et ont construit un sous-ensemble équilibré pour les tâches de classification. Le jeu de données a été publié aux côtés de références similaires telles que DBpedia et Yahoo! Answers, dans le but de fournir des défis variés pour les algorithmes de classification de texte.

La création d'AG News a été motivée par le besoin de jeux de données volumineux, propres et publiquement disponibles pour entraîner et évaluer les modèles réseau de neurones. À l'époque, de nombreux jeux de données existants étaient petits ou nécessitaient un prétraitement important. AG News offrait une tâche de classification simple avec des étiquettes claires, permettant aux chercheurs de se concentrer sur l'architecture des modèles et les techniques d'entraînement plutôt que sur le nettoyage des données.

Structure du Jeu de Données

AG News contient deux fichiers : un pour l'entraînement et un pour le test. L'ensemble d'entraînement comprend 120 000 échantillons, tandis que l'ensemble de test contient 7 600 échantillons. Chaque échantillon est une ligne CSV avec trois champs : l'indice de classe (1 à 4), le titre et la description. Les indices de classe correspondent respectivement à Monde, Sports, Affaires et Science/Technologie. Les titres sont généralement courts, souvent de moins de 10 mots, tandis que les descriptions sont d'une ou deux phrases, fournissant un contexte pour le titre.

Le jeu de données est prétraité pour supprimer la ponctuation et convertir tout le texte en minuscules, bien que la casse et la ponctuation originales soient disponibles dans la version brute. Ce prétraitement simplifie la tokenisation et permet aux modèles de se concentrer sur les motifs de mots plutôt que sur le formatage. La distribution équilibrée des classes garantit que la précision est une métrique significative, car une devinette aléatoire donnerait une précision de 25 %.

Applications en Apprentissage Automatique

AG News est fréquemment utilisé pour évaluer les modèles de classification de texte, des méthodes traditionnelles comme les machines à vecteurs de support et la régression logistique aux architectures modernes basées sur transformeur. Il sert de vérification de cohérence pour les nouvelles conceptions de modèles, car atteindre une haute précision sur AG News indique qu'un modèle peut capturer des motifs sémantiques et syntaxiques de base dans le texte.

À l'ère des grands modèles de langage, AG News est souvent utilisé pour le réglage fin et l'évaluation. Des modèles comme BERT et GPT peuvent atteindre une précision quasi parfaite sur l'ensemble de test, démontrant la maturité de la classification de texte. Cependant, le jeu de données reste précieux à des fins éducatives et pour comparer l'efficacité de différentes architectures, en particulier dans des contextes à ressources limitées.

Les chercheurs utilisent également AG News pour étudier l'apprentissage par transfert, l'adaptation de domaine et les techniques d'augmentation de données. Sa simplicité permet des expériences contrôlées, et sa taille soutient l'entraînement sans coût computationnel excessif. En conséquence, AG News apparaît dans des centaines d'articles académiques et est un incontournable dans les cours d'apprentissage automatique.

Limites et Critiques

Malgré sa popularité, AG News présente des limites. Les quatre catégories sont larges, et certains articles peuvent être mal étiquetés ou ambigus, entraînant du bruit dans les étiquettes. Le jeu de données est également relativement ancien, avec des articles du début des années 2000, il peut donc ne pas refléter les tendances ou le vocabulaire actuels de l'actualité. De plus, le prétraitement supprime la ponctuation et met le texte en minuscules, ce qui peut masquer des différences stylistiques potentiellement pertinentes dans des applications réelles.

Une autre critique est qu'AG News est trop facile pour les modèles modernes, beaucoup atteignant plus de 90 % de précision. Cela a conduit certains chercheurs à rechercher des références plus difficiles, comme celles avec des catégories plus fines ou des distributions de classes déséquilibrées. Néanmoins, AG News reste une référence utile et un point de départ pour comprendre la classification de texte.

Voir Aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·text-classification·machine-learning·natural-language-processing
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique