WikiText est une collection de corpus de textes en anglais extraits d'articles Wikipédia vérifiés, conçue pour l'entraînement et l'évaluation de modèles de langage. Elle a été introduite pour fournir un corpus plus vaste et plus réaliste que des ensembles de données antérieurs comme Penn Treebank, en mettant l'accent sur la préservation de la structure originale des articles, y compris les titres, les listes et les liens. Cet ensemble de données est couramment utilisé dans la recherche sur apprentissage automatique et apprentissage profond pour des tâches telles que la prédiction du mot suivant et l'évaluation de modèles.
Les versions principales sont WikiText-2 et WikiText-103, contenant respectivement 2 millions et 103 millions de jetons. Ces ensembles de données sont organisés pour exclure les tableaux et les listes, et ils conservent le texte brut avec des jetons spéciaux pour les mots inconnus, ce qui les rend adaptés pour tester la capacité des modèles à gérer un grand vocabulaire et des dépendances à long terme. WikiText est devenu une référence standard dans le domaine, cité dans de nombreux articles sur réseaux de neurones et grands modèles de langage.
Construction de l'ensemble de données
WikiText a été créé par Salesforce Research en 2016, avec pour objectif de fournir un corpus plus difficile que les options précédentes. Le processus d'extraction impliquait de prendre des articles de Wikipédia classés comme « bons » ou « de qualité » par la communauté Wikipédia, garantissant une haute qualité et une cohérence. Le texte a ensuite été nettoyé pour supprimer le balisage, mais la casse originale, la ponctuation et les nombres ont été préservés, ce qui diffère des ensembles de données antérieurs qui mettaient souvent tout en minuscules.
Une caractéristique clé est l'utilisation d'un vocabulaire de 267 735 mots pour WikiText-103, qui inclut tous les mots apparaissant au moins trois fois dans l'ensemble d'entraînement. Les mots rares sont remplacés par un jeton « <unk> ». Ce grand vocabulaire force les modèles à apprendre des représentations pour de nombreux mots, testant leur capacité à généraliser. L'ensemble de données est divisé en ensembles d'entraînement, de validation et de test, l'ensemble de test contenant des articles d'une période différente pour éviter les fuites.
Applications en modélisation du langage
WikiText est principalement utilisé pour évaluer les modèles de langage, qui prédisent la probabilité d'une séquence de mots. Les chercheurs l'utilisent pour mesurer la perplexité, une métrique indiquant à quel point un modèle prédit bien le mot suivant. Des scores de perplexité plus bas sont meilleurs, et WikiText-103 est devenu une norme pour comparer les modèles basés sur transformeurs, tels que ceux développés par OpenAI et Google DeepMind.
Par exemple, des modèles comme GPT-2 et BERT ont été évalués sur WikiText-103, avec des scores de perplexité rapportés qui s'améliorent au fil du temps. Les articles longs de l'ensemble de données, d'une moyenne d'environ 3 000 mots, testent la capacité d'un modèle à gérer un contexte à longue portée, ce qui est crucial pour des tâches comme le résumé de documents et la réponse à des questions. Cela fait de WikiText une ressource précieuse pour faire progresser la recherche en intelligence artificielle.
Comparaison avec d'autres ensembles de données
Avant WikiText, la référence standard était Penn Treebank (PTB), qui contient seulement environ 1 million de jetons provenant d'articles du Wall Street Journal. PTB est plus petit et a un vocabulaire restreint, ce qui facilite l'obtention d'une faible perplexité pour les modèles. WikiText offre un défi plus réaliste en utilisant un vocabulaire plus large et des documents plus longs, ce qui reflète mieux le texte du monde réel.
Un autre ensemble de données, le One Billion Word Benchmark, est plus grand mais consiste en des phrases mélangées, perdant la structure des documents. WikiText conserve l'ordre original des articles, permettant aux modèles d'apprendre à partir de récits cohérents. Cette différence structurelle est significative pour entraîner des modèles qui doivent comprendre le contexte à travers les phrases et les paragraphes, une capacité clé pour les systèmes de IA générative.
Limites et critiques
Malgré sa popularité, WikiText a des limites. L'ensemble de données est dérivé de Wikipédia, qui a un style formel et encyclopédique, il peut donc ne pas représenter le langage informel ou conversationnel. De plus, le processus de nettoyage supprime les tableaux et les listes, qui peuvent être informatifs pour certaines tâches. Certains chercheurs ont noté que la gestion du jeton « <unk> » peut biaiser l'évaluation, car les modèles peuvent s'y fier plutôt que d'apprendre des mots rares.
Une autre critique est que WikiText-103, bien que grand, est encore plus petit que les ensembles de données à l'échelle du web modernes utilisés pour entraîner des grands modèles de langage comme ceux de Anthropic ou Microsoft (AI). En 2025, de nombreux modèles sont entraînés sur des billions de jetons, faisant de WikiText davantage une référence pour la recherche académique qu'une source d'entraînement pour des systèmes de production. Néanmoins, il reste une norme pour des comparaisons reproductibles dans le domaine.
Directions futures
Le développement de WikiText a influencé la création d'autres ensembles de données, comme The Pile et RedPajama, qui combinent plusieurs sources. Ces ensembles de données plus récents visent à répondre aux limites de WikiText en incluant des types de textes divers et des échelles plus grandes. Cependant, la simplicité et la facilité d'utilisation de WikiText garantissent sa pertinence continue dans l'éducation et la recherche, en particulier pour ceux qui étudient les fondamentaux du apprentissage profond.
Les chercheurs explorent également des moyens d'adapter WikiText pour des tâches multilingues et multimodales, bien que la version originale soit uniquement en anglais. Alors que les modèles d'IA évoluent, le besoin d'ensembles de données structurés de haute qualité reste, et WikiText sert d'exemple fondateur de la manière de construire de telles ressources. Son héritage est évident dans les nombreux articles qui le citent comme référence, assurant sa place dans l'histoire du développement du apprentissage automatique.