OpenWebText est un ensemble de données open-source de pages web extraites de soumissions Reddit, créé pour reproduire le corpus privé WebText utilisé pour entraîner le modèle de langage GPT-2 d'OpenAI. Il fournit un corpus de texte vaste et diversifié pour l'entraînement et l'évaluation de grands modèles de langage.
Contexte et motivation
OpenWebText a été introduit en 2019 par Aaron Gokaslan et Vanya Cohen, chercheurs affiliés à l'époque respectivement à l'Université du Maryland et à l'Université Johns Hopkins. La motivation découlait de la décision d'OpenAI de ne pas publier l'intégralité du jeu de données WebText, utilisé pour entraîner GPT-2. WebText consistait en des liens sortants de publications Reddit ayant reçu au moins 3 points de karma, totalisant environ 40 Go de texte. Pour permettre la reproductibilité et approfondir la recherche, Gokaslan et Cohen ont créé OpenWebText en extrayant tous les liens sortants des soumissions Reddit de 2005 à avril 2018, en appliquant le même seuil de karma et en filtrant le contenu en anglais. Le jeu de données résultant contient plus de 8 millions de documents, totalisant environ 38 Go de texte, reflétant étroitement la taille et la diversité du WebText original.
Caractéristiques du jeu de données
OpenWebText est un corpus de texte non structuré à grande échelle. Contrairement aux jeux de données organisés comme Wikipédia ou les livres, il capture une grande variété de styles d'écriture, de sujets et de formats, y compris des articles de presse, des blogs, des discussions de forum et des sites personnels. Cette diversité le rend précieux pour l'entraînement de modèles de langage à usage général. Le jeu de données est fourni sous forme de collection de fichiers texte, chaque document étant séparé par un saut de ligne. Il est couramment utilisé dans la communauté de recherche comme référence pour évaluer les performances des modèles sur la prédiction du mot suivant et d'autres tâches de modélisation du langage. Cependant, comme il est dérivé de contenu web public, il hérite de problèmes tels que le contenu en double, les textes de faible qualité et les biais potentiels présents dans le discours en ligne.
Utilisation dans l'entraînement des modèles de langage
OpenWebText a été largement adopté dans le domaine du traitement automatique du langage naturel (TALN). Il sert de corpus d'entraînement standard pour de nombreux modèles de langage open-source, y compris les variantes de GPT-2 et d'autres architectures basées sur les transformeurs. Par exemple, Hugging Face fournit une version prétraitée d'OpenWebText couramment utilisée pour l'ajustement fin et l'évaluation. Les chercheurs l'utilisent souvent pour comparer les performances des modèles à celles de GPT-2, car il offre une distribution d'entraînement comparable. Le jeu de données a également été utilisé dans des études sur la curation des données, la mise à l'échelle des modèles et les effets des données d'entraînement sur le comportement des modèles. Sa disponibilité a facilité la recherche reproductible dans le développement de grands modèles de langage, en particulier dans le contexte de l'IA générative.
Impact et limites
OpenWebText a eu un impact significatif sur la communauté IA open-source en démocratisant l'accès à un corpus web à grande échelle. Il a permis aux chercheurs sans accès à des jeux de données propriétaires d'entraîner et d'évaluer des modèles d'une échelle similaire à celle de GPT-2. Cependant, le jeu de données présente des limites. Il n'est pas aussi propre que les corpus organisés et contient une quantité substantielle de texte passe-partout, d'éléments de navigation et d'autres bruits. De plus, la méthodologie d'extraction basée sur le karma Reddit introduit un biais de sélection, favorisant le contenu qui plaît aux utilisateurs de Reddit. Le jeu de données manque également d'informations de licence explicites pour de nombreuses pages web incluses, soulevant des préoccupations de droits d'auteur. Malgré ces problèmes, OpenWebText reste une ressource fondamentale dans le développement des grands modèles de langage et continue d'être référencé dans la littérature académique.
Jeux de données connexes et évolution
OpenWebText fait partie d'un écosystème plus large de jeux de données textuels à l'échelle du web utilisés en TALN. D'autres exemples notables incluent Common Crawl, qui est un crawl massif du web, et The Pile, une collection organisée de sources diverses. Des jeux de données plus récents, tels que C4 (Colossal Clean Crawled Corpus) et RefinedWeb, ont été développés pour remédier à certains des problèmes de bruit et de qualité présents dans les crawls web bruts. Ces nouveaux jeux de données utilisent des techniques de filtrage et de déduplication plus sophistiquées. Néanmoins, OpenWebText reste pertinent en tant que référence historique et base pour évaluer les méthodes de curation des données. Sa création a également souligné l'importance des données ouvertes dans le domaine de l'intelligence artificielle, influençant les efforts ultérieurs pour publier des corpus d'entraînement à usage public.
Voir aussi
- Grand modèle de langage
- GPT-2
- Common Crawl
- The Pile
- Curation des données