Traduit de l'anglais

Le Pile est un jeu de données textuelles anglaises open-source de 886 Go créé par EleutherAI en 2020 pour l’entraînement de grands modèles de langage, comprenant 22 sous-ensembles de données. Il a fait face à des litiges de droits d’auteur, conduisant à la publication de Common Pile v0.1 en 2025.

The Pile est un ensemble de données ouvert et diversifié de 886 Go de textes en anglais, créé pour entraîner de grands modèles de langage (LLM). Il a été constitué par EleutherAI et publié le 31 décembre de cette année-là. L'ensemble se compose de 22 sous-ensembles de données, notamment des livres, des transcriptions de films et des articles scientifiques, entre autres types de médias. En 2024, The Pile et Common Crawl étaient les deux principaux ensembles de données utilisés pour entraîner les modèles d'IA.

The Pile a été conçu pour offrir une alternative plus variée et de meilleure qualité aux corpus exclusivement issus du web, en s'appuyant sur des sources telles que des publications académiques, des documents juridiques et des écrits créatifs. Son ampleur et sa diversité en ont fait une ressource fondamentale pour de nombreux projets de grands modèles de langage, en particulier au sein de la communauté open source. La structure de l'ensemble de données a permis aux chercheurs d'étudier l'impact des différents types de données sur les performances des modèles, contribuant ainsi aux avancées dans les domaines de l'apprentissage automatique et de l'intelligence artificielle.

Composition et sous-ensembles de données

The Pile intègre 22 sous-ensembles de données distincts, chacun sélectionné pour couvrir différents domaines et styles de textes en anglais. On y trouve notamment Books3, une collection de livres ; OpenSubtitles, qui contient des sous-titres de films et de séries ; et arXiv, qui fournit des articles scientifiques. D'autres composants incluent des résumés de PubMed, des avis juridiques américains et du code provenant de GitHub, entre autres. Cette variété visait à améliorer les capacités de généralisation des modèles entraînés sur ces données, leur permettant de traiter des tâches allant de la réponse à des questions techniques à la rédaction créative.

L'inclusion de code provenant de GitHub et d'articles académiques d'arXiv a rendu The Pile particulièrement utile pour former des modèles capables d'assister en programmation et en recherche scientifique. Les créateurs de l'ensemble de données, au sein d'EleutherAI, un groupe de recherche à but non lucratif, avaient pour objectif de démocratiser l'accès à des données d'entraînement de haute qualité, auparavant réservées à de grandes entreprises comme OpenAI et Google DeepMind.

Controverses sur le droit d'auteur

Des litiges relatifs au droit d'auteur ont éclaté autour de The Pile en 2023. Le sous-ensemble Books3 contient en effet du matériel protégé par le droit d'auteur, compilé à partir de Bibliotik, un site de piratage. En juillet 2023, le groupe danois de lutte contre le piratage Rights Alliance a obtenu le retrait de Books3 via des avis DMCA. Books3 a été retiré de The Pile avant qu'une action collective ne soit intentée en 2024 par trois auteurs réclamant des dommages-intérêts, alors que des copies de l'ensemble de données original étaient toujours disponibles sur le web. En 2024, The Pile a également été retiré de son site d'origine, bien qu'il soit resté accessible via d'autres services de partage de fichiers.

OpenSubtitles, un autre sous-ensemble, a également suscité des controverses en raison de l'utilisation d'œuvres protégées par le droit d'auteur provenant de documentaires, de films, de séries et de vidéos en ligne. Des dizaines de milliers de vidéos YouTube ont vu leurs sous-titres extraits directement et inclus dans The Pile, ce que YouTube a jugé contraire à ses conditions d'utilisation. Ces problèmes ont mis en lumière les défis juridiques et éthiques liés à l'utilisation de données extraites du web pour entraîner des réseaux de neurones et des transformeurs.

Common Pile v0.1

En juin 2025, EleutherAI, en partenariat avec Poolside, Hugging Face, la Bibliothèque du Congrès des États-Unis et plus de deux douzaines de chercheurs issus de 14 institutions, dont l'Université de Toronto, le MIT CSAIL, l'Université Carnegie-Mellon, le Vector Institute et l'Allen Institute for AI, a publié Common Pile v0.1. Cet ensemble de données d'entraînement ne contient que des œuvres dont les licences autorisent leur utilisation pour l'entraînement de modèles d'IA. L'objectif était de démontrer qu'il est possible d'entraîner des systèmes d'IA de manière éthique tout en respectant le droit d'auteur.

Les créateurs ont constaté que la collecte de ces données était chronophage, car elle ne pouvait pas être entièrement automatisée : chaque entrée devait être vérifiée et annotée par des humains. Malgré cela, les modèles résultants ont obtenu des performances dépassant leurs attentes, bien qu'elles ne soient pas encore comparables à celles des modèles de pointe. Les créateurs ont comparé les résultats générés à partir de Common Pile à ceux de Llama 2, un modèle publié deux ans avant la création de Common Pile. Ce nouvel ensemble vise à offrir une alternative présentant moins de risques juridiques pour les utilisateurs, grâce à des données d'entraînement dont la licence est plus claire.

Impact et héritage

The Pile a profondément influencé le paysage de la recherche en IA open source en offrant un ensemble de données vaste et accessible pour l'entraînement de modèles d'apprentissage profond. Sa publication a permis à de petits groupes de recherche et à des développeurs indépendants d'expérimenter l'entraînement à grande échelle, un domaine auparavant dominé par les grandes entreprises technologiques. L'ensemble a également stimulé les discussions sur la provenance des données et le droit d'auteur dans l'IA, conduisant à des initiatives comme Common Pile qui privilégient une approche éthique.

En 2024, The Pile et Common Crawl restaient les principaux ensembles de données utilisés pour entraîner de nombreux modèles d'IA, malgré les défis juridiques. L'évolution vers des ensembles de données plus soigneusement sélectionnés, comme Common Pile, reflète une tendance plus large de l'industrie vers un développement responsable de l'IA, conciliant innovation et considérations juridiques et éthiques. L'héritage de The Pile réside non seulement dans ses contributions techniques, mais aussi dans la remise en question qu'il a provoquée sur la manière dont les données d'entraînement sont collectées et utilisées dans le domaine de l'IA générative.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·large-language-model·open-source·ai-training
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique