BookCorpus est une vaste collection de livres de fiction gratuits et non publiés, devenue un ensemble de données standard pour le pré-entraînement des modèles de langage neuronaux. Compilé par des chercheurs de l'Université de Toronto et d'OpenAI, le corpus contient plus de 11 000 livres et environ 74 millions de phrases, totalisant environ 1 milliard de mots. Il a été introduit en 2015 dans un article de Yukun Zhu et ses collègues, qui l'ont utilisé pour entraîner des modèles à générer des scénarios de films. L'objectif principal de cet ensemble de données est de fournir un corpus narratif diversifié et cohérent qui aide les modèles à apprendre les dépendances à long terme et la compréhension contextuelle, essentielles pour des tâches de traitement du langage naturel(TLN).
La création de BookCorpus a impliqué le téléchargement de livres depuis Internet, notamment depuis la plateforme Smashwords, où les auteurs publient leurs œuvres gratuitement. Les critères de sélection privilégiaient les livres ayant une longueur minimale et une structure narrative, garantissant que le texte contienne un développement riche des personnages, une progression de l'intrigue et un vocabulaire varié. Cette focalisation sur la fiction distingue BookCorpus d'autres ensembles de données comme Wikipédia ou les articles de presse, qui sont plus factuels et structurés. Le texte brut a été traité pour supprimer les métadonnées, les tableaux et autres éléments non narratifs, résultant en un corpus propre, segmenté en phrases, facile à utiliser pour l'entraînement.
Rôle dans le développement des modèles de langage
BookCorpus a gagné en importance en tant qu'ensemble de données clé pour le pré-entraînement de plusieurs grands modèles de langage influents. En 2018, le modèle BERT de Google, basé sur l'architecture Transformer, a utilisé BookCorpus aux côtés de Wikipédia en anglais pour son objectif de modélisation de langage masqué. La nature narrative des livres a aidé BERT à apprendre à gérer les dépendances à long terme et la résolution de coréférences, courantes dans la fiction. De même, le premier Generative Pre-trained Transformer(GPT) d'OpenAI a été entraîné exclusivement sur BookCorpus, démontrant qu'un ensemble de données unique et ciblé pouvait produire de bonnes performances sur diverses tâches en aval. Plus tard, des modèles comme GPT-2 et GPT-3 ont élargi leurs données d'entraînement pour inclure des textes web, mais BookCorpus est resté un composant fondamental à leurs débuts.
Le choix de BookCorpus pour ces modèles a été motivé par sa taille et sa qualité. À l'époque, c'était l'un des plus grands ensembles de textes longs et cohérents disponibles. Les livres offraient un terrain d'essai naturel pour apprendre à prédire le mot suivant dans une phrase, car ils contiennent des structures de phrases complexes et des arcs narratifs absents des contenus web plus courts et fragmentés. Cela a aidé les modèles à développer un meilleur sens du style, du ton et de la cohérence logique, ce qui s'est avéré bénéfique pour des tâches comme la génération de texte et la réponse à des questions.
Caractéristiques techniques
D'un point de vue technique, BookCorpus est remarquable pour sa segmentation au niveau des phrases et sa tokenisation. L'ensemble de données est généralement prétraité en divisant le texte en phrases à l'aide d'heuristiques basées sur la ponctuation et les majuscules, puis tokenisé en unités sous-phrastiques à l'aide d'algorithmes comme le Byte-Pair Encoding (BPE) ou WordPiece. La longueur moyenne des phrases est d'environ 13 mots, légèrement plus longue que celle des textes web typiques, ce qui reflète le style descriptif de la fiction. La taille du vocabulaire est importante, avec plus de 200 000 mots uniques, bien que beaucoup soient rares ou des noms propres, ce qui peut poser des défis pour les modèles à vocabulaire fixe.
Une limitation de BookCorpus est son manque de diversité en termes de genre et d'auteurs. Les livres proviennent principalement d'auteurs auto-édités sur Smashwords, ce qui peut ne pas représenter l'ensemble du spectre de la littérature anglaise. De plus, le corpus contient un nombre significatif de fautes de frappe et d'incohérences de formatage, qui peuvent introduire du bruit lors de l'entraînement. Malgré ces problèmes, l'ensemble de données a été largement adopté car il est gratuitement disponible et facile à télécharger, ce qui le rend accessible aux chercheurs et aux praticiens, tant dans le milieu universitaire que dans l'industrie.
Impact et héritage
L'introduction de BookCorpus a coïncidé avec un changement dans le TLN vers le pré-entraînement sur de grands corpus non étiquetés, suivi d'un ajustement fin sur des tâches spécifiques. Son succès a contribué à populariser l'idée qu'un ensemble de données unique et bien organisé pouvait servir de base universelle pour de nombreuses applications. Cette approche a ensuite été étendue par d'autres ensembles de données comme The Pile et C4, qui combinent plusieurs sources pour créer des ensembles d'entraînement encore plus grands et plus diversifiés. Cependant, BookCorpus reste une référence pour évaluer l'efficacité du texte narratif dans la modélisation du langage, et il est toujours utilisé dans la recherche sur l'interprétabilité des modèles et les biais.
L'ensemble de données a également suscité des discussions sur le droit d'auteur et la provenance des données. Étant donné que les livres sont non publiés et distribués gratuitement, leur statut juridique pour l'entraînement est moins clair que celui des œuvres du domaine public. Cela a conduit à des débats sur le consentement et la compensation des auteurs, qui se poursuivent dans le contexte plus large des données d'entraînement de l'IA. En 2025, BookCorpus n'est plus activement maintenu, mais son influence persiste dans la conception des modèles de langage modernes et les considérations éthiques entourant leur développement.
Alternatives et comparaisons
Plusieurs alternatives à BookCorpus ont vu le jour au fil des ans, chacune avec ses propres forces. Par exemple, l'ensemble de données WikiText, dérivé de Wikipédia, offre un texte plus propre et plus structuré mais manque de la profondeur narrative de la fiction. L'ensemble de données OpenWebText, qui récupère des pages web liées depuis Reddit, fournit un échantillon plus large et plus diversifié mais inclut plus de bruit et de langage informel. En revanche, la focalisation de BookCorpus sur la fiction le rend particulièrement adapté aux tâches nécessitant la compréhension des interactions entre personnages, des arcs émotionnels et du langage descriptif. Les chercheurs combinent souvent BookCorpus avec d'autres ensembles de données pour équilibrer cohérence et diversité, comme on le voit dans l'entraînement de modèles comme RoBERTa et T5.
En résumé, BookCorpus est un ensemble de données pionnier qui a joué un rôle crucial dans l'avancement de l'apprentissage profond pour le langage. Sa création a permis le développement de modèles capables de générer un texte fluide et contextuellement approprié, ouvrant la voie à l'ère moderne de l'IA générative. Bien que des ensembles de données plus récents et plus vastes aient depuis été introduits, BookCorpus reste une référence historique et une ressource pratique pour de nombreux projets de recherche.