Traduit de l'anglais

C4 (Colossal Clean Crawled Corpus) est un ensemble de données textuelles web à grande échelle et nettoyé, introduit par Google en 2019 pour le pré-entraînement de modèles de langage basés sur des transformeurs, contenant des centaines de gigaoctets de texte anglais extrait de Common Crawl.

C4, abréviation de Colossal Clean Crawled Corpus, est un ensemble de données textuelles à grande échelle utilisé pour le pré-entraînement des grands modèles de langage. Il a été introduit par des chercheurs de Google en 2019 dans le cadre du projet original Transformer (architecture)-based T5 (Text-to-Text Transfer Transformer). L'ensemble de données se compose de centaines de gigaoctets de texte en anglais extraits de l'archive web Common Crawl, un référentiel public de milliards de pages web collectées sur de nombreuses années. C4 a été conçu pour offrir une alternative plus propre et plus gérable aux données brutes de crawl web, qui contiennent généralement beaucoup de bruit, comme des textes de navigation standardisés, du contenu dupliqué et des textes de faible qualité ou générés par machine.

La création de C4 a impliqué un pipeline de filtrage en plusieurs étapes appliqué aux données brutes de Common Crawl. La première étape consistait à dédupliquer l'ensemble de données en supprimant les phrases et documents quasi identiques, ce qui réduisait la redondance et améliorait l'efficacité de l'entraînement. Ensuite, le pipeline supprimait les pages contenant des textes de remplissage, comme « lorem ipsum » ou des phrases standardisées courantes, et écartait les pages qui n'étaient pas principalement en anglais, selon un classificateur de langue. De plus, le pipeline filtrait les pages contenant du contenu offensant ou inapproprié, y compris celles avec certains mots-clés ou termes. L'ensemble de données final comprenait environ 750 gigaoctets de texte, soit environ 156 milliards de jetons, ce qui en faisait l'un des plus grands corpus de pré-entraînement publics de l'époque.

Composition et caractéristiques

L'ensemble de données C4 est remarquable par son échelle et sa diversité. Il inclut du texte provenant d'un large éventail de domaines web, notamment des articles de presse, des blogs, des forums et des pages académiques. Cependant, comme il est dérivé de crawls web, l'ensemble reflète les biais et les limites du contenu web, comme la surreprésentation de certains sujets et la sous-représentation d'autres. Le processus de filtrage a également introduit un biais vers un anglais formel et bien écrit, car il a supprimé de nombreux textes informels ou non standard. Depuis, les chercheurs ont analysé C4 pour des problèmes tels que la contamination des données (où les ensembles de test chevauchent les données d'entraînement) et la présence d'informations personnellement identifiables, ce qui a conduit au développement de versions plus raffinées comme C4-200M et C4-en-1.0.

Utilisation dans le pré-entraînement

C4 a été initialement utilisé pour pré-entraîner le modèle T5, qui a formulé toutes les tâches de traitement du langage naturel comme des problèmes texte-à-texte. La taille et la propreté de l'ensemble de données le rendaient adapté à l'entraînement de modèles avec des milliards de paramètres. Après T5, C4 est devenu une référence standard pour évaluer les techniques de curation de données et a été adopté par de nombreux modèles ultérieurs, y compris des variantes de BERT et de GPT. Par exemple, le modèle GPT-3 de OpenAI a utilisé une approche similaire de filtrage de Common Crawl, bien que pas exactement l'ensemble de données C4. L'ensemble a également servi de base à des extensions multilingues, comme mC4, qui couvre plus de 100 langues.

Impact et héritage

L'introduction de C4 a eu un impact significatif sur le domaine de l'apprentissage automatique et de l'intelligence artificielle. Elle a démontré l'importance de la qualité des données dans le pré-entraînement de modèles à grande échelle, montrant qu'un filtrage soigné pouvait conduire à des améliorations substantielles des performances sur les tâches en aval. C4 a également mis en lumière les défis pratiques liés au travail avec des données à l'échelle du web, notamment le stockage, le traitement et les considérations éthiques. Sa publication en tant qu'ensemble de données ouvert a permis aux chercheurs du monde entier d'expérimenter avec le pré-entraînement à grande échelle sans avoir à collecter leurs propres crawls web, démocratisant l'accès à des données d'entraînement de haute qualité.

Limites et critiques

Malgré son utilisation répandue, C4 a fait face à des critiques. Le processus de filtrage, bien qu'efficace pour éliminer le bruit, a également supprimé du contenu qui pourrait être précieux pour certaines tâches, comme des extraits de code ou des dialectes d'anglais non standard. La dépendance de l'ensemble à un texte exclusivement en anglais a limité son applicabilité aux modèles multilingues, bien que cela ait été corrigé plus tard par mC4. De plus, le C4 original n'était pas entièrement dédupliqué au niveau du document, ce qui a conduit à des biais potentiels dus à un contenu répété. Les chercheurs ont également noté que l'ensemble contient des informations obsolètes, car il provient de crawls web jusqu'en 2019, et qu'il peut inclure du matériel protégé par le droit d'auteur, soulevant des questions juridiques et éthiques sur son utilisation dans des modèles commerciaux.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·pretraining·natural-language-processing·web-crawl
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique