Common Crawl est une organisation à but non lucratif, ainsi que le nom de son archive régulièrement mise à jour et librement accessible, contenant des pétaoctets de données issues du crawl web, collectées en parcourant systématiquement des milliards de pages web et en publiant le HTML brut, le texte extrait et les métadonnées pour téléchargement public. Fondée en 2007 par Gil Elbaz, Common Crawl précède de plus d'une décennie l'ère moderne des grands modèles de langage, mais son archive est devenue l'une des matières premières les plus importantes pour le pré-entraînement des LLM lorsque les chercheurs ont commencé à entraîner de grands modèles textuels sur des données à l'échelle du web à la fin des années 2010 et dans les années 2020.
Common Crawl publie un nouveau crawl environ chaque mois, et au milieu des années 2020, son archive cumulative couvrait des centaines de milliards de pages web, ce qui en fait, aux côtés des ensembles de données sous licence et organisés, l'une des plus grandes sources uniques de texte brut disponibles pour l'entraînement de l'IA.
Histoire et fonctionnement
Common Crawl a été établi comme une organisation à but non lucratif avec la mission déclarée de démocratiser l'accès aux données à l'échelle du web, qui étaient auparavant principalement disponibles pour les grandes entreprises de moteurs de recherche, offrant aux chercheurs, aux startups et aux développeurs indépendants une ressource comparable en ampleur à ce que Google ou Microsoft pouvaient crawler en interne. L'organisation a reçu des financements et un soutien de plusieurs entreprises technologiques et fondations au fil des ans. Son crawler suit les liens sur le web public de manière largement indiscriminée, sous réserve de robots.txt et d'autres conventions standard de crawl, ce qui signifie que l'archive brute inclut une très large gamme de qualité de contenu, allant de matériel de référence de haute valeur à du spam, du texte marketing et du contenu de faible qualité généré par l'IA dans les crawls plus récents.
Rôle dans l'entraînement de l'IA
Étant donné que l'archive brute de Common Crawl est non filtrée et très hétérogène, la plupart des laboratoires d'IA ne s'entraînent pas directement dessus, mais construisent plutôt des ensembles de données dérivés et filtrés à partir de celle-ci. Des exemples bien connus incluent l'ensemble de données C4 utilisé pour entraîner le modèle T5 de Google, les ensembles de données sous-jacents aux premiers modèles GPT tels que GPT-2 et GPT-3, ainsi que RefinedWeb et FineWeb, des dérivés filtrés et dédupliqués de Common Crawl publiés par des groupes de recherche affiliés à Hugging Face et d'autres dans les années 2020, spécifiquement pour l'entraînement ouvert de modèles de fondation. Ces ensembles de données dérivés appliquent des étapes telles que la déduplication, l'identification de la langue, des classificateurs de qualité entraînés pour imiter des textes de référence organisés comme Wikipédia, et un filtrage de toxicité ou de spam, ne conservant généralement qu'une fraction des pages crawlées d'origine.
Critiques et controverses
Le rôle de Common Crawl en tant qu'entrée fondamentale pour l'entraînement commercial de l'IA a attiré une attention croissante parallèlement à la vague plus large de procès sur le droit d'auteur liés à l'IA à partir de 2023, car l'archive inclut des articles de presse, des livres et d'autres contenus protégés par le droit d'auteur, collectés sans la permission explicite des titulaires de droits, sous les mêmes normes de crawl web sur lesquelles les moteurs de recherche s'appuyaient depuis longtemps, mais appliquées à un cas d'usage nouveau et plus controversé. Certains éditeurs ont commencé à bloquer le crawler de Common Crawl, CCBot, via robots.txt après 2023, spécifiquement pour empêcher que leur contenu ne soit intégré dans les pipelines d'entraînement de l'IA, une réponse reflétée sur de nombreux sites envers les crawlers liés à l'IA en général. Common Crawl a déclaré qu'il se conforme à ces désinscriptions et fonctionne comme un service neutre de collecte de données, arguant que la responsabilité de l'utilisation en aval incombe aux organisations qui construisent des ensembles de données d'entraînement à partir de son archive.
Importance
L'existence continue de Common Crawl en tant qu'alternative gratuite et ouverte aux index web propriétaires a été citée par des chercheurs, notamment dans des organisations telles que EleutherAI et l'Allen Institute for AI, comme importante pour permettre à la recherche en IA non commerciale et open source de rester viable dans un domaine de plus en plus dominé par des laboratoires fermés bien financés disposant de leur propre infrastructure de crawl privée.