Common Crawl es una organización sin fines de lucro, y el nombre de su archivo de petabytes de datos de rastreo web, actualizado regularmente y disponible gratuitamente, que se recopila mediante el rastreo sistemático de miles de millones de páginas web y la publicación del HTML crudo, el texto extraído y los metadatos para descarga pública. Fundado en 2007 por Gil Elbaz, Common Crawl precede a la era moderna de los modelos de lenguaje de gran tamaño por más de una década, pero su archivo se convirtió en uno de los materiales primarios más importantes para el pretraining de LLM una vez que los investigadores comenzaron a entrenar modelos de texto a gran escala con datos de nivel web a finales de la década de 2010 y en la de 2020.
Common Crawl publica un nuevo rastreo aproximadamente cada mes, y para mediados de la década de 2020 su archivo acumulado abarcaba cientos de miles de millones de páginas web, lo que lo convierte, junto con conjuntos de datos con licencia y curados, en una de las mayores fuentes individuales de texto crudo disponible para el entrenamiento de IA.
Historia y operación
Common Crawl se estableció como una organización sin fines de lucro con la misión declarada de democratizar el acceso a datos de nivel web que anteriormente estaban disponibles principalmente para grandes empresas de motores de búsqueda, proporcionando a investigadores, startups y desarrolladores independientes un recurso comparable en escala a lo que Google o Microsoft podían rastrear internamente. La organización ha recibido financiación y apoyo de varias empresas tecnológicas y fundaciones a lo largo de los años. Su rastreador sigue enlaces a través de la web pública de manera en gran medida indiscriminada, sujeto a robots.txt y otras convenciones estándar de rastreo, lo que significa que el archivo crudo incluye una amplia gama de calidad de contenido, desde material de referencia de alto valor hasta spam, texto de marketing y contenido generado por IA de baja calidad en rastreos más recientes.
Papel en el entrenamiento de IA
Debido a que el archivo crudo de Common Crawl no está filtrado y es altamente heterogéneo, la mayoría de los laboratorios de IA no entrenan directamente sobre él, sino que construyen conjuntos de datos derivados y filtrados a partir de él. Ejemplos bien conocidos incluyen el conjunto de datos C4 utilizado para entrenar el modelo T5 de Google, los conjuntos de datos subyacentes a los primeros modelos GPT como GPT-2 y GPT-3, y RefinedWeb y FineWeb, derivados de Common Crawl filtrados y deduplicados publicados por grupos de investigación afiliados a Hugging Face y otros en la década de 2020 específicamente para el entrenamiento abierto de modelos fundacionales. Estos conjuntos de datos derivados aplican pasos como deduplicación, identificación de idioma, clasificadores de calidad entrenados para imitar texto de referencia curado como Wikipedia, y filtrado de toxicidad o spam, reteniendo típicamente solo una fracción de las páginas rastreadas originales.
Crítica y controversia
El papel de Common Crawl como entrada fundamental para el entrenamiento de IA comercial atrajo un escrutinio creciente junto con la ola más amplia de demandas por derechos de autor de IA a partir de 2023, ya que el archivo incluye artículos de noticias, libros y otro material con derechos de autor extraído sin el permiso explícito de los titulares de derechos, recopilado bajo las mismas normas de rastreo web en las que los motores de búsqueda habían confiado durante mucho tiempo, pero aplicado a un caso de uso nuevo y más controvertido. Algunos editores se movieron para bloquear el rastreador de Common Crawl, CCBot, mediante robots.txt después de 2023 específicamente para evitar que su contenido fluyera hacia los pipelines de entrenamiento de IA, una respuesta reflejada en muchos sitios hacia los rastreadores relacionados con IA en general. Common Crawl ha declarado que cumple con tales exclusiones y opera como un servicio neutral de recopilación de datos, argumentando que la responsabilidad por el uso posterior recae en las organizaciones que construyen conjuntos de datos de entrenamiento a partir de su archivo.
Importancia
La existencia continua de Common Crawl como una alternativa gratuita y abierta a los índices web propietarios ha sido citada por investigadores, incluso en organizaciones como EleutherAI y el Instituto Allen para la IA, como importante para permitir que la investigación de IA no comercial y de código abierto siga siendo viable en un campo cada vez más dominado por laboratorios cerrados bien financiados con su propia infraestructura de rastreo privada.