Common Crawl是一个非营利组织,也是其定期更新的免费可获取档案的名称,该档案包含PB级(拍字节)的网络爬取数据,通过系统性地爬取数十亿网页收集而来,并公开发布原始HTML、提取的文本及元数据供公众下载。Common Crawl由Gil El Azem于2007年创立,比大型语言模型的现代时代早了十多年,但其档案在2010年代末至2020年代初研究人员开始利用网络规模数据训练大型文本模型时,成为了最重要的原始材料来源之一。
Common Crawl大约每月发布一次新的爬取数据,到2020年代中期,其累计档案已涵盖数千亿个网页,使其与授权数据集和精选数据集并列,成为可用于AI训练的单一最大原始文本来源之一。
历史与运作
Common Crawl作为一个非营利组织成立,其使命是让此前主要被大型搜索引擎公司垄断的网络规模数据能够被公众获取,为研究人员、初创企业和独立开发者提供与谷歌或微软内部爬取能力相当的数据资源。多年来,该组织获得了多家科技公司和基金会的资助。其爬虫程序基本不加区分地遍历公共网络中的链接,遵循robots.txt及其他标准爬取规范,这意味着原始档案中内容质量参差不齐,既有高价值的参考资料,也有垃圾信息、营销文案,以及近年爬取中越来越多的AI生成内容。
在AI训练中的作用
由于Common Crawl的原始档案未经筛选且高度混杂,大多数AI实验室并不直接使用它,而是基于其构建经过过滤的数据集。著名的例子包括用于训练谷歌T5模型的C4数据集,支撑早期GPT模型(如GPT-2和GPT-3)的数据集,以及2020年代由Hugging Face关联研究团队及其他研究团体发布的RefinedWeb和FineWeb,,这些数据集均是对Common Crawl数据进行过滤和去重后的衍生品,专门用于开源基础模型训练。这些衍生数据集通常经过去重、语言识别、训练质量分类器(用于模仿维基百科等精选参考文本)以及有害内容或垃圾信息过滤等步骤,最终往往只保留原始爬取页面的一小部分。
批评与争议
随着2023年以来AI版权诉讼浪潮的兴起,Common Crawl作为商业AI训练的基础输入来源受到了越来越多的审视,因为其档案中包含未经版权所有者明确许可而爬取的新闻文章、书籍及其他材料。这些内容是在搜索引擎长期依赖的网络爬取规范下收集的,但被应用于一个更具争议性的新场景。2023年后,一些出版商开始通过robots.txt阻止Common Crawl的爬虫CCBot,以防止其内容进入AI训练流程,这一做法也反映在许多网站对各类AI爬虫的普遍抵制中。Common Crawl表示其遵守此类退出选择,并自视为中立的數據收集服务,认为下游使用的责任应由基于其档案构建训练数据集的组织承担。
意义
Common Crawl作为专有网络索引的免费、开放替代方案持续存在,已被研究人员(包括EleutherAI和艾伦人工智能研究所等机构)引用为重要资源,认为其对于在日益由资金充裕、拥有自有爬取基础设施的封闭实验室主导的领域中,维持非商业和开源AI研究的可行性至关重要。