译自英文

C4(Colossal Clean Crawled Corpus)是谷歌于2019年推出的大规模、经过清洗的网络文本数据集,用于预训练基于[[transformer|Transformer]]的语言模型,包含从[[common-crawl|Common Crawl]]中提取的数百GB英文文本。

C4,即“大规模清洁爬取语料库”(Colossal Clean Crawled Corpus)的简称,是一个用于预训练大型语言模型的大规模文本数据集。它由谷歌的研究人员于2019年作为基于Transformer (architecture)的T5(文本到文本转换器)项目的一部分引入。该数据集包含数百吉字节的英语文本,这些文本从Common Crawl网络档案中提取,后者是一个公开可用的、包含数十亿网页的存储库,这些网页经过多年收集而成。C4旨在提供比原始网络爬取数据更干净、更易管理的替代方案,因为原始数据通常包含大量噪声,如样板导航文本、重复内容以及低质量或机器生成的文本。

C4的创建涉及对原始Common Crawl数据应用多步骤过滤流程。初始步骤是通过移除近乎相同的句子和文档来对数据集进行去重,这有助于减少冗余并提高训练效率。接下来,该流程移除了包含占位文本(如“lorem ipsum”或常见样板短语)的页面,并丢弃了根据语言分类器判定并非主要使用英语的页面。此外,该流程还过滤掉了包含攻击性或不当内容的页面,包括带有某些关键词或术语的页面。最终数据集包含约750吉字节的文本,即约1560亿个词元,使其成为当时最大的公开预训练语料库之一。

组成与特征

C4数据集以其规模和多样性而著称。它包含来自广泛网络域名的文本,包括新闻文章、博客、论坛和学术页面。然而,由于它源自网络爬取,该数据集反映了网络内容的偏见和局限性,例如某些主题的过度代表和其他主题的代表不足。过滤过程还引入了对正式、书写规范的英语的偏向,因为它移除了许多非正式或非标准文本。研究人员此后对C4进行了分析,以解决数据污染(即测试集与训练数据重叠)和包含个人可识别信息等问题,从而促成了更精细版本(如C4-200M和C4-en-1.0)的开发。

在预训练中的使用

C4最初用于预训练T5模型,该模型将所有自然语言处理任务视为文本到文本问题。数据集的大小和清洁度使其适合训练具有数十亿参数的模型。在T5之后,C4成为评估数据整理技术的标准基准,并被许多后续模型采用,包括BERT和GPT的变体。例如,OpenAI的GPT-3模型使用了类似的过滤Common Crawl方法,尽管并非精确的C4数据集。该数据集还作为多语言扩展的基础,例如mC4,它覆盖了超过100种语言。

影响与遗产

C4的引入对机器学习人工智能领域产生了重大影响。它展示了数据质量在预训练大规模模型中的重要性,表明仔细的过滤可以显著提高下游任务的性能。C4还凸显了处理网络规模数据的实际挑战,包括存储、处理和伦理考量。其作为开放数据集的发布使全球研究人员能够实验大规模预训练,而无需自行收集网络爬取数据,从而民主化了对高质量训练数据的访问。

局限性与批评

尽管被广泛使用,C4仍面临批评。过滤过程虽然有效去除噪声,但也移除了对某些任务可能有价值的内容,如代码片段或非标准英语方言。数据集仅依赖英语文本限制了其对多语言模型的适用性,尽管这一点后来通过mC4得到解决。此外,原始C4在文档级别并未完全去重,导致重复内容可能带来偏见。研究人员还指出,该数据集包含过时信息,因为它源自截至2019年的网络爬取,并且可能包含受版权保护的材料,这引发了关于其在商业模型中使用时的法律和伦理问题。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:dataset·pretraining·natural-language-processing·web-crawl
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史