अंग्रेज़ी से अनुवादित

C4 (Colossal Clean Crawled Corpus) एक बड़े पैमाने पर, साफ किया गया वेब टेक्स्ट डेटासेट है, जिसे Google ने 2019 में ट्रांसफॉर्मर-आधारित भाषा मॉडल के प्रीट्रेनिंग के लिए पेश किया था, जिसमें Common Crawl से निकाला गया सैकड़ों गीगाबाइट का अंग्रेजी टेक्स्ट शामिल है।

C4,即Colossal Clean Crawled Corpus的缩写,是一个用于预训练大型语言模型的大规模文本数据集。它由谷歌的研究人员于2019年作为原始Transformer (architecture)-based T5(文本到文本迁移转换器)项目的一部分引入。该数据集包含从Common Crawl网络档案中提取的数百GB英文文本,Common Crawl是一个公开可用的、包含数十亿网页的存储库,这些网页多年来被收集。C4旨在提供比原始网络爬取数据更干净、更易管理的替代方案,原始数据通常包含大量噪声,如样板导航文本、重复内容以及低质量或机器生成的文本。

C4的创建涉及对原始Common Crawl数据应用多步骤过滤流程。初始步骤通过移除几乎相同的句子和文档来去重数据集,这有助于减少冗余并提高训练效率。接下来,流程移除了包含占位文本(如“lorem ipsum”或常见样板短语)的页面,并丢弃了主要不是英文的页面,这是通过语言分类器确定的。此外,流程还过滤掉包含攻击性或不当内容的页面,包括那些含有某些关键词或术语的页面。最终数据集包含约750GB文本,或约1560亿个标记,使其成为当时最大的公开预训练语料库之一。

组成与特征

C4数据集以其规模和多样性而著称。它包含来自广泛网络域名的文本,包括新闻文章、博客、论坛和学术页面。然而,由于它源自网络爬取,数据集反映了网络内容的偏见和局限性,例如某些主题的过度代表和其他主题的不足代表。过滤过程还引入了对正式、书写良好的英语的偏见,因为它移除了许多非正式或非标准文本。研究人员此后分析了C4中的问题,如数据污染(测试集与训练数据重叠)和存在个人可识别信息,导致了更精细版本(如C4-200M和C4-en-1.0)的开发。

预训练中的使用

C4最初用于预训练T5模型,该模型将所有自然语言处理任务视为文本到文本问题。数据集的大小和清洁度使其适合训练具有数十亿参数的模型。在T5之后,C4成为评估数据整理技术的标准基准,并被许多后续模型采用,包括BERT和GPT的变体。例如,OpenAI的GPT-3模型使用了类似的过滤Common Crawl方法,尽管不是确切的C4数据集。该数据集还作为多语言扩展的基础,如mC4,覆盖了100多种语言。

影响与遗产

C4的引入对机器学习和人工智能领域产生了重大影响。它展示了数据质量在预训练大规模模型中的重要性,表明仔细过滤可以带来下游任务性能的显著提升。C4还突出了处理网络规模数据的实际挑战,包括存储、处理和伦理考虑。其作为开放数据集的发布使全球研究人员能够实验大规模预训练,而无需自行收集网络爬取数据,从而民主化了对高质量训练数据的访问。

局限性与批评

尽管广泛使用,C4仍面临批评。过滤过程虽然有效去除噪声,但也移除了对某些任务可能有价值的内容,如代码片段或非标准英语方言。数据集仅依赖英文文本限制了其对多语言模型的适用性,尽管这后来通过mC4得到解决。此外,原始C4在文档级别并未完全去重,导致重复内容可能带来偏见。研究人员还指出,数据集包含过时信息,因为它源自截至2019年的网络爬取,并且可能包含受版权保护的材料,这引发了关于其在商业模型中使用的法律和伦理问题。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·pretraining·natural-language-processing·web-crawl
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास