英語からの翻訳

C4(Colossal Clean Crawled Corpus)は、2019年にGoogleが導入した大規模でクリーニング済みのウェブテキストデータセットであり、トランスフォーマーベースの言語モデルの事前学習用に設計されています。Common Crawlから抽出された数百ギガバイトの英語テキストを含んでいます。

C4(全称Colossal Clean Crawled Corpus)是一个用于预训练大语言模型的大规模文本数据集。它由Google的研究人员于2019年作为原始基于Transformer (architecture)的T5(Text-to-Text Transfer Transformer)项目的一部分引入。该数据集包含数百GB的英语文本,这些文本提取自Common Crawl网络档案,这是一个公开可用的数十亿网页存储库,,收集时间跨越多年。C4旨在提供一种比原始网络爬取数据更干净、更易管理的替代方案,,因为原始数据通常包含大量噪声,,如样板导航文本、重复内容以及低质量或机器生成的文本。

C4的创建涉及对原始Common Crawl数据应用多步骤过滤管道。第一步是对数据集进行去重,,移除近乎相同的句子和文档,,这有助于减少冗余并提高训练效率。接下来,,管道移除了包含占位文本(如“lorem ipsum”或常见样板短语)的页面,,并丢弃了主要非英语的页面,,这是通过语言分类器确定的。此外,,管道还过滤掉了包含攻击性或不当内容(包括某些关键词或术语)的页面。最终数据集包含约750GB的文本,,即约1560亿个token,,使其成为当时最大的公开可用预训练语料库之一。

组成与特征

C4数据集以其规模和多样性而著称它包含来自广泛网络域名的文本,,包括新闻文章、博客、论坛和学术页面等然而,,由于它源自网络爬取,,该数据集反映了网络内容的偏见和局限性,,例如某些主题的过度代表和其他主题的代表不足。过滤过程还引入了对正式、书写良好的英语的偏向,,因为它移除了许多非正式或非标准文本。研究人员此后分析了C4中的数据污染问题(即测试集与训练数据重叠)以及个人可识别信息的存在,,从而推动了更精细版本(如C4-200M和C4-en-1.0)的开发。

预训练中的使用

C4最初用于预训练T5模型,,该模型将所有自然语言处理任务视为文本到文本问题该数据集的大小和清洁度使其适合训练具有数十亿参数的模型在T5之后,,C4成为评估数据整理技术的标准基准,,并被许多后续模型采用,,包括BERT和GPT的变体例如,,OpenAI的GPT-3模型使用了类似的过滤Common Crawl方法,,尽管并非确切的C4数据集该数据集还作为多语言扩展的基础,,如mC4,,覆盖超过100种语言

影响与遗产

C4的引入对机器学习人工智能领域产生了重大影响它证明了数据质量在预训练大规模模型中的重要性,,表明仔细过滤可以显著改善下游任务性能C4还突显了处理网络规模数据的实际挑战,,包括存储、处理和伦理考虑其作为开放数据集的发布使全球研究人员能够实验大规模预训练,,而无需自行收集网络爬取数据,,从而民主化了对高质量训练数据的访问

局限性与批评

尽管被广泛使用,,C4仍面临批评过滤过程虽然有效去除噪声,,但也移除了某些任务可能有价值的内容,,如代码片段或非标准英语方言该数据集仅依赖英语文本,,限制了其对多语言模型的适用性,,尽管后来通过mC4解决了这一问题此外,,原始C4在文档级别并未完全去重,,导致重复内容可能带来偏见研究人员还指出,,该数据集包含过时信息,,因为它源自截至2019年的网络爬取,,并且可能包含受版权保护的材料,,这引发了关于其在商业模型中使用的法律和伦理问题

参见

  • 数据整理
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:dataset·pretraining·natural-language-processing·web-crawl
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴