译自英文

OpenWebText是一个从Reddit提交中提取网页的开源数据集,旨在复制用于训练OpenAI的GPT-2语言模型的私有WebText语料库。它为训练和评估大型语言模型提供了大规模、多样化的文本语料库。

OpenWebText是一个从Reddit提交中提取网页的开源数据集,旨在复刻用于训练OpenAI的GPT-2语言模型的私有WebText语料库。它提供了一个大规模、多样化的文本语料库,用于训练和评估大型语言模型。

背景与动机

OpenWebText于2019年由Aaron Gokaslan和Vanya Cohen引入,,他们当时分别隶属于马里兰大学和约翰霍普金斯大学。这一动机源于OpenAI决定不发布用于训练GPT-2的完整WebText数据集。WebText由Reddit帖子中获得的出站链接组成,,这些帖子至少获得3个karma,,总计约40GB文本。为了促进可复现性和进一步研究,,Gokaslan和Cohen通过抓取2005年至2018年4月期间Reddit提交的所有出站链接创建了OpenWebText,,应用相同的karma阈值,,并过滤英语内容。生成的数据集包含超过800万份文档,,总计约38GB文本,,与原始WebText的规模和多样性密切相关。

##数据集特征

OpenWebText是一个大规模、非结构化的文本语料库。与维基百科或书籍等精选数据集不同,,它涵盖了多种写作风格、主题和格式,,包括新闻文章、博客文章、论坛讨论和个人网站。这种多样性使其对于训练通用语言模型具有价值。数据集以文本文件集合的形式提供,,每个文档以换行符分隔。它通常被研究界用作评估模型在下一词预测和其他语言建模任务上性能的基准。然而,,由于它源自公共网络内容,,它继承了重复内容、低质量文本以及在线话语中存在的潜在偏见等问题

##在语言模型训练中的使用

OpenWebText已被广泛采用于自然语言处理(NLP)领域。它作为许多开源语言模型的标准训练语料库,,包括GPT-2变体和其他基于Transformer的架构。例如,,Hugging Face提供了一个预处理版本的OpenWebText,,通常用于微调和评估。研究人员经常使用它来比较模型与GPT-2的性能,,因为它提供了可比较的训练分布。该数据集也被用于关于数据策展、模型扩展以及训练数据对模型行为影响的研究中。其可用性促进了大型语言模型开发中的可复现研究,,特别是在生成式AI的背景下

##影响与局限性

OpenWebText通过使大规模网络语料库的获取民主化,,对开源AI社区产生了重大影响。它使无法访问专有数据集的研究人员能够训练和评估与GPT-2规模相当的模型。然而,,该数据集存在局限性。它不如精选语料库干净,,并且包含大量样板文本、导航元素和其他噪声。此外,,基于Reddit karma的抓取方法引入了选择偏差,,偏向于吸引Reddit用户的内容。该数据集还缺乏许多包含网页的明确许可信息,,引发了版权问题。尽管存在这些问题,,OpenWebText仍然是大型语言模型发展中的基础资源,,并继续在学术文献中被引用

##相关数据集与演变

OpenWebText是NLP中使用的更广泛的网络规模文本数据集生态系统的一部分。其他值得注意的例子包括Common Crawl,,这是一个大规模的网络抓取,,以及The Pile,,一个精选的多样化来源集合。更近期的数据集,,如C4(Colossal Clean Crawled Corpus)和RefinedWeb,,已被开发出来以解决原始网络抓取中存在的一些噪声和质量问题。这些较新的数据集采用了更复杂的过滤和去重技术。尽管如此,,OpenWebText作为历史基准和评估数据策展方法的基线仍然具有相关性。它的创建也凸显了开放数据在人工智能领域的重要性,,影响了随后发布训练语料库供公众使用的努力

##参见

  • 数据策展
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·datasets·machine-learning
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史