The Pile是一个886 GB的多样化开源英文文本数据集,旨在训练大型语言模型(LLM)。它由EleutherAI于2020年构建,并于同年12月31日公开发布。该数据集由22个子数据集组成,包括书籍、电影剧本和科学论文等各类媒体。截至2024年,The Pile和Common Crawl一直是用于训练AI模型的两个主要训练数据集。
The Pile旨在提供比纯网络语料库更多样化、更高质量的替代方案,其来源包括学术出版物、法律文件和创意写作。其规模和多样性使其成为许多大型语言模型项目的基础资源,尤其是那些在开源社区中的项目。该数据集的结构使研究人员能够研究不同类型数据对模型性能的影响,从而推动了机器学习和人工智能领域的进步。
组成与子数据集
The Pile整合了22个不同的子数据集,每个子数据集都经过精心挑选,以覆盖英语文本的不同领域和风格。这些包括Books3(一个书籍集合)、OpenSubtitles(包含电影和电视字幕)以及arXiv(提供科学论文)。其他组成部分包括PubMed摘要、美国法律意见和GitHub代码等。这种多样性旨在提高基于其训练的模型的泛化能力,使它们能够处理从技术问答到创意写作的各种任务。
包含来自GitHub的代码和来自arXiv的学术论文,使得The Pile特别适用于训练能够辅助编程和科学研究的模型。该数据集的创建者EleutherAI(一个非营利性AI研究组织)旨在使高质量训练数据的获取民主化,而这些数据此前仅限于像OpenAI和Google DeepMind这样的大型企业。
版权争议
围绕The Pile使用的版权纠纷在2023年升级。Books3部分包含从盗版网站Bibliotik汇编的受版权保护的材料。2023年7月,丹麦反盗版组织版权联盟通过DMCA通知将Books3移除。在2024年三位作者提起集体诉讼之前,Books3已从The Pile中移除,但原始数据集的副本仍在网络上可获取。到2024年,The Pile也从其原始网站被撤下,不过仍可通过其他文件共享服务访问。
另一个子数据集OpenSubtitles,因使用纪录片、电影、电视和在线视频中的受版权保护作品而引发争议。数万个YouTube视频的字幕被直接从YouTube抓取并纳入The Pile,而YouTube认为这违反了其服务条款。这些问题凸显了使用网络抓取数据训练神经网络和变换器模型所面临的法律和伦理挑战。
Common Pile v0.1
2025年6月,EleutherAI与Poolside、Hugging Face、美国国会图书馆以及来自14个机构的20多名研究人员合作(包括多伦多大学、麻省理工学院、卡内基梅隆大学、向量研究所和艾伦人工智能研究所),发布了Common Pile v0.1。该训练数据集仅包含其许可允许用于训练AI模型的作品。其目的是展示在尊重版权的同时进行合乎伦理的AI系统训练的可能性。
创建者发现,收集数据非常耗时,因为无法完全自动化,需要人工验证和标注每一条条目。尽管如此,由此产生的模型取得了超出预期的结果,但仍无法与前沿模型相媲美。创建者将Common Pile生成的结果与Llama 2进行了比较,后者是一个在Common Pile创建前两年发布的模型。由于底层训练数据的版权问题较少,该模型可能为使用其输出的用户带来较低的法律风险。
影响与遗产
The Pile通过提供大型且易于访问的深度学习模型训练数据集,显著影响了开源AI研究的格局。它的发布使较小的研究团体和独立开发者能够尝试大规模训练,而这一领域此前由科技巨头主导。该数据集还引发了关于AI中数据来源和版权的讨论,催生了像Common Pile这样优先考虑合乎伦理来源的倡议。
截至2024年,尽管面临法律挑战,The Pile和Common Crawl仍是许多AI模型的主要训练数据集。向像Common Pile这样更精心策划的数据集的转变,反映了行业向负责任AI发展的更广泛趋势,即在创新与法律和伦理考量之间取得平衡。The Pile的遗产不仅在于其技术贡献,还在于推动了人们重新评估生成式AI领域中训练数据的收集和使用方式。