训练数据是用于教导机器学习模型的示例集合,模型在训练过程中从中学习统计模式。对于现代大型语言模型,训练数据通常包括从公共网络抓取的海量文本、许可数据集、书籍、代码仓库,以及越来越多由其他模型生成的合成数据。数据的规模、多样性和质量,连同模型规模和计算量,是模型能力的主要驱动因素之一,正如缩放定律所描述的那样。
从大约2023年起,训练数据的构成和来源成为法律、伦理和商业争议的重要焦点,作者、艺术家、出版商及其他权利持有者对AI开发者使用受版权保护的材料提起诉讼,同时,相较于不断增长的模型数据需求,易于抓取的高质量文本日益稀缺。
来源与构成
大型语言模型训练语料通常来自多种来源:广泛的网络爬虫,如Common Crawl;经过筛选和过滤的网络子集,如支持GPT-3及其后续模型的数据集;数字化书籍;维基百科及其他参考网站;来自GitHub等存储库的编程代码;学术论文;以及通过商业交易获得版权的素材,涉及出版商、股票媒体公司及其他权利持有人,这种做法自2023年以来各大实验室大幅增加,取代了未经许可的爬取。数据通常进行去重处理,过滤质量和有害内容,并越来越多地对代码、教科书和推理密集型文本等高价值类别进行加权或过采样,反映研究显示,数据质量和组合在重要性上不亚于原始数量。
数据墙
截至2024年和2025年,多位研究人员和实验室负责人公开讨论了即将到来的数据墙:公共互联网上高质量且易获取的人类生成文本的供应有限,估计约为数十万亿个标记,而最大的模型训练已接近或超过该上限。应对方案包括增加合成数据的使用,获取此前无法通过爬取方式获得的许可数据,例如归档、私有论坛和视频字幕,采用多模态训练从图像、音频和视频而非仅文本中提取信号,以及增强架构或算法方法,包括测试时计算的扩展,旨在无需按比例增加预训练数据而提升能力。
法律与伦理争议
训练数据的实践是2023年以来爆发的AI版权诉讼的核心。这些诉讼包括《纽约时报》、多位作者、视觉艺术家和音乐唱片公司针对OpenAI、Meta、Stability AI和Midjourney等公司提起的案件。普遍声称受版权保护的作品未经准许或补偿即被用于训练模型,而被告普遍认为训练构成合理使用或属于类似原则。按照AI与版权法律,这应属于合理使用或同等原则。此外,研究人员和记者记录了一些训练数据集包含未经同意的个人数据的案例,至少一个涉及LAION图像模型数据集的影响,发现需紧急处理的违规所致,这引发了对数据集筛选和公开透明做法的更广泛关注,而欧盟AI法案等监管者日益要求对此进行记录。