Kadrey诉Meta Platforms案

译自英文

Kadrey诉Meta Platforms是一起由作者针对Meta提起的版权侵权诉讼,指控其在训练LLaMA大型语言模型时使用了盗版书籍,未经授权复制和分发受版权保护的作品。

Kadrey诉Meta Platforms案是一起于2023年在美国加利福尼亚北区联邦地区法院提起的民事诉讼。原告为包括理查德·卡德雷、莎拉·西尔弗曼和克里斯托弗·戈尔登在内的一组作者,他们指控Meta Platforms, Inc.未经授权使用其书籍的盗版副本训练其LLaMA(大型语言模型Meta AI)系列大型语言模型,侵犯了其版权。该案是针对生成式人工智能系统开发者的一系列更广泛诉讼的一部分,引发了关于未经明确许可在受版权保护的文本上训练模型是否合法的问题。

该诉讼的核心是Meta使用了一个名为“Books3”的数据集,其中包含超过195,000本书籍,其中许多来自影子图书馆Bibliotik。原告声称,Meta下载并使用该数据集训练LLaMA模型(包括LLaMA 1和LLaMA 2),未获得许可或向作者支付补偿。该案已成为检验版权法(尤其是合理使用原则)如何适用于机器学习的关键案例。

背景与当事人

首席原告理查德·卡德雷是美国作家,以“桑德曼·斯利姆”都市奇幻系列闻名。喜剧演员兼作家莎拉·西尔弗曼和恐怖奇幻作家克里斯托弗·戈尔登也加入了诉讼。诉状于2023年7月7日提交,随后与类似诉讼(包括作家保罗·特伦布莱提起的案件)合并。被告为Meta Platforms, Inc.及其子公司Meta AI,后者开发了LLaMA模型。

原告由约瑟夫·萨维里律师事务所代理,该律所已对多家AI公司提起多起诉讼。Meta由吉布森、邓恩和克拉彻律师事务所的律师代理。该案由杰奎琳·斯科特·科利法官审理,她也负责其他AI版权纠纷。

版权侵权指控

核心指控是Meta在训练过程中未经授权复制和分发受版权保护的书籍。原告认为,LLaMA模型在被提示时可以生成与其书籍段落非常相似的文本,这表明模型已记忆并能复制受版权保护的材料。他们还声称,Meta使用由AI平台The Eye上的用户创建的Books3数据集是明知故犯的侵权行为,因为该数据集被广泛知晓包含盗版书籍。

诉状引用了具体示例,例如模型生成的文本与卡德雷小说《桑德曼·斯利姆》和西尔弗曼回忆录《尿床者》的摘录匹配。原告声称,这种复制构成直接和替代侵权,以及帮助侵权,因为Meta促成了侵权数据集的创建。

Meta的辩护与合理使用论点

Meta的主要辩护是,在受版权保护的文本上训练AI模型构成美国版权法第107条下的合理使用。该公司认为,这种使用具有变革性,因为模型不会完整复制书籍,而是学习统计模式和语言结构。Meta还辩称,训练过程类似于人类阅读书籍并从中学习,且模型不会在市场上与原作品竞争。

Meta已提出驳回案件的动议,认为原告未能陈述诉讼请求,因为他们未证明模型输出了受版权作品的实质性部分。该公司还指出,LLaMA模型是开源的,且训练数据未公开分发,这限制了市场损害。

程序历史

在2023年7月初步提交后,法院将几起相关案件合并为牵头案件编号3:23-cv-03417。2023年11月,科利法官驳回了Meta关于直接侵权索赔的驳回动议,但允许原告修改关于替代和帮助侵权的诉状。原告于2023年12月提交了修改后的诉状,增加了更具体的指控。

2024年2月,Meta对修改后的诉状提出新的驳回动议,该动议于2024年5月被部分批准。法院驳回了帮助侵权索赔,但允许直接侵权和替代责任索赔继续审理。证据发现阶段正在进行中,双方正在寻求Meta的内部通信和训练数据文档。

AI版权诉讼的更广泛背景

该案是针对AI开发者的几起高调诉讼之一。类似诉讼已由作者对OpenAI和Anthropic提起,包括由喜剧演员莎拉·西尔弗曼领导的集体诉讼(部分被驳回),以及作者对谷歌就其Gemini模型提起的诉讼。这些案件的结果预计将塑造生成式AI的法律格局,可能影响公司如何收集训练数据以及是否需要许可受版权作品。

美国版权局也在研究该问题,并于2023年发布了一份调查通知,征求公众对AI与版权交叉问题的意见。该局尚未发布最终指南,但其报告强调了需要平衡保护作者和允许技术创新。

关键法律问题

该案提出了几个未解决的法律问题。首先,训练期间复制受版权作品是否构成法律意义上的“复制”,即使这些复制是临时的且未直接分发。其次,AI模型的变革性是否有利于合理使用,因为模型可以生成新文本但也能记忆和复制段落。第三,对作者的市场损害是否显著,特别是如果AI模型能生成替代原书的文本。

法院历史上对合理使用适用四因素测试,考虑使用的目的和性质、受版权作品的性质、使用量以及对市场的影响。在相关案件Authors Guild诉Google(2015年)中,第二巡回法院认定谷歌为搜索目的数字化书籍是合理使用,但该案涉及有限片段展示。Kadrey案涉及更广泛的复制,可能导致不同结果。

潜在结果与影响

如果原告胜诉,Meta可能被要求支付每部作品最高150,000美元的法定赔偿,考虑到数据集中的书籍数量,这可能达到数十亿美元。该公司还可能被命令销毁LLaMA模型或使用许可数据重新训练。这样的裁决可能对AI开发产生寒蝉效应,迫使公司为所有训练数据获得许可,这将昂贵且耗时。

相反,如果Meta在合理使用上胜诉,将确立一个广泛先例,即AI训练受版权文本是允许的,可能加速大型语言模型的发展。这也可能影响其他待决案件,并鼓励更多公司使用抓取数据而不支付补偿。

当前状态与未来程序

截至2024年底,该案处于证据发现阶段。双方正在交换文件并进行证词采集。审判日期尚未确定,但法律分析师预计该案将在2025年进入即决判决动议阶段。法院还可能决定认证集体诉讼,这将扩大原告群体,包括Books3数据集中所有作品的作者。

该案吸引了各组织的法庭之友简报,包括支持原告的作者协会,以及电子前沿基金会(该基金会在类似案件中提交了支持合理使用的简报)。无论地区法院的裁决如何,结果都可能被上诉,可能最终到达最高法院。

对AI行业的意义

Kadrey案是AI行业的晴雨表。它测试了可接受训练数据的界限,以及LLaMA等模型的开源性质是否改变法律分析。该案还凸显了创新与知识产权之间的紧张关系,这一辩论是Artificial intelligenceGenerative AI未来的核心。

OpenAIAnthropic这样的公司正密切关注诉讼进展,因为它们面临类似诉讼。结果可能影响它们如何与出版商和作者谈判许可协议,以及是否投资于避免受版权材料的替代训练方法。该案还对Machine learning研究有影响,因为许多学术数据集包含受版权文本。

与此同时,Meta继续发布新版本的LLaMA,包括LLaMA 3,该版本在可能包含额外受版权作品的更大数据集上训练。该公司表示致力于尊重知识产权,但未披露其训练数据的完整内容,理由是商业秘密。

结论

Kadrey诉Meta Platforms案是一个里程碑案件,将有助于定义AI训练的法律边界。该决定将对作者、技术公司和公众产生深远影响。虽然案件仍在进行中,其结果很可能设定一个先例,影响版权法如何适用于Large language model和其他Neural network系统。法院的裁决将受到法律学者、政策制定者和行业利益相关者的密切关注,因为它涉及保护创意作品与促进技术进步之间平衡的基本问题。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:copyright-law·artificial-intelligence·litigation·meta-platforms
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史