Silverman诉OpenAI案是一起于2023年7月在美国加利福尼亚北区联邦地区法院提起的联邦诉讼。原告为作家莎拉·西尔弗曼、理查德·卡德雷和克里斯托弗·戈尔登,他们指控OpenAI(大型语言模型ChatGPT的开发者)未经许可将其书籍用作训练数据,侵犯了其版权。该案成为首批针对生成式人工智能系统在受版权保护文本上进行训练这一做法的高调法律挑战之一,引发了关于合理使用、训练数据集透明度以及AI公司对与受保护作品相似的输出所应承担责任的问题。
该诉讼于2023年7月7日提起,随后与类似诉讼合并审理。原告寻求法定损害赔偿、禁令救济,并要求法院宣告OpenAI对其作品的使用构成版权侵权。他们还指控OpenAI违反了《数字千年版权法》(DMCA)并构成不当得利。该案引起广泛关注,因为它检验了允许未经许可有限使用受版权材料的“合理使用”原则,是否适用于为机器学习目的而大规模摄取书籍的行为。
背景与法律语境
生成式AI系统(尤其是像ChatGPT这样的大型语言模型)的兴起,依赖于通常包含数百万本书籍、文章和网页的训练数据集。OpenAI的训练过程涉及抓取公开可用的文本(包括受版权保护的作品),以教会模型预测和生成类似人类的文本。原告认为,这种使用并非变革性的,而是一种未经授权的复制形式,剥夺了作者的许可收入和对其创作的控制权。
该案是针对AI公司更广泛诉讼浪潮的一部分。其他作家,包括约翰·格里森、乔治·R·R·马丁和朱迪·皮考特,也对OpenAI及其他开发者提起了类似诉讼。Silverman诉OpenAI案的结果被视为法院将如何解释AI训练背景下合理使用的风向标。
原告的主张
西尔弗曼、卡德雷和戈尔登指控OpenAI完整复制了他们的书籍以创建训练数据集,然后用该数据集训练ChatGPT。他们认为,这种复制不受合理使用保护,因为它是商业性的、非变革性的,并且损害了他们作品的市场。他们还声称,ChatGPT能够生成其书籍的摘要或摘录,这表明模型已记忆了文本的实质性部分。
原告进一步指控OpenAI在数字化过程中移除了书籍中的版权管理信息(如标题页和版权声明),违反了DMCA。他们寻求直接侵权和间接侵权的损害赔偿,以及不当得利的赔偿。
OpenAI的辩护
OpenAI动议驳回诉讼,辩称在训练中使用受版权作品属于合理使用。该公司主张,训练数据用于创建统计模式,而非复制表达性内容,且由此产生的模型不与原作竞争。OpenAI还辩称,原告缺乏诉讼资格,因为他们未在美国版权局注册其版权,而这是提起侵权诉讼的前提条件。
在其驳回动议中,OpenAI强调,原告未指控ChatGPT生成了其书籍的侵权副本,仅指控训练过程涉及复制。该公司认为,这种中间复制是变革性的,并且在先前涉及搜索引擎和文本挖掘的案件中已得到支持。
法院裁决
2024年2月12日,加利福尼亚北区联邦地区法院法官阿拉塞利·马丁内斯-奥尔金部分批准、部分驳回了OpenAI的驳回动议。法院驳回了原告的直接版权侵权主张,认为他们未能合理指控ChatGPT的输出侵犯了其作品。法院的理由是,原告未证明模型生成了其书籍的复制品或衍生作品,仅证明其能生成摘要或摘录,法院认为这不足以构成侵权。
然而,法院允许原告依据加州法律提出的不正当竞争主张以及过失干扰预期经济利益的主张继续审理。法院还准许原告修改其诉状,以解决其版权主张中的不足。DMCA主张被驳回且不得再诉,因为法院认为原告未能充分指控OpenAI移除了版权管理信息。
该裁决被视为一个混合结果。虽然直接侵权主张被驳回,但案件在其他理由上继续审理,且原告获得了重新起诉的机会。该决定还凸显了当涉嫌复制发生在训练过程而非模型输出中时,证明侵权的难度。
后续发展
在驳回后,原告于2024年3月提交了修改后的诉状,增加了关于ChatGPT复制受版权文本能力的更具体指控。他们还寻求认证一个由作品被用于训练的作家组成的集体。OpenAI再次动议驳回,法院于2024年10月举行了听证会。截至2025年初,该案仍在审理中,尚未对案情作出最终裁决。
该案是更大法律格局的一部分。2024年,美国版权局启动了一项关于AI版权影响的研究,国会也举行了相关听证会。其他法院也在处理类似问题,包括2023年12月提起的《纽约时报》诉OpenAI案。
对AI行业的影响
Silverman诉OpenAI案对人工智能行业产生了重大影响。该案促使AI公司重新考虑其数据来源做法。一些公司(包括OpenAI)开始为版权所有者提供退出机制,并与出版商签订许可协议。该案还影响了关于训练数据集透明度需求以及法定许可计划可能性的讨论。
该诉讼凸显了创新与知识产权之间的紧张关系。虽然AI开发者主张广泛获取文本对于创建有用模型至关重要,但作者和出版商认为他们应获得补偿和控制。该案及类似案件的结果可能塑造机器学习和生成式AI系统商业可行性的未来。
法律与伦理考量
该案提出了几个法律和伦理问题。一个关键问题是,“合理使用”原则(传统上适用于批评、评论或研究等目的的有限复制)是否应扩展到为AI训练而整体摄取受版权作品。法院此前在Authors Guild诉Google案等案件中支持了文本挖掘作为合理使用,但那些案件涉及搜索索引,而非能生成表达性内容的生成模型。
另一个问题是神经网络在创作衍生作品中的作用。原告认为,ChatGPT以作者风格生成文本或生成捕捉书籍精髓的摘要的能力,可能构成衍生作品。OpenAI反驳称,模型的输出与原作不构成实质性相似,且模型不存储文本副本。
在伦理层面,该案强调了在使用创作者作品时需要同意和补偿。它还引发了对AI公司权力集中的担忧,这些公司可以在没有有效监督的情况下获取大量数据。该案促成了关于技术开发者与内容创作者之间社会契约的更广泛辩论。
结论
Silverman诉OpenAI案在快速发展的AI法律领域中仍是一个里程碑式案件。其裁决为法院可能如何处理针对AI公司的版权主张提供了早期指导,但许多问题仍未解决。该案可能会被上诉,其最终结果可能对该公司和更广泛的深度学习社区产生深远影响。截至2025年初,该诉讼仍在进行中,AI与版权的法律格局也在持续发展。