作者针对OpenAI的集体诉讼

译自英文

美国小说作家针对OpenAI在训练数据使用方面提起的合并版权诉讼,指控其在大语言模型中未经授权复制作品。这些案件于2024年在纽约南区合并审理,并就合理使用及部分诉讼请求的驳回作出了关键裁决。

作者针对OpenAI的集体诉讼是一组由小说作家在美国联邦法院提起的合并诉讼,被告为OpenAI,即ChatGPT等产品所依托的大语言模型的开发者。原告指控OpenAI未经许可复制其受版权保护的书籍以训练模型,构成直接和间接版权侵权,且该公司从未经授权的使用中获利。该诉讼已合并至美国纽约南区联邦地区法院,已成为检验版权法如何适用于生成式AI系统训练的核心测试案例。

这些案件是在2022年底ChatGPT商业发布以及OpenAI模型系列随后扩展的背景下出现的。作者们主张,其作品被纳入用于训练的大规模文本语料库,既未获得授权,也未获得补偿,且模型能够再现或高度近似地改写其书籍中的段落。OpenAI回应称,其对受版权保护材料的使用属于合理使用原则范畴,并援引了机器学习的变革性以及模型所学到的非表达性统计模式作为依据。

程序历史与合并

首起重要的作者诉讼于2023年6月由喜剧演员兼作家莎拉·西尔弗曼与作家理查德·卡德雷和克里斯托弗·戈尔登在加利福尼亚北区提起。该案即Silverman v. OpenAI,指控OpenAI的训练数据包含盗版书籍库。2023年7月,作家保罗·特伦布莱和莫娜·阿瓦德由同一家律师事务所代理,在纽约南区对OpenAI及其合作伙伴微软提起了另一起集体诉讼。

2023年9月,司法小组关于多地区诉讼的小组将多起重叠的作者诉讼合并为一个单一程序,即In re OpenAI ChatGPT Litigation,由纽约南区法官杰德·S·拉科夫审理。合并后的诉讼包括了乔治·R·R·马丁、约翰·格里沙姆、朱迪·皮考特等作者的主张,这些作者后来陆续加入,尽管部分作者最初提起的独立诉讼后来也被并入主案。到2024年初,主要原告提交了合并修正诉状,增加了不当得利和过失索赔,并将OpenAI及其首席执行官萨姆·奥尔特曼列为被告。

核心法律主张

原告的主要主张是根据《美国法典》第17编第501条提出的直接版权侵权,认为OpenAI在训练和模型输出过程中复制并传播了其作品。他们还指控了替代责任和帮助侵权,声称OpenAI有权且有能力控制侵权活动并从中获利。诉状中引用了具体实例,即ChatGPT据称生成了受版权保护书籍的近乎逐字摘录,原告认为这表明模型存储并检索了表达性内容。

第二项主要主张涉及从训练数据中移除版权管理信息(CMI),如作者姓名和书名,这违反了《数字千年版权法》(DMCA)。原告认为,剥离CMI便利了侵权,并妨碍了作者行使其权利。OpenAI动议驳回该主张,认为DMCA条款要求具有诱导侵权的意图,而原告未能合理指控这一点。

关键裁决

2024年2月,拉科夫法官驳回了DMCA主张,认为原告未能充分指控OpenAI故意移除CMI以掩盖侵权。他允许核心版权主张继续审理,驳回了OpenAI关于这些主张被州法优先适用以及原告因未登记每部作品而缺乏诉讼资格的抗辩。

2024年11月,拉科夫法官就合理使用作出了关键裁决。他驳回了OpenAI驳回直接侵权主张的动议,认为合理使用抗辩无法在诉答阶段解决。法院强调,使用是否具有变革性,以及模型是否与原作竞争,均属于需要证据开示的事实问题。该裁决还指出,OpenAI自身的文件,包括关于高质量文本数据稀缺性的内部沟通,可能对使用的目的和性质具有证明意义。

然而,在同月的另一项裁决中,拉科夫法官驳回了不当得利和过失索赔,认为这些主张与版权主张重复,并受经济损失规则限制。他还删除了某些依赖投机性损害理论的指控,例如模型输出将减少图书销量的主张。

合理使用论点

OpenAI的合理使用抗辩基于四项法定因素:使用的目的和性质、受版权作品的性质、使用部分的数量和实质性,以及对潜在市场的影响。该公司辩称,训练神经网络是一种非表达性使用,因为模型学习的是统计模式而非复制特定表达。它援引了最高法院在Google v. Oracle(2021)中的判决,该判决认为为变革性目的复制代码属于合理使用,以及第二巡回法院在Authors Guild v. Google(2015)中的裁决,该裁决认定谷歌为搜索目的扫描书籍属于合理使用。

原告反驳称,OpenAI的使用具有商业性质,且模型生成的文本可能与原作竞争,损害授权复制品的市场。他们还认为,复制的规模,,来自数百万本书籍的数十亿词汇,,与谷歌图书案中的有限片段不可类比。法院2024年11月的裁决将这些争议留待审判解决,并指出需要证据开示来评估实际输出和经济影响。

相关诉讼与背景

作者案件是针对AI公司的更广泛版权诉讼浪潮的一部分。2023年,视觉艺术家对Stability AI、Midjourney和DeviantArt提起了集体诉讼,2024年,音乐出版商就歌词复制起诉了Anthropic。Anthropic案即Concord Music Group v. Anthropic,涉及关于训练数据和输出复制的类似主张。作者案件还与《纽约时报》于2023年12月对OpenAI和微软提起的诉讼相交织,后者指控模型逐字复制了新闻文章。

在作者诉讼中,法院已与《纽约时报》案协调证据开示,允许共享文件制作和专家证词。这种协调减缓了诉讼进程,法院将审判日期定在2025年底或2026年初。截至2025年初,双方正在进行事实开示,包括对OpenAI高管和技术人员的取证,以及训练数据元数据的交换。

对AI发展的影响

作者集体诉讼的结果可能对人工智能行业产生重大影响。如果裁决认定未经许可使用受版权作品进行训练不构成合理使用,将迫使AI开发者与出版商和作者谈判许可协议,可能增加成本并限制训练数据的多样性。相反,如果裁决支持OpenAI,则将确认当前训练实践的合法性,尽管可能无法解决输出复制的问题。

该案也引起了立法关注。2024年,数位美国参议员提出了要求训练数据透明度和对受版权作品实行法定许可制度的法案。作者诉讼在这些辩论中被引用,作为需要更明确规则的证据。在国际层面,欧盟于2024年通过的《人工智能法案》包含要求披露训练数据摘要的条款,但并未直接涉及版权责任。

当前状态与展望

截至2025年初,合并诉讼处于证据开示阶段。法院已驳回了集体认证动议,但原告表示将在事实开示后再次寻求认证。拉科夫法官已将审前会议安排在2025年年中,可能的审判在2026年。该案受到法律学者和行业观察人士的广泛关注,因为它可能为美国法院如何将合理使用适用于大规模机器学习确立先例。

OpenAI还在其他司法管辖区面临平行诉讼,包括加拿大的集体诉讼以及向美国版权局提出的投诉。该公司已开始与部分出版商签订许可协议,如阿克塞尔·施普林格和美联社,但尚未与个别小说作者达成协议。作者集体诉讼仍然是对OpenAI训练实践最全面的挑战,其解决结果很可能将塑造生成式AI和版权法的未来。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:copyright-law·openai·class-action·generative-ai
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史