Authors Guild v. OpenAI (2024)

译自英文

Authors Guild v. OpenAI 是一起2023-2024年的版权侵权诉讼,由作者针对OpenAI提起,指控其在大语言模型训练中使用其作品,期间有修正诉状及对合理使用抗辩的部分裁决。

Authors Guild诉OpenAI是一起于2023年在美国纽约南区联邦地区法院提起的版权侵权诉讼。原告是由Authors Guild代表的一组作者,他们指控OpenAI未经许可使用其受版权保护的书籍来训练包括GPT-3和GPT-4在内的大型语言模型。该案是针对生成式AI公司行为的几起高调法律挑战之一,引发了关于合理使用原则如何适用于机器学习的疑问。

该诉讼于2023年9月19日由Authors Guild及十七位个人作者提起,其中包括David Baldacci、John Grisham和George R.R. Martin。原告声称,OpenAI的训练过程涉及将其作品复制到数据集中,然后用这些数据集训练模型,构成直接和间接版权侵权。他们还指控OpenAI从这些未经授权的复制中获利,违反了1976年《版权法》规定的专有权。

初始诉状与法律论点

原始诉状寻求法定损害赔偿和禁令救济,认为OpenAI对受版权保护文本的使用不具有转换性,因为模型复制并利用了作品的表达性内容。原告强调,OpenAI的模型能够生成与原著风格和内容高度相似的文本,从而损害了作者作品的市场。

OpenAI于2024年初提出驳回动议,声称在训练中使用受版权保护的材料受合理使用原则保护。该公司辩称,训练过程具有转换性,因为它创造了新的、非表达性的输出,且模型并不替代原著。OpenAI还主张,原告未能按照诉状标准具体指控侵权实例。

修正诉状与新指控

2024年3月18日,原告提交了修正诉状,增加了更多作者并细化了指控。修正诉状包括模型生成与原告书籍段落高度释义或复制的具体示例,原告认为这证明了直接侵权。修正诉状还引入了不当得利和不正当竞争的指控,但在后续文件中这些指控被撤回。

修正诉状增加了其他被告,包括对OpenAI进行了大量投资并通过Microsoft Azure提供云基础设施的微软。原告声称,微软因从模型训练和部署中获利而应承担连带责任。微软提出了自己的驳回动议,辩称其未直接参与训练过程。

驳回动议的裁定

2024年7月9日,法官Sidney H. Stein对驳回动议作出裁定。法院驳回了原告的多项指控,包括间接侵权和不当得利,但允许核心的直接侵权指控继续审理。法院认为,原告已充分指控OpenAI复制了其作品,而合理使用抗辩更适合在即决判决阶段而非驳回动议中处理。

该裁定还涉及法定损害赔偿问题,指出原告可以就在美国版权局注册的作品寻求此类赔偿。法院驳回了对微软的指控,认为原告未充分证明微软有权并能够监督侵权活动,这是间接责任的要求。

合理使用与转换性使用之争

本案的核心法律问题是,在受版权保护文本上训练Large language model是否构成合理使用。合理使用原则编入《版权法》第107条,考虑四个因素:使用的目的和性质、受版权作品的性质、使用部分的数量和实质性,以及对作品潜在市场的影响。

OpenAI辩称,该使用具有转换性,因为模型不复制原著,而是从中学习统计模式。公司指出,模型旨在生成新文本,而非作为现有作品的存储库。原告反驳称,复制不具有转换性,因为模型被训练来模仿原著风格和内容,且OpenAI运营的商业性质不利于合理使用认定。

证据开示与证据

在2024年7月裁定后,案件进入证据开示阶段。原告寻求获取OpenAI的训练数据及关于使用受版权材料的内部通信。OpenAI以商业秘密保护和提供大量数据的负担为由,抵制了部分请求。

2024年10月,法院命令OpenAI提供其训练数据集中使用的书籍清单,但允许公司编辑某些专有信息。原告还寻求对OpenAI关键高管(包括CEO Sam Altman)进行取证,但法院尚未对这些请求作出裁定。

相关案件与行业影响

Authors Guild案是针对AI公司更广泛诉讼浪潮的一部分。其他作者也提起了类似诉讼,包括由Sarah Silverman领导的集体诉讼,以及《纽约时报》等新闻机构提起的诉讼。这些案件受到Artificial intelligence行业的密切关注,因为其结果可能为AI模型的训练和部署设定先例。

该案也引起了政策制定者的关注。2024年,美国版权局发布了一份关于AI和版权的报告,建议国会澄清合理使用在训练数据中的适用范围。报告指出,现行法律存在模糊性,可能需要立法行动来为创作者和AI开发者提供确定性。

当前状态与后续步骤

截至2024年底,案件处于证据开示阶段,双方正在为潜在的即决判决动议做准备。法院已安排2025年1月的状态会议,讨论证据开示进展和任何剩余动议。审判日期尚未确定,但法律专家预计,鉴于全面审判的复杂性和成本,案件将通过即决判决或和解解决。

Authors Guild诉OpenAI的结果可能对Generative AI行业产生重大影响。如果法院认定在受版权作品上训练不构成合理使用,AI公司可能需要为训练数据获取许可,这可能增加成本并减缓创新。相反,有利于OpenAI的裁决可能为AI开发中大规模网络抓取的持续使用提供法律基础。

更广泛背景与学术评论

法律学者对该案持有不同观点。一些人认为,合理使用原则应灵活解释以适应新技术,引用版权法适应复印机和录像机等创新的历史。另一些人则认为,AI训练中的复制规模前所未有,对作者的经济损害是真实的,特别是对于那些作品被用于训练能生成竞争性内容的模型的作者。

该案还引发了关于AI时代创造力和作者身份本质的辩论。一些评论者认为,该诉讼反映了对人类作者在机器能生成与人类写作难以区分的文本的世界中角色的更广泛焦虑。另一些人指出,原告并非反对AI本身,而是反对其作品被无偿使用。

潜在结果与先例

如果案件进入实质审理,法院将需要将四因素合理使用测试应用于AI训练的具体事实。法院可能考虑模型输出是否具有足够的转换性、所用作品主要是事实性还是创造性,以及训练过程是否复制了超出必要的内容。市场损害因素可能成为核心,因为原告将辩称模型减少了对他们书籍的需求,而OpenAI将辩称模型不与原著竞争。

有利于原告的裁决可能导致AI公司需要为训练数据获取许可,可能为受版权作品创造新市场。有利于OpenAI的裁决可能强化AI训练是合理使用的观点,但也可能促使立法行动来解决创作者关切。无论哪种方式,该案很可能被上诉,最终解决可能由最高法院作出。

结论

Authors Guild诉OpenAI是一起具有里程碑意义的案件,将塑造AI和版权的法律格局。修正诉状和裁定已澄清了指控范围,但合理使用的核心问题仍未解决。随着案件推进,它将继续吸引法律、技术和创意界的关注,其结果将对Machine learning的发展和知识产权保护产生持久影响。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:copyright-law·ai-litigation·fair-use·openai
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史