《纽约时报》诉OpenAI案

译自英文

NYT诉OpenAI案是《纽约时报》于2023年12月对OpenAI和微软提起的版权侵权诉讼,指控其未经授权使用该报文章来训练大型语言模型。此案引发了关于合理使用和生成式AI的关键法律问题。

《纽约时报》公司于2023年12月27日在美国纽约南区联邦地区法院对OpenAI和微软提起诉讼。诉状指控被告未经许可使用数百万篇受版权保护的新闻文章来训练其大型语言模型,并且由此产生的系统与该报自身内容形成竞争。此案是关于生成式AI与版权法交汇的最受关注的法律斗争之一,对整个人工智能行业具有影响。

该诉讼的核心主张是直接和间接版权侵权,以及违反《数字千年版权法》的行为。《纽约时报》寻求法定赔偿、禁令救济,以及销毁任何纳入其作品的模型和训练数据集。OpenAI和微软已提出驳回动议,辩称其对文章的使用构成美国版权法下的合理使用,截至2025年初,这一抗辩尚未在法庭上得到完全解决。

背景与当事方

《纽约时报》创立于1851年,是美国最大且最具影响力的报纸之一,到2023年数字订阅用户超过1000万。其商业模式严重依赖独家报道和付费墙内容。OpenAI成立于2015年,是领先的AI研究组织,开发了GPT系列模型,包括GPT-3和GPT-4,这些模型为ChatGPT等产品提供支持。微软是OpenAI的主要投资者,据报道承诺投资130亿美元,通过Azure提供云基础设施,并将OpenAI的模型整合到其必应搜索引擎和Office生产力套件中。

诉状列出了超过100个具体示例,其中ChatGPT和Bing Chat据称几乎逐字复制了《纽约时报》的文章,通常绕过付费墙,且未注明出处或获得许可。《纽约时报》辩称,这削弱了其将新闻货币化的能力,因为用户无需订阅即可从AI系统获取相同信息。

法律主张与指控

主要主张是版权侵权,声称被告在训练其模型期间复制、再现和传播了《纽约时报》的文章。诉状详细描述了训练过程涉及摄取从互联网抓取的海量文本语料库,其中包括数百万篇《纽约时报》文章。《纽约时报》进一步声称,这些模型可以生成与其文章实质性相似的输出,有时包含完全相同的句子或段落。

该诉讼还指控间接侵权,声称OpenAI和微软从其用户的侵权行为中直接获利,这些用户提示模型复制受版权保护的内容。此外,《纽约时报》根据《数字千年版权法》提出主张,认为被告在训练过程中删除或更改了版权管理信息,例如署名和版权声明。

抗辩论点

OpenAI和微软于2024年2月提出驳回动议,辩称该诉讼基于推测性主张,并且将受版权保护的作品用于训练是变革性的合理使用。他们声称,这些模型并不取代原始文章的市场,而是作为信息综合的新工具。被告还指出,《纽约时报》的文章在互联网上公开可访问,并且训练过程涉及统计模式而非直接复制。

在提交的文件中,OpenAI强调了其在提供署名和允许出版商选择退出训练方面的努力,但《纽约时报》辩称这些措施不足,并且是在侵权发生后才实施的。被告还指出,《纽约时报》本身在各种目的上使用AI工具,暗示对该技术有一定程度的接受。

行业背景与相关案例

该诉讼是涉及AI公司的更广泛版权纠纷浪潮的一部分。2023年,包括莎拉·西尔弗曼和乔治·R·R·马丁在内的作者对OpenAI和其他公司提起了集体诉讼,而视觉艺术家则起诉了Stability AI和Midjourney。Getty Images在英国和美国对Stability AI提起了单独诉讼。这些案例共同涉及关于在受版权保护的数据上进行训练是否构成合理使用,以及AI生成的输出是否可能侵犯现有作品的问题。

《纽约时报》案件的结果可能为法院如何解释机器学习背景下的合理使用设定先例。法律学者指出,在Authors Guild诉Google等案例中确立的变革性使用原则可能是抗辩的核心。然而,OpenAI产品的商业性质以及对《纽约时报》的潜在市场损害使此案区别于早期先例。

训练数据的技术方面

大型语言模型的训练涉及从多种来源(包括书籍、网站和新闻文章)输入数十亿个单词。OpenAI的GPT-3于2020年发布,其训练数据集名为Common Crawl,包含PB级的网页。 《纽约时报》声称其文章未经授权被纳入该数据集及后续数据集。技术过程涉及使用变换器多头注意力等技术将文本转换为数值表示,使模型能够学习模式并生成连贯的响应。

OpenAI已承认其训练数据包括公开可用的网络内容,但未披露其数据集的完整构成。该公司已实施过滤器以减少逐字复制受版权保护文本的可能性,但《纽约时报》的诉状提供了这些过滤器失效的示例。此案引发了关于更透明数据来源以及AI公司与内容创作者之间许可协议可能性的讨论。

程序历史与现状

在初始提交后,法院将该案与其他针对OpenAI的相关版权诉讼合并进行审前程序,但《纽约时报》的案件仍保持独立。2024年3月,法官部分驳回了被告的驳回动议,允许核心版权主张继续进行,同时驳回了部分次要主张。截至2025年初,双方正在进行证据开示,《纽约时报》寻求获取OpenAI的训练数据和内部通信。

一个关键进展发生在2024年11月,当时OpenAI对《纽约时报》提出反诉,声称该报聘请承包商操纵ChatGPT以复制受版权保护的材料,违反了平台的服务条款。《纽约时报》否认了这些指控,称其为对核心问题的干扰。该案定于2025年底开庭审理,尽管鉴于双方的高风险,和解仍有可能。

对新闻业和AI的影响

该诉讼对新闻行业具有重大影响,该行业一直在努力适应数字经济。许多出版商已与AI公司签订许可协议,例如OpenAI与Axel Springer、美联社和新闻集团之间的交易。然而,《纽约时报》选择了诉讼,认为仅靠许可并不能解决未经授权使用的根本危害。此案可能决定AI公司是否必须为其产品所依赖的数据付费,从而可能重塑新闻业和AI开发的经济格局。

对于AI行业而言,不利的裁决可能迫使公司彻底改革其训练实践,可能限制数据集的规模并增加成本。相反,有利于OpenAI的裁决可能确立广泛的合理使用保护,鼓励进一步创新,但引发内容创作者的担忧。此案受到MIT CSAIL斯坦福AI实验室等机构研究人员的密切关注,他们研究AI的法律和伦理维度。

公众与学界反应

公众对此诉讼的看法存在分歧。记者和媒体倡导者普遍支持《纽约时报》,视其为对知识产权和高质量新闻可持续性的捍卫。科技爱好者和一些AI研究人员认为,限制性的版权裁决可能阻碍进步,并指出利用现有作品创造新知识的悠久历史。法律专家指出,鉴于所涉问题的新颖性和重要性,此案最终可能上诉至最高法院。

学者们还就AI背景下的合理使用概念进行了辩论,一些人提出平衡创新与创作者权利的新框架。此案推动了学术会议和论文的开展,包括分析神经网络如何记忆训练数据以及复制发生的条件。这些研究可能为司法判决和未来立法提供信息。

潜在结果与未来方向

存在几种可能的结果。法院可能裁定在受版权保护的作品上进行训练是合理使用,这可能导致更多许可谈判但非强制性付费。或者,法院可能认定侵权,要求OpenAI支付赔偿并可能销毁其模型,这将是前所未有的且具有破坏性。中间立场可能涉及允许训练但要求对逐字复制采取更强保障的裁决,或强制实施许可制度。

在法庭之外,此案推动了立法提案,例如《AI基础模型透明度法案》,该法案将要求公司披露训练数据来源。欧盟的《AI法案》于2024年通过,包含关于训练数据版权合规的条款。这些监管努力可能提供一个框架,减少逐案诉讼的需求。因此,《纽约时报》诉OpenAI案是一个里程碑式的案件,将在未来多年影响社会如何平衡AI的益处与创作者的权利。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:copyright-infringement·generative-ai·legal-case·journalism
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史