《纽约时报》诉OpenAI诉讼案

译自英文

纽约时报于2023年12月对OpenAI和微软提起版权侵权诉讼,指控其未经授权使用受版权保护的文章来训练AI模型。该案寻求损害赔偿,并要求销毁侵权数据集。

《纽约时报》公司于2023年12月对OpenAI和微软提起诉讼,指控这两家公司未经许可使用数百万篇受版权保护的新闻文章来训练其大型语言模型。这份提交至美国纽约南区联邦地区法院的诉状称,OpenAI的ChatGPT和微软的Copilot产品在被提示时,会逐字或仅作极小改动地再现《纽约时报》的文章,从而削弱了该报将其新闻内容变现的能力。《纽约时报》寻求法定损害赔偿、禁止进一步使用其内容的禁令,以及销毁任何包含其文章的数据库。

这起诉讼是对生成式人工智能行业最引人注目的法律挑战之一,该行业严重依赖从网络抓取的文本进行训练。《纽约时报》辩称其内容未经许可被使用,而OpenAI和微软则主张其使用属于合理使用原则,该原则允许为评论或研究等目的对受版权保护的材料进行有限复制。此案受到广泛关注,因为其结果可能重塑人工智能公司获取训练数据的方式,以及它们是否必须为获取内容而向出版商付费。

背景与当事方

《纽约时报》创刊于1851年,是美国规模最大、最具影响力的报纸之一,截至2023年其数字订阅用户数已超过1000万。OpenAI成立于2015年,最初为非营利组织,后重组并设有营利性部门,开发了ChatGPT聊天机器人和底层的GPT系列模型。微软自2019年以来已向OpenAI投资超过130亿美元,并提供用于训练和部署OpenAI系统的Azure云基础设施。微软还将OpenAI的技术整合到其必应搜索引擎和Office生产力套件中。

这起诉讼将OpenAI和微软均列为被告,理由是微软深度参与财务和技术事务,应承担同等责任。《纽约时报》的法律团队由Susman Godfrey律师事务所牵头,在与OpenAI就潜在许可协议进行了数月谈判未果后,于2023年12月27日提交了诉状。

版权侵权指控

诉状详细列举了ChatGPT和微软的Copilot据称再现《纽约时报》文章的具体实例。例如,当被问及一篇关于铅中毒的2019年调查报道时,ChatGPT据称生成了该文章的近乎逐字摘录,包括标题和多个段落。《纽约时报》还提交证据表明,这些模型能够生成与其餐厅评论、产品推荐和新闻报道相匹配的文本,有时甚至不注明出处。

《纽约时报》辩称,这种再现超出了可接受的合理使用范围,因为它直接与该报自身的数字内容竞争。当用户向ChatGPT询问新闻摘要时,他们可能获得原本需要订阅《纽约时报》才能获取的信息,从而减少了该报网站的流量,并削弱了广告和订阅收入。诉状还指出,OpenAI的训练数据包括来自Common Crawl(一个存档网页的非营利组织)等来源的《纽约时报》文章,且未获得许可。

法律论点与合理使用抗辩

OpenAI和微软于2024年2月提交了驳回诉讼的动议,辩称《纽约时报》的主张基于“黑客攻击”ChatGPT,即使用异常提示来诱导生成受版权保护的文本,而非典型用户行为。他们援引了合理使用原则,该原则考虑的因素包括使用目的(转换性还是商业性)、受版权作品的性质、使用数量以及对市场的影响。OpenAI坚称,在公开可用文本上进行训练类似于人类阅读并从书籍中学习,且由此产生的模型并不存储原始文章的副本。

《纽约时报》反驳称,这种使用并非转换性的,因为模型旨在生成与原始文章竞争的文本,且OpenAI产品的商业性质不利于合理使用的认定。该报还指出“使用数量与实质性”因素,强调模型可以再现整篇文章,而不仅仅是简短摘录。法律学者指出,结果可能取决于法院是否将人工智能训练视为类似于Authors Guild诉Google案中谷歌对书籍数字化的合理使用,还是视为更直接的侵权。

人工智能版权诉讼的更广泛背景

《纽约时报》的诉讼是针对人工智能公司的一波版权诉讼浪潮的一部分。2023年,包括莎拉·西尔弗曼、克里斯托弗·戈尔登和理查德·卡德雷在内的作者起诉了OpenAI和Meta,指控其训练数据中使用了他们的书籍。Getty Images在英国和美国对Stability AI提起诉讼,指控其滥用照片。2023年12月,喜剧演员莎拉·西尔弗曼和其他原告修改了诉状,加入了ChatGPT再现受版权保护文本的具体实例。

这些案件引发了关于为人工智能训练进行网络抓取的合法性、合理使用对机器学习的适用性以及是否需要新的许可框架的问题。一些出版商,如美联社和Axel Springer,已与OpenAI签署了许可协议,而其他出版商,包括《纽约时报》,则选择了诉讼。《纽约时报》的诉讼因其规模之大和证据质量之高而引人注目,其中包括模型输出与原始文章的并排比较。

技术与经济影响

此案对人工智能行业具有重大影响。如果《纽约时报》胜诉,人工智能公司可能被要求为所有受版权保护的训练数据获取许可,这可能增加成本并减缓模型开发。相反,若法院支持OpenAI,则可能强化在公开文本上训练而无需补偿的做法,从而可能损害依赖订阅收入的新闻机构。

经济风险很高。《纽约时报》2023年报告的年收入约为25亿美元,其中数字订阅所占份额日益增长。该报已大力投资其自身的数字产品,包括游戏、烹饪和音频,并辩称人工智能生成的摘要削弱了这些投资。OpenAI在2024年初估值超过800亿美元,该公司表示愿意为内容付费,但否认《纽约时报》关于广泛侵权的指控。

程序历史与当前状态

在驳回动议提交后,法院允许案件继续审理,证据开示定于2024年年中开始。2024年4月,《纽约时报》提交了修正诉状,加入了新的侵权实例,包括ChatGPT再现该报Wirecutter产品评测板块文章的情况。OpenAI回应称,修正诉状仍未能证明模型以构成侵权的方式“记忆”文章。

2024年5月,法院部分驳回了OpenAI的驳回动议,允许核心版权索赔继续审理,同时驳回了与《数字千年版权法》相关的一些附带索赔。案件目前处于证据开示阶段,双方正在交换文件和证词。审判日期尚未确定,但法律专家预计此案将持续数年,并可能向更高法院上诉。

人工智能与出版行业的反应

这起诉讼在人工智能社区内引发了辩论。一些研究人员认为,在受版权保护的文本上进行训练对于构建强大的模型至关重要,而另一些人则主张更透明的数据来源。OpenAI首席执行官萨姆·奥尔特曼公开表示,公司愿意达成许可协议,并对其数据实践缺乏透明度表示遗憾。微软则基本保持沉默,在公开声明中交由OpenAI回应。

包括新闻媒体联盟在内的出版行业团体提交了支持《纽约时报》的法庭之友简报,认为人工智能公司正在搭记者工作的便车。相反,一些技术倡导团体警告称,对OpenAI的不利裁决可能阻碍创新,并让大型出版商对信息拥有过度控制权。此案还影响了立法讨论,一些立法者提议要求人工智能公司披露其训练数据来源的法律。

潜在结果与先例

如果《纽约时报》胜诉,法院可能命令OpenAI和微软为每件被侵权的作品支付最高15万美元的法定赔偿,鉴于据称使用的数百万篇文章,这可能总计达数十亿美元。法院还可能发布禁令,要求销毁训练数据集,这将迫使OpenAI在没有《纽约时报》内容的情况下重新训练其模型。这样的结果很可能引发其他出版商的类似诉讼浪潮。

如果OpenAI胜诉,此案将为人工智能训练确立广泛的合理使用先例,可能允许公司使用任何公开可用的文本而无需补偿。这可能加速人工智能发展,但也可能削弱新闻机构的财务可行性,这些机构已经面临印刷收入下降。一些观察者认为,更可能的结果是和解,即OpenAI同意向《纽约时报》支付许可费,以换取继续使用其内容。

对人工智能治理的意义

这起诉讼是围绕人工智能治理以及创新与知识产权之间平衡的更广泛辩论中的一个里程碑。它提出了根本性问题,即人工智能模型应被视为转换性工具还是衍生作品,以及训练数据的创造者是否应获得补偿。此案正受到包括美国版权局在内的监管机构的密切关注,该局一直在进行关于人工智能与版权问题的研究。

截至2024年底,此案仍未解决,双方正在为漫长的法律斗争做准备。结果不仅可能影响OpenAI微软的未来,还可能影响其他依赖大规模文本训练的人工智能公司,如Anthropic谷歌DeepMind的做法。《纽约时报》选择诉讼而非谈判,使其成为生成式人工智能时代内容创作者权利的测试案例。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:copyright-law·artificial-intelligence·litigation·news-publishing
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史