《纽约时报》诉OpenAI案

译自英文

《纽约时报》于2023年12月对OpenAI和微软提起版权侵权诉讼,指控其未经授权使用该报文章来训练大型语言模型。此案是对生成式AI基础的一次标志性法律挑战。

《纽约时报》诉微软公司和 OpenAI 公司案是一起具有里程碑意义的版权侵权诉讼,于2023年12月27日在美国纽约南区联邦地区法院提起。该诉讼指控 OpenAI 及其主要投资者微软在未经许可或补偿的情况下,使用《纽约时报》数百万篇受版权保护的新闻文章来训练其大型语言模型,从而违反版权法并威胁该报的商业模式。此案被广泛视为检验知识产权法如何适用于生成式人工智能系统及其底层训练数据的关键测试。

该诉讼旨在追究被告对《纽约时报》所称的“非法复制和使用《纽约时报》独特价值作品”的责任。诉讼要求按每件被侵权作品最高15万美元的法定赔偿金索赔,申请禁止进一步使用《纽约时报》内容的禁令,并要求销毁包含该内容的任何数据集或模型。根据同期报道,此次起诉是在该报与 OpenAI 之间数月谈判未能达成许可协议之后提出的。

背景与语境

该争议源于人工智能系统的快速发展,特别是基于Transformer架构的深度学习模型。OpenAI 于2015年作为非营利研究实验室成立,后重组并设立营利部门,于2020年发布 GPT-3,并于2022年11月发布 ChatGPT。这些系统在从互联网抓取的海量文本语料库上进行训练,其中包括新闻文章、书籍和其他受版权保护的材料。

《纽约时报》创刊于1851年,长期维持付费墙和数字订阅业务,截至2023年底报告订阅用户超过1000万。该报认为其新闻是宝贵的专有资产,允许人工智能公司免费使用会削弱其收回制作成本的能力。《纽约时报》还指出,人工智能聊天机器人可能“记忆”并复制文章片段,从而可能直接与该报自身的分发渠道竞争。

法律主张与论点

诉状提出多项诉讼理由,包括直接版权侵权、帮助侵权和替代侵权。《纽约时报》提供了数十个例子,显示 ChatGPT 和其他 OpenAI 产品据称近乎逐字复制了其文章片段,包括2019年关于出租车牌照贷款的调查报道和2020年关于 COVID-19 疫情的报道。该报认为,此类输出表明模型是在其内容上训练的,且这种复制不具有转换性。

OpenAI 和微软在法庭文件中回应称,其对受版权材料的使用属于“合理使用”原则,该原则允许为批评、评论、新闻报道、教学或研究等目的进行有限使用。他们辩称,在大型数据集上训练是一个转换性过程,不会取代原始作品,而是创造新的、非表达性的统计表示。微软在2023年初已向 OpenAI 投资超过130亿美元,于2024年2月提出驳回动议,声称《纽约时报》未显示具体损害。

《纽约时报》反驳称,合理使用是一个狭窄的例外,OpenAI 运营的商业规模加上人工智能生成摘要带来的直接竞争,不利于合理使用的认定。法律学者指出,此案可能为法院如何解释人工智能训练的“目的和性质”树立先例,这一问题在美国判例法中仍未解决。

关键事件与时间线

  • 2023年12月27日:《纽约时报》在纽约南区提起诉讼,将 OpenAI 和微软列为被告。
  • 2024年1月:OpenAI 公开表示对诉讼感到“惊讶和失望”,并指出其一直在与《纽约时报》进行富有成效的讨论。该公司还开始为不希望其内容用于未来训练的网站所有者提供退出机制。
  • 2024年2月:微软提出驳回动议,辩称《纽约时报》的主张是推测性的,且该公司在模型训练中没有直接作用。
  • 2024年4月:法院部分驳回了微软的驳回动议,允许案件在多项主张上继续审理。负责此案的法官 Sidney H. Stein 命令双方进行证据开示。
  • 2024年6月:OpenAI 提出自己的即决判决动议,声称《纽约时报》无法证明具体文章以造成市场损害的方式被复制。《纽约时报》反对,引用了 OpenAI 内部承认需要许可内容的通信。
  • 2024年10月:法院就证据开示争议举行初步听证会,特别是关于访问 OpenAI 训练数据集的问题。《纽约时报》要求获得哪些文章被纳入训练的详细记录,而 OpenAI 则辩称此类信息属于商业秘密。
  • 截至2025年初:案件仍处于证据开示阶段,未设定审判日期。双方继续提交动议和专家报告。

更广泛的影响

该诉讼是针对人工智能公司的一系列法律行动的一部分。2023年,Sarah Silverman 和 George R.R. Martin 等作者对 OpenAI 和 Meta 提起了类似的集体诉讼。Getty Images 在英国和美国起诉 Stability AI 使用其照片进行训练。此案之所以引人注目,是因为它涉及一家拥有大量法律资源和明确财务利益的大型新闻机构。

结果可能影响机器学习开发的经济性。如果《纽约时报》胜诉,人工智能公司可能需要向出版商许可内容,这一成本可能重塑整个行业。相反,如果 OpenAI 胜诉,则可能使在公开可用文本上训练的做法合法化,从而可能加速OpenAIAnthropicGoogle DeepMind等竞争对手的发展。

新闻机构的反应各不相同。一些机构,如美联社和 Axel Springer,已与 OpenAI 签署了许可协议。其他机构,包括《纽约时报》,则选择了诉讼。此案还引发了关于是否需要新立法的讨论,一些立法者提议为人工智能训练建立“通知和退出”机制。

技术与伦理维度

此案提出了关于神经网络如何存储和检索信息的问题。研究人员已表明,大型语言模型可以记忆长段文本,尤其是当这些段落多次出现在训练数据中时。《纽约时报》认为,其文章被广泛转载和引用,很可能在 OpenAI 的数据集中过度代表,从而增加了逐字复制的风险。

伦理辩论集中在人工智能公司是否有道德义务补偿内容创作者。合理使用的支持者认为,训练类似于人类阅读和学习文章,而批评者则认为,人工智能训练的范围和商业性质根本不同。此案还凸显了人工智能训练缺乏透明度的问题,因为大多数公司不公开披露其完整数据来源。

反应与评论

法律专家给出了不同的预测。一些人,如斯坦福法学院教授 Mark Lemley,认为人工智能训练很可能被认定为合理使用,引用了 Google Books 案等先例。其他人,包括版权学者 Pamela Samuelson,则指出《纽约时报》关于直接竞争的证据可能使天平倾斜。麻省理工学院计算机科学与人工智能实验室斯坦福人工智能实验室都就此案举办了研讨会,反映了其学术重要性。

OpenAI 首席执行官 Sam Altman 公开表示,公司愿意为内容付费,但认为当前法律框架不明确。在2024年3月的一次采访中,他说:“我们希望成为出版商的良好合作伙伴。问题在于什么是公平的价格。”《纽约时报》方面则坚持认为,其主要目标是保护其新闻业并为行业树立先例。

当前状态与未来展望

截至2024年底,此案尚未解决。双方已进行了大量动议实践,法院尚未就核心合理使用问题作出裁决。一些观察人士预计,鉴于其全国重要性,此案可能最终上诉至最高法院。与此同时,OpenAI 继续与其他出版商签署内容协议,包括 News Corp 和《金融时报》,这表明无论诉讼结果如何,行业正朝着许可模式发展。

《纽约时报》还采取了并行行动,包括向英国信息专员办公室就数据保护问题提出投诉。该公司表示将继续投资于自身的人工智能能力,包括与Google Cloud合作进行数据分析,但仍致力于诉讼。

结论

《纽约时报》诉 OpenAI 案代表了媒体与人工智能关系的关键转折点。其解决不仅可能影响涉案双方,还可能影响人工智能开发、内容许可和版权法的更广泛生态系统。随着技术的发展,此案确立的法律原则可能为未来争议奠定基础,使其成为本十年最受关注的诉讼之一。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:copyright-law·artificial-intelligence·legal-dispute·news-media
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史