《纽约时报》诉OpenAI案(2023年)

译自英文

NYT v. OpenAI(2023)是《纽约时报》于2023年12月对OpenAI和微软提起的版权侵权诉讼,指控其未经授权使用数百万篇文章训练AI模型。该案寻求损害赔偿及销毁训练数据,提出了关于生成式AI中合理使用的关键问题。

NYT诉OpenAI案(2023年)是《纽约时报》公司于2023年12月27日在美国纽约南区联邦地区法院对OpenAI及其主要投资者微软提起的一起具有里程碑意义的版权侵权诉讼。诉状指控OpenAI和微软未经许可使用数百万篇受版权保护的新闻文章来训练其大型语言模型(包括GPT-4和ChatGPT),并且这些模型现在以与报纸自身产品直接竞争的方式复制和“记忆”《纽约时报》的内容。该诉讼要求对每件被侵权作品获得最高15万美元的法定赔偿,禁止进一步使用《纽约时报》内容,并销毁所有包含此类材料的训练数据集。

该案被广泛视为生成式AI行业与内容创作者之间更广泛冲突的试金石,因为它测试了“合理使用”原则是否延伸至大规模抓取受版权保护的文本用于模型训练。结果可能重塑人工智能开发的经济格局,迫使公司协商许可协议或重新设计训练流程。截至2025年初,该案仍处于审前诉讼阶段,双方已提交驳回动议和反诉。

背景:生成式AI的兴起与数据抓取

这场诉讼是在深度学习的快速发展以及基于Transformer (architecture)模型的商业部署背景下展开的。OpenAI成立于2015年,于2020年发布GPT-3,并于2022年11月推出ChatGPT,后者迅速成为历史上增长最快的消费者应用之一。这些模型基于从公共互联网抓取的海量文本语料库进行训练,包括新闻文章、书籍和学术论文。时报称,其内容(大部分受收费墙保护)未经授权出现在这些数据集中,以及时使其成为训练材料的重要部分。

微软向OpenAI投资了超过130亿美元,并将其模型集成到必应聊天和Office 365等产品中,因在部署和利用涉嫌侵权的系统方面发挥的作用而被列为共同被告。起诉书引用了具体实例,其中ChatGPT生成了与《纽约时报》文章几乎逐字逐句的摘录,包括2020年一篇关于出租车行业的调查报道和2019年一篇关于抵押贷款利率的文章,证明这些模型可以在请求下直接再现受版权保护的文本。

法律主张与要求

时报提出了多项诉讼理由,包括直接版权侵权、协助侵权和代位侵权。它认为OpenAI和微软在训练和推理过程中复制、存储和传播了其作品,并且模型的输出构成未经授权的衍生作品。起诉书强调,被告“建立在他人工作的基础上”,而时报花费了数十亿美元进行新闻报道,却被AI公司免费占有。

除经济赔偿外,时报还请求发布永久性禁令,要求OpenAI和微软从训练数据集中删除所有《纽约时报》内容,并阻止未来使用该内容。这一要求规模空前,因为将完全要求这些公司从头重新训练模型,这将耗资数亿美元并可能降低模型质量。时报还要求法院责令被告披露其训练数据来源,并实施技术措施以防止将来发生侵权行为。

OpenAI的辩护:合理使用与公众利益

OpenAI于2024年2月提交了答复,提出其对受版权保护材料的使用属于合理使用例外情况,该例外允许为批评、评论、新闻报道、教学和研究等目的进行有限复制。该公司认为,训练AI模型是一种超越性的使用,并不替代原作品,并且模型学习的是模式和事实,而不是记忆具体文本。OpenAI还指出其“退出”机制,使网站所有者能够阻止其网络爬虫,以及其与其他出版商(如美联社和Axel Springer)建立的可持续合作关系,作为其尊重知识产权诚信的标志。

微软引用了类似的论点,强调模型是生成新内容的工具,而非复制现有文章。被告还提到,《纽约时报》本身也在为多种目的使用AI工具,报纸的这一指控是企图扼杀竞争。法律专家对这些辩护的强度存在分歧,一些人认为大规模复制和商业性质的使用不利于合理使用,而另一些人则指出机器学习的变革性特征是合理的论证。

行业反应与并行诉讼

《纽约时报》的诉讼是AI公司浪潮中的一部分之一。2023年,包括萨拉·西尔弗曼、克里斯托弗·戈登和理查德·卡代在内的作家先后对OpenAI和Meta提起了集体诉讼,而萨拉·西尔弗曼的案件后来与其他案件合并。盖蒂图片社在英国和美国起诉了Stability AI,指控其使用了其照片训练图像生成器。2024年,作家协会对OpenAI提起了集体诉讼,多家报社包括《芝加哥论坛报》和《纽约每日新闻》也加入了另一起针对OpenAI和微软的诉讼。这些案件引发了行业内广泛的反应。一些公司,如Anthropic谷歌深度思维,已开始与出版商许可内容,而另一些公司则主张采用类似音乐流媒体的法定许可计划。美国版权局于2023年就AI与版权问题启动了公众调查,欧盟在2024年通过了《人工智能法案》,其中包括对训练数据的透明性要求。《纽约时报》案的结果可能成为影响上述各项工作的先例。

关键法律问题与先例

核心的裁决问题在于,训练AI模型使用受版权保护的文本是否构成合理使用。法院历史上一直适用四项标准:使用的目的和性质、受版权作品的性质、使用部分的比例以及对该作品市场的影响。在2015年的“作者协会诉谷歌案”中,第二巡回法院认为,谷歌为搜索目的对图书进行数字化属于合理使用,但该案涉及有限的摘录和非商业用途。时报则辩称,其文章高度创造力性质多样、被告复制了完整作品,而且ChatGPT能够生成摘要和摘录直接损害了时报的许可收入和订阅业务。

另一个关键问题是“记忆”问题。OpenAI承认,大型语言模型在一些特定条件下有时会完整再现训练数据。时报的起诉书中包含了此类输出的示例,并认为这些输出并非创世性使用,而是版权开放。同时,被告则认为这些实例仅为稀有现象,模型设计旨在推广,而非默记。判定将是专家根据模型训练的技术细节和复制可能会进行出庭作证。

程序过程与现状

案件提交后,法院指派法官西德尼·H·斯坦审理该案。2024年初,OpenAI和微软针对诉讼提出放弃逮捕动议,称时报未提供具体的侵权输出来例证。时报于2024年3月修改裁决,增加了更多示例并明确了其主张。2024年7月,斯坦法官驳回了放弃请求,允许案件进入证据发现阶段。这一人为时报在主战场的胜利略微乐观,因为该人不接受被告关于案件过于推测性的论点。

预计证据发现阶段将更新箭头,时报要求访问OpenAI的训练数据以及内部关于数据来源的沟通记录。OpenAI基于商业秘密和大量数据集的生产负担拒绝了一些要求。法院还要求双方讨论制定离庭协议,但截至2025年初尚未达成。庭审日期尚未确定,但建议观察人士预计可能于2025年底或2026年开始。

对AI开发的广泛影响

该案的影响远不止两个部门。如果时报胜诉,那些AI公司可能需要为所有受版权训练数据拒绝,这将导致更加昂贵的代价和惩罚性的创新。有些启动可能会转向仅使用公共领域或合成数据,而大型公司将投资于专有数据集或与出版商的合作。该案还可能影响开源模型的开发,由于开源模型严重依靠依赖抓取的数据,可能无法遵守许可要求。

此外,如果OpenAI胜诉,这将合法化未经许可使用受版权材料训练模型的做法,可能导致更激进的抓取以及对创作者更少的报酬。这一结果或将加速机器生成内容的趋势,对传统媒体公司产生进一步的压力。因此,此案紧密受到科技专家、律师和记者界的关注,因它将帮助确定机器学习时代知识产权的边界。

结语

NYT v. OpenAI(2023)是一个为生成式AI时代定义的法律争战。它引发了关于作者身份、所有权以及人类创造力在机器大规模生成文本的世界中价值的根本问题。无论是通过剧本或审判解决,案件的结果都将可能影响AI科研、媒体经济以及版权法数十年。随着诉讼推进,这对比提醒我们,神经网络机器学习的快速推进不仅是一个技术故事,也是一个深刻的人文故事,它关于谁从技术进步中获益,谁需要承担成本。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:copyright-law·artificial-intelligence·litigation·media-industry
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史