《纽约时报》诉OpenAI案是一起由纽约时报公司于2023年12月对OpenAI和微软提起的版权侵权诉讼。该案的核心在于,被告涉嫌未经授权使用数百万篇受版权保护的报纸文章,用于训练支持ChatGPT及其他产品的大语言模型。该报寻求数十亿美元的赔偿,并要求销毁包含或衍生自其内容的AI模型和数据集。截至2025年,该诉讼仍在纽约南区美国联邦地区法院进行中,庭审日期定于2025年末或2026年初。
背景:生成式AI与版权
基于大语言模型的生成式AI的兴起,开创了版权法的新前沿。这些系统建立在Transformer架构之上,摄取从互联网抓取的大量文本语料,包括新闻文章、书籍和网站。OpenAI的ChatGPT于2022年11月首次发布,展示了生成类似人类回应的能力,且常常再现或紧密改写受版权保护的文本。这种行为引发了法律问题,即使用受版权材料训练AI是否构成合理使用或可诉的侵权。随后,多位作者和权利人提起了多起诉讼,但《纽约时报》的案件因其规模及涉及大型科技公司而成为最受瞩目的案例。
当事方与法律主张
原告纽约时报公司是一家美国主要报纸,历来积极执行版权。被告包括OpenAI及其商业伙伴微软,后者为OpenAI的产品提供云基础设施和独家云托管。微软的GitHub Copilot也被列为被告,但主要焦点仍集中在ChatGPT及其底层模型上。
在2023年12月27日提交至纽约南区联邦地区法院的诉状中,《纽约时报》提出了多项主张:直接版权侵权、帮助侵权、替代侵权以及根据《兰哈姆法》提出的不正当竞争。该报指控OpenAI和微软未经许可复制其数百万篇文章,将其用于训练模型,并使模型能够生成“记忆”、“复述”或改写原文的输出,且往往删除了署名。诉状中包含了数十个示例,显示ChatGPT近乎逐字复制了《纽约时报》文章的摘录,有时甚至包含整段内容。
该报寻求每件被侵权作品最高15万美元的法定赔偿,鉴于涉及文章数量之多,赔偿总额可能达到数十亿美元。它还要求删除或销毁所有包含其受版权保护内容的训练数据和模型,并寻求禁令以防止未来使用。
OpenAI与微软的回应
OpenAI和微软于2024年2月提出驳回动议,辩称使用受版权材料进行训练符合美国版权法下的合理使用。他们主张,这些模型将内容转化为新的、非表达性的统计关系结构,而所涉输出要么是合法的摘要,要么是用户提示引发再现的结果。他们还辩称,《纽约时报》关于“记忆”的说法被夸大了,且该公司未证明实际损害。
在法律简报中,被告指出,《纽约时报》并未因AI而出现读者数量下降,且该报本身也曾尝试使用AI生成内容。他们提到网络抓取是行业惯例。驳回动议部分成功:2024年9月,法官西德尼·H·斯坦驳回了与替代侵权相关的索赔,但允许直接侵权和帮助侵权索赔继续审理。关于虚假背书的《兰哈姆法》索赔也被驳回,法院建议《纽约时报》重新提交。
关键法律问题与先例
该案涉及多项未决的法律原则。核心问题在于,根据合理使用的四要素测试(考察使用目的、作品性质、使用数量和市场影响),使用受版权作品进行训练是否具有变革性。法院历史上曾认定某些类型的数字复制(如谷歌的图书扫描项目)构成合理使用。然而,《纽约时报》认为生成式AI有所不同,因为其输出可以直接与原文章竞争,可能减少订阅收入和许可机会。
另一个问题是“记忆”现象。研究表明,大语言模型在提示下可以重现训练数据,尤其是对于不常见或重复的文本。《纽约时报》记录了ChatGPT几乎逐字重现其文章的情况,表明模型并未完全转化内容。OpenAI坚称此类输出很少见,并已实施技术措施以防止长篇再现。
对AI行业的广泛影响
该诉讼对更广泛的AI生态系统具有重大影响。许多公司,包括Anthropic、谷歌DeepMind和苹果,已面临或正在面临类似诉讼,或已与出版商达成许可协议。结果可能为AI公司是否必须获得许可并支付训练数据费用,还是可以继续自由抓取网络设定先例。
为应对诉讼,多家媒体机构已与OpenAI及其他公司签署协议。例如,美联社、阿克塞尔·斯普林格和新闻集团据报道已达成许可协议,而其他机构如国家公共广播电台和《芝加哥论坛报》则探索了替代方案。该案可能加速内容许可的趋势,因为AI公司寻求降低法律风险。相反,若《纽约时报》胜诉,则可能迫使训练数据集的编制方式发生根本性转变,可能提高初创公司和小型参与者的成本。
法律程序与时间线
该案已进入审前阶段。2024年,双方进行了广泛的证据开示,法院命令OpenAI提供训练数据日志和内部通信。《纽约时报》还获得了记录,显示OpenAI员工曾对未经许可使用受版权材料表示担忧。2024年11月,法院驳回了《纽约时报》关于增加与微软Copilot相关额外索赔的动议,但允许对诉状进行修改。
一个值得注意的进展发生在2025年2月,斯坦法官批准了将庭审定于2025年12月15日的日程安排令。他还驳回了OpenAI关于等待第二巡回法院相关案件(涉及另一起作者诉讼)后再进行庭审的请求。庭审预计将持续数周,并可能包括关于AI技术和经济学的专家证词。
经济与战略考量
对《纽约时报》而言,该诉讼不仅关乎赔偿。它代表了对其新闻业的捍卫,以及推动建立AI使用新闻内容的许可市场。该报辩称,AI聊天机器人可能取代传统搜索和直接新闻消费,削弱其订阅模式。它还重视其品牌,并期望在其报道被使用时获得署名。
与此同时,OpenAI在法律辩护上投入了大量资源,聘请了知名律师事务所和外部专家。该公司还进行了公共宣传,发表关于版权和合理使用的论文。微软作为主要股东和基础设施提供商,拥有自己的法律团队,但在很大程度上遵循了OpenAI的策略。财务风险很高:如果《纽约时报》胜诉,可能获得数十亿美元的法定赔偿,而对被告的不利判决可能引发其他出版商的后续诉讼浪潮。
行业反应与宪法背景
各方反应不一。许多学者和AI研究人员认为,使用受版权文本进行训练对于推进该领域是必要的,过度限制性的裁决将阻碍创新。其他人,包括记者和作者,则支持《纽约时报》,认为该案对保护创作生计至关重要。美国版权局已发表意见,承认问题的复杂性,但未就AI训练作出明确裁决。
该案还涉及第一修正案的考量,因为AI生成内容依赖于摄取新闻来提供信息。最高法院尚未解决这些问题,留下地区法院在未知领域摸索。一些人将其与互联网时代的里程碑案件(如索尼诉环球影业案和作者协会诉谷歌案)相提并论,这些案件在技术进步与版权保护之间寻求平衡。
利害攸关之处
如果法院裁定《纽约时报》文章的使用不构成合理使用,则可能命令销毁某些OpenAI模型或要求建立许可机制。这样的结果可能迫使AI公司依赖公有领域或明确许可的数据,减缓发展速度,但可能为内容创作者创造新业务。相反,合理使用的裁决将验证许多AI实验室当前的做法,尽管可能不排除自愿协议。
截至2025年末,庭审尚未开始,双方均表示愿意和解。OpenAI已从其他出版商获得内容许可,表明其愿意谈判。然而,《纽约时报》表示致力于诉讼,认为仅靠许可无法解决AI构成的“生存威胁”。该案仍是法律与技术交汇领域最受关注的案件之一,对新闻业的未来和数字经济具有深远影响。