《纽约时报》诉微软公司案是一起具有里程碑意义的版权侵权诉讼,于2023年12月27日在美国纽约南区联邦地区法院提起。原告《纽约时报》公司指控OpenAI和微软通过开发和部署大型语言模型(如ChatGPT)及其支持的基于Azure的基础设施,未经授权复制并使用了数百万篇受版权保护的新闻文章来训练其人工智能系统。该诉讼寻求法定赔偿、禁令救济以及销毁侵权模型权重和训练数据集,使其成为对生成式人工智能商业应用最具重大意义的法律挑战之一。
该案的核心在于版权法与机器学习的交叉领域,具体涉及在从互联网抓取的海量文本语料库上训练大型语言模型的做法。《纽约时报》辩称,OpenAI和微软整体复制了其文章以构建ChatGPT背后的神经网络,且这些模型能够复制或高度改写受版权保护的内容,从而与该报自身的数字产品形成竞争。微软被列为被告,是因为其对OpenAI进行了数十亿美元的投资,并将OpenAI的模型整合到必应聊天和Microsoft 365 Copilot等产品中。该诉讼已成为法院如何将现有版权原则应用于新兴生成式人工智能领域的风向标。
背景与当事方
《纽约时报》公司成立于1851年,是美国最知名的新闻机构之一,截至2023年其数字订阅用户超过1000万。其商业模式高度依赖受版权保护的独家报道和分析。OpenAI成立于2015年,最初为非营利组织,2019年重组为利润上限实体,开发先进的人工智能系统,包括GPT系列大型语言模型。微软是一家全球科技公司,自2019年以来已向OpenAI投资超过130亿美元,通过其Azure平台提供云计算资源,并将OpenAI的模型整合到自身产品中。
该诉讼将微软列为共同被告,是因为其与OpenAI在财务和技术上深度交织。微软的Azure云托管OpenAI的训练和推理工作负载,且该公司拥有某些OpenAI技术的独家商业化权利。《纽约时报》声称,微软不仅是被动投资者,而是侵权系统开发和分发的积极参与者。
版权侵权指控
诉状详细列举了ChatGPT和微软必应聊天据称逐字复制或仅作轻微修改地再现《纽约时报》文章的具体实例。例如,诉讼引用了关于2018年加利福尼亚州坎普火灾的查询,ChatGPT据称返回了《纽约时报》一篇文章的近乎逐字摘录,包括标题和导语。《纽约时报》认为,此类输出表明这些模型是在其受版权保护的内容上训练的,并能按需生成这些内容,构成直接和间接侵权。
《纽约时报》还声称,OpenAI和微软从训练数据中移除或模糊了版权管理信息,如署名和发表日期,违反了《数字千年版权法》。该诉讼主张,被告尽管拥有资源,但未寻求《纽约时报》的许可或授权,且其对文章的使用并非转换性使用,而是对原作的替代。
法律论点与抗辩
截至2025年初,OpenAI和微软尚未对诉状提交正式答辩,但他们在相关案件中的公开声明和法律文件暗示了可能的抗辩。这些包括合理使用原则,该原则允许在未经许可的情况下为批评、评论、新闻报道、教学或研究等目的有限使用受版权保护的材料。被告可能辩称,在受版权保护的文本上训练是转换性使用,因为模型并非整体复制文章,而是学习统计规律和语言结构。
另一个可能的抗辩是,模型并非设计用于逐字复述特定文章,任何相似之处都源于语言的性质和某些短语的普遍性。OpenAI已表示,它为不希望其内容用于训练的网站提供“退出”机制,但《纽约时报》认为这给版权持有人带来了不当负担。该案还可能引发关于大型语言模型的输出是否构成衍生作品的问题,这一概念在人工智能背景下法院尚未充分探讨。
程序历史与相关案件
该诉讼被分配给纽约南区法官西德尼·H·斯坦。2024年初,法院批准了合并相关案件进行审前程序的联合动议,但《纽约时报》案仍保持独立。其他几位版权持有人也对OpenAI和微软提起了类似诉讼,包括莎拉·西尔弗曼和乔治·R·R·马丁等作家,以及针对Stability AI和Midjourney的视觉艺术家。《纽约时报》案因其规模及原告作为主要媒体机构的地位而备受关注。
2024年2月,法院发布日程安排令,设定了证据开示的时间表,审判日期暂定于2025年底。双方已进行了大量动议实践,包括驳回动议和即决判决动议,但截至2025年初尚未作出任何决定性裁决。该案吸引了各组织的法庭之友简报,包括美国作家协会和电子前沿基金会,反映了其广泛影响。
对人工智能行业的影响
该案的结果可能对大型语言模型的发展和更广泛的人工智能领域产生深远影响。如果法院裁定《纽约时报》胜诉,可能要求OpenAI和微软支付巨额赔偿并改变其训练实践,可能需使用授权数据集或实施更强大的内容过滤。这可能提高人工智能开发的成本,并为小型公司和研究机构设置进入壁垒。
相反,对被告有利的裁决将确认在公开可用文本上训练的合法性,为生成式人工智能的持续创新开绿灯。该案受到其他科技公司的密切关注,包括Anthropic、Google DeepMind和Meta AI,它们面临类似的法律挑战。它还与关于人工智能监管的持续政策辩论相交织,美国和欧洲的政府正在考虑规范机器学习中受版权材料使用的新法律。
技术背景:大型语言模型如何训练
要理解法律问题,有必要考虑训练大型语言模型的技术过程。这些模型基于2017年引入的Transformer (architecture)架构,在包含数十亿词汇的海量数据集上训练,这些词汇来自书籍、网站和其他来源。在训练过程中,模型调整其内部参数,,即其Neural network连接的权重,,以预测序列中的下一个词,这一过程称为自监督学习。这要求模型编码文本中的统计规律,包括事实、风格,有时甚至是逐字短语。
OpenAI的GPT-3和GPT-4的训练数据包括Common Crawl(一个公共网络档案)的很大一部分,以及维基百科和书籍等精选数据集。《纽约时报》声称其文章未经许可被纳入这些数据集。模型复制特定段落的能力是一种已知现象,通常称为“记忆化”,当某些序列在训练数据中频繁出现时就会发生。研究人员已表明,大型语言模型可以复述受版权作品的较长摘录,引发侵权担忧。
更广泛的法律格局与合理使用
合理使用原则编入美国《版权法》第107条,考虑四个因素:使用的目的和性质、受版权作品的性质、使用部分的数量和实质性,以及对潜在市场的影响。法院已将合理使用应用于搜索引擎和视频录制等技术,但将其应用于人工智能训练是新颖的。在2023年的“作家协会诉谷歌”案中,第二巡回法院裁定谷歌为搜索目的数字化书籍属于合理使用,但该案涉及非表达性使用,而人工智能模型可以生成表达性内容。
《纽约时报》认为,该使用并非转换性使用,因为模型旨在生成与原始文章竞争的文字,可能减少《纽约时报》网站的流量和订阅收入。被告可能反驳称,模型并非替代文章,而是提供了一种获取信息的新方式,类似于搜索引擎。法院对这些因素的分析很可能为未来涉及其他人工智能公司和内容创作者的案件树立先例。
当前状态与展望
截至2025年初,该案处于证据开示阶段,双方正在交换证据和专家报告。法院尚未就核心法律问题作出裁决,审判预计最早要到2025年底。双方已进行和解讨论,但未达成协议。该案是几起将塑造人工智能法律环境的高调诉讼之一,与涉及音乐唱片公司和图像生成器的案件并列。
结果将取决于法院如何解释事实并将现有法律应用于快速发展的技术。法律学者对可能的结果存在分歧,一些人预测会认定合理使用,另一些人则预期《纽约时报》胜诉。鉴于其全国重要性,该案最终可能上诉至第二巡回法院,甚至最高法院。无论结果如何,它已促使许多人工智能公司寻求内容提供商的许可,并加速了关于制定新立法以应对生成式人工智能独特挑战的讨论。
对新闻业和媒体的影响
该诉讼还凸显了媒体行业与人工智能开发者之间的更广泛紧张关系。新闻机构依赖版权保护其报道,但人工智能系统可以聚合和总结新闻,可能削弱其商业模式。《纽约时报》一直在积极探索自身的人工智能工具,但坚持任何对其内容的使用都必须得到补偿。其他出版商,包括美联社和Axel Springer,已与OpenAI签署许可协议,而《纽约时报》选择了诉讼。
如果《纽约时报》胜诉,可能导致其他出版商掀起类似诉讼浪潮,可能迫使人工智能公司谈判集体许可安排。这可能为媒体组织创造新的收入来源,但也可能减缓人工智能创新的步伐。相反,《纽约时报》败诉可能助长人工智能公司继续未经许可抓取内容,可能损害新闻业的财务可行性。因此,该案代表了技术与新闻界关系中的关键转折点。
结论
《纽约时报》诉微软公司案是一场关键的法律斗争,将有助于界定人工智能时代版权的边界。其解决将对人工智能开发者、内容创作者和公众产生深远影响,影响信息的产生、获取和变现方式。随着案件的推进,法律专家、技术专家和媒体高管都将密切关注,使其成为检验数百年版权原则如何应用于最新形式机器智能的试金石。