2023年12月27日,纽约时报公司在美国纽约南区联邦地区法院对OpenAI和微软提起诉讼。诉状指控被告未经许可使用数百万篇受版权保护的新闻文章来训练其大型语言模型,且由此产生的系统与该报自身内容形成竞争。此案是关于生成式AI与版权法交汇的最受关注的法律斗争之一,对整个人工智能行业具有深远影响。
该诉讼的核心主张是直接和间接版权侵权,以及违反《数字千年版权法》。时报寻求法定损害赔偿、禁令救济,以及销毁任何包含其作品的模型和训练数据集。OpenAI和微软已提出驳回动议,辩称其使用文章构成美国版权法下的合理使用,截至2025年初,这一抗辩尚未在法庭上得到完全解决。
背景与当事方
纽约时报创立于1851年,是美国最大且最具影响力的报纸之一,截至2023年数字订阅用户超过1000万。其商业模式严重依赖独家报道和付费墙内容。OpenAI成立于2015年,是领先的AI研究组织,开发了GPT系列模型,包括GPT-3和GPT-4,这些模型为ChatGPT等产品提供支持。微软是OpenAI的主要投资者,据报道承诺投资130亿美元,通过Azure提供云基础设施,并将OpenAI的模型集成到其必应搜索引擎和Office生产力套件中。
诉状列举了100多个具体实例,声称ChatGPT和必应聊天在未经署名或许可的情况下,几乎逐字复制了时报文章,且通常绕过付费墙。时报认为,这削弱了其通过新闻内容变现的能力,因为用户无需订阅即可从AI系统中获取相同信息。
法律主张与指控
主要主张是版权侵权,声称被告在训练模型过程中复制、再现和分发了时报文章。诉状详细描述了训练过程涉及摄取从互联网抓取的海量文本语料库,其中包括数百万篇时报文章。时报进一步声称,模型可以生成与其文章实质性相似的输出,有时包含完全相同的句子或段落。
该诉讼还指控间接侵权,声称OpenAI和微软从其用户的侵权行为中直接获利,这些用户提示模型再现受版权保护的内容。此外,时报依据《数字千年版权法》提出主张,认为被告在训练过程中删除或篡改了版权管理信息,如署名和版权声明。
抗辩论点
OpenAI和微软于2024年2月提出驳回动议,辩称该诉讼基于推测性主张,且使用受版权作品进行训练是变革性的合理使用。他们声称,模型并未取代原始文章的市场,而是作为信息综合的新工具。被告还指出,时报文章在线上公开可访问,且训练过程涉及统计模式而非直接复制。
在提交的文件中,OpenAI强调了其在提供署名和允许出版商选择退出训练方面的努力,但时报认为这些措施不足,且仅在侵权发生后实施。被告还指出,时报自身也使用AI工具用于各种目的,暗示对该技术有一定程度的接受。
行业背景与相关案件
此案是涉及AI公司的更广泛版权纠纷浪潮的一部分。2023年,包括莎拉·西尔弗曼和乔治·R·R·马丁在内的作者对OpenAI及其他公司提起集体诉讼,而视觉艺术家则起诉了Stability AI和Midjourney。Getty Images在英国和美国对Stability AI提起了单独诉讼。这些案件共同涉及关于训练受版权数据是否构成合理使用,以及AI生成输出是否可能侵犯现有作品的问题。
NYT案件的结果可能为法院如何解释机器学习背景下的合理使用设定先例。法律学者指出,在Authors Guild诉Google等案件中确立的变革性使用原则可能是抗辩的核心。然而,OpenAI产品的商业性质以及对时报的潜在市场损害,使此案区别于早期先例。
训练数据的技术方面
大型语言模型的训练涉及从多种来源(包括书籍、网站和新闻文章)输入数十亿词汇。OpenAI的GPT-3于2020年发布,基于名为Common Crawl的数据集进行训练,该数据集包含PB级的网页。时报声称其文章未经授权被纳入此数据集及后续数据集。技术过程涉及使用变换器和多头注意力等技术将文本转换为数值表示,使模型能够学习模式并生成连贯响应。
OpenAI已承认其训练数据包括公开可用的网络内容,但未披露其数据集的完整构成。公司已实施过滤器以减少逐字复制受版权文本的可能性,但时报的诉状提供了这些过滤器失效的实例。此案引发了关于更透明数据来源以及AI公司与内容创作者之间潜在许可协议的讨论。
程序历史与现状
初次提交后,法院将案件与其他相关版权诉讼合并进行预审,但时报案件仍保持独立。2024年3月,法官部分驳回了被告的驳回动议,允许核心版权主张继续审理,同时驳回了一些次要主张。截至2025年初,双方正在进行证据开示,时报寻求访问OpenAI的训练数据和内部通信。
一个关键进展发生在2024年11月,OpenAI对时报提出反诉,声称该报聘请承包商操纵ChatGPT以再现受版权保护的材料,违反了平台服务条款。时报否认了这些指控,称其为对核心问题的干扰。此案定于2025年末开庭审理,尽管鉴于双方的高风险,和解仍有可能。
对新闻业与AI的影响
该诉讼对新闻行业具有重大影响,该行业一直在努力适应数字经济。许多出版商已与AI公司签订许可协议,例如OpenAI与Axel Springer、美联社和新闻集团之间的交易。然而,时报选择诉讼,认为仅靠许可无法解决未经授权使用的根本危害。此案可能决定AI公司是否必须为其产品所依赖的数据付费,从而可能重塑新闻业和AI发展的经济格局。
对于AI行业,不利裁决可能迫使公司彻底改革其训练实践,可能限制数据集的规模并增加成本。相反,有利于OpenAI的裁决可能确立广泛的合理使用保护,鼓励进一步创新,但引发内容创作者的担忧。此案受到MIT CSAIL和斯坦福AI实验室等机构研究人员的密切关注,他们研究AI的法律和伦理维度。
公众与学术反应
公众对此诉讼的看法存在分歧。记者和媒体倡导者普遍支持时报,视其为对知识产权和优质新闻可持续性的捍卫。科技爱好者和一些AI研究者认为,限制性版权裁决可能阻碍进步,并指出利用现有作品创造新知识的悠久历史。法律专家指出,鉴于所涉问题的新颖性和重要性,此案最终可能上诉至最高法院。
学者们还就AI背景下的合理使用概念进行了辩论,一些人提出平衡创新与创作者权利的新框架。此案推动了学术会议和论文,包括对神经网络如何记忆训练数据以及再现发生条件的分析。这些研究可能为司法判决和未来立法提供信息。
潜在结果与未来方向
存在几种可能的结果。法院可能裁定对受版权作品的训练构成合理使用,这可能导致更多许可谈判,但非强制支付。或者,法院可能认定侵权,要求OpenAI支付损害赔偿并可能销毁其模型,这将是前所未有的且具有破坏性。折中方案可能涉及允许训练但要求更强有力的防止逐字复制的保障措施,或强制实施许可制度。
在法庭之外,此案推动了立法提案,例如《AI基础模型透明度法案》,该法案将要求公司披露训练数据来源。欧盟的《AI法案》于2024年通过,包含关于训练数据版权合规的条款。这些监管努力可能提供一个减少逐案诉讼需求的框架。因此,NYT诉OpenAI案是一个里程碑式的案件,将影响社会在未来多年如何平衡AI的益处与创作者的权利。