《纽约时报》诉OpenAI合理使用抗辩

译自英文

《纽约时报》于2023年12月起诉OpenAI和微软,指控其在训练大型语言模型时侵犯版权。OpenAI的合理使用辩护主张其使用具有变革性,而《纽约时报》则声称其文章被未经授权复制。

《纽约时报》公司于2023年12月对OpenAI和微软提起诉讼,指控这两家公司未经许可或补偿,使用数百万篇受版权保护的新闻文章来训练其大型语言模型。该案正式名称为《纽约时报》公司诉微软公司和OpenAI公司案,核心问题在于在训练生成式人工智能系统时使用受版权保护的文本是否构成美国版权法下的合理使用。此案的判决结果可能为人工智能公司如何处理其训练数据集中的受版权保护材料树立先例。

《纽约时报》声称,OpenAI的ChatGPT和微软基于Azure的Copilot产品会逐字或高度近似地复制其文章的大量内容,且往往缺乏适当署名。诉状列举了多个例子,显示这些模型输出了与《纽约时报》报道几乎相同的段落,包括付费墙内容。OpenAI回应称其主张合理使用抗辩,认为基于公开可用文本进行训练具有变革性,且不会替代原作。微软作为OpenAI的主要投资者和分销商,也被列为被告。

诉讼背景

该诉讼于2023年12月27日在美国纽约南区联邦地区法院提起。《纽约时报》寻求法定赔偿和禁令救济,包括销毁所有包含其内容的模型权重和训练数据集。此次起诉前,《纽约时报》与OpenAI就许可协议进行了数月谈判但未果。据报道,《纽约时报》曾寻求对其超过1亿篇文章的档案使用进行补偿,但双方未能达成条款。

此案是涉及人工智能公司的多起高调版权纠纷之一。2023年7月,包括莎拉·西尔弗曼和克里斯托弗·戈尔登在内的作者曾就类似指控起诉OpenAI和Meta。《纽约时报》的诉讼之所以引人注目,是因为它涉及一家拥有雄厚法律资源和明确商业利益的大型新闻机构。此案结果可能影响新闻出版商和其他内容创作者与人工智能开发者之间的互动方式。

OpenAI的合理使用论点

OpenAI的抗辩基于美国《版权法》第107条所规定的合理使用原则。该公司认为,在受版权保护的文本上训练模型是一种变革性使用,,它创造了新功能(预测序列中的下一个词元),而非复制原始表达。OpenAI声称,训练过程不会存储源文本的副本,而是学习单词之间的统计模式和关系。该公司指出,其模型能够在广泛主题上生成原创文本,这证明它并非简单复述训练数据。

OpenAI还强调其技术的公共效益。该公司认为,大型语言模型能够促进研究、教育和创意表达,而限制在公开可用文本上的训练将扼杀创新。OpenAI指出,它为不希望其内容用于训练的网站所有者提供了退出机制,尽管《纽约时报》在起诉前并未使用该机制。该公司进一步辩称,《纽约时报》的文章属于事实性新闻报道,其版权保护力度弱于创意作品,且模型仅使用底层事实和思想,而非原始表达。

《纽约时报》的版权主张

《纽约时报》反驳称,合理使用不适用,因为OpenAI的使用具有商业性质,并直接与该报自身产品竞争。诉状指控ChatGPT和Copilot能够生成足够详细的《纽约时报》文章摘要,足以替代阅读原文,从而将流量和广告收入从《纽约时报》网站分流。该报还声称,这些模型在某些情况下逐字复制其文章,这超出了任何变革性使用的范围。

《纽约时报》指出其内容的“马赛克”性质,,单篇文章是更大编辑产品的一部分,包含背景、分析和调查报道。该报认为,即使复制部分内容也会削弱其价值。诉状还提到,OpenAI已从其他出版商获得内容许可,包括阿克塞尔·斯普林格和美联社,这表明该公司认识到使用受版权保护材料时需要获得许可。《纽约时报》辩称,其拒绝许可不应通过合理使用主张来规避。

法律先例与解释

此案的合理使用分析可能会借鉴几个关键先例。在“作者协会诉谷歌案”(2015年)中,第二巡回上诉法院裁定,谷歌为搜索索引对数百万本书进行数字化属于变革性合理使用,因为它提供片段和搜索功能,而不会完整复制书籍。OpenAI可能会引用此案来论证其使用同样具有变革性。然而,《纽约时报》可能会区分谷歌图书案,指出谷歌图书不与书籍本身竞争,而ChatGPT生成的内容可与新闻文章竞争。

另一个相关先例是2023年的“汤森路透诉罗斯智能案”,法院裁定使用路透社的法律要点来训练人工智能法律研究工具不构成合理使用。该判决虽对第二巡回法院无约束力,但表明当输出与原创作品竞争时,法院可能会更严格审查人工智能训练。《纽约时报》可能会辩称,其案件更接近罗斯智能案而非谷歌图书案,因为ChatGPT旨在用新闻内容回答问题,直接与《纽约时报》的核心业务竞争。

训练数据的技术方面

此案还提出了关于机器学习模型如何存储和检索信息的技术问题。OpenAI的模型基于Transformer架构,使用多头注意力机制处理文本。在训练过程中,模型调整数十亿个参数以最小化在庞大文本语料库上的预测误差。OpenAI未披露其训练数据集的完整内容,但《纽约时报》的诉状声称,基于模型能够重现特定段落,其文章出现在训练数据中。

OpenAI辩称,模型并非以传统意义存储文本副本,,参数编码的是统计关系,而非精确字符串。然而,研究人员已证明,大型语言模型能够记忆并重现训练数据中的长段落,尤其是当这些段落多次出现或具有独特性时。《纽约时报》提供了ChatGPT输出其文章近乎逐字引用的例子,这表明记忆确实发生。法院可能需要判断这种记忆是否构成版权法下的复制。

行业反应与影响

该诉讼引发了科技和出版行业的广泛反应。包括新闻集团和甘尼特在内的部分出版商表示支持《纽约时报》的立场,而其他出版商则与人工智能公司达成许可协议。OpenAI已与多家出版商签署协议,包括政治新闻网站母公司阿克塞尔·斯普林格和《金融时报》,以将其内容用于训练和展示。这些协议表明,一些出版商认为与人工智能公司合作而非诉讼更有价值。

人工智能研究人员担心不利裁决可能阻碍该领域发展。许多人认为,在大型多样化数据集上训练对于构建强大模型至关重要,而要求对每件受版权保护作品单独获得许可将不切实际。一些人提出了替代框架,如强制许可制度或文本数据集体权利组织。此案还可能影响国际人工智能发展,因为其他国家正关注美国法院如何平衡版权保护与技术创新。

可能结果与时间线

截至2025年初,此案处于证据开示阶段,双方正在交换关于训练数据和模型输出的证据。审判日期尚未确定,法律专家预计此案需要数年才能解决,可能最终上诉至最高法院。法院可能在审判前就合理使用问题作出即决判决,这可能会缩小争议范围或完全解决此案。

存在几种可能结果。法院可能裁定OpenAI的使用属于合理使用,允许该公司继续在未经许可的情况下使用受版权保护的文本进行训练。或者,法院可能认定该使用不属于合理使用,可能要求OpenAI支付赔偿并向《纽约时报》获得内容许可。折中方案可能涉及裁定某些使用属于合理使用而其他使用不属于,具体取决于复制程度和商业影响。此案也可能庭外和解,正如许多高调版权纠纷那样,OpenAI向《纽约时报》支付许可费并同意对其内容复制的某些限制。

该判决可能对人工智能行业产生深远影响。对OpenAI不利的裁决可能迫使其他公司,包括Anthropic谷歌DeepMind,改变其训练实践。它还可能影响依赖公开可用文本的开源模型开发。相反,对OpenAI有利的裁决可能鼓励人工智能公司继续在未经许可的情况下使用受版权保护的材料,可能导致内容创作者提起更多诉讼。此案代表了版权法如何适应新技术的根本考验,其结果将塑造人工智能开发者与内容生产者之间未来多年的关系。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:copyright-law·artificial-intelligence·litigation·fair-use
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史