作者对OpenAI的集体诉讼是一起合并审理的法律案件,一群作者指控OpenAI(GPT-3和GPT-4等大型语言模型的开发者)未经许可使用其书籍和其他文字作品训练人工智能系统,侵犯了他们的版权。该案在美国纽约南区联邦地区法院提起,成为关于在受版权保护的文本上训练生成式人工智能合法性更广泛辩论的焦点。原告寻求法定赔偿、利润返还以及禁止进一步未经授权使用的禁令,而OpenAI则辩称其训练行为属于合理使用原则。
这起诉讼是在针对人工智能公司的一系列类似诉讼浪潮中出现的,反映了创意产业与Generative AI快速商业化之间日益加剧的紧张关系。作者的主张核心在于,OpenAI的Large language model(基于Transformer (architecture)架构并在海量互联网语料上训练)必然复制并衍生自受保护的表达。与早期涉及搜索引擎或图像缩略图的案件不同,此案直接针对基础训练过程本身,提出了关于将受版权保护的材料用于机器学习是否构成侵权的新问题。
背景与立案
初始诉状于2023年9月8日由包括莎拉·西尔弗曼、理查德·卡德雷和克里斯托弗·戈尔登在内的作者提交,他们声称OpenAI的训练数据未经授权包含了他们的书籍。原告断言,OpenAI的OpenAI模型能够生成其作品的摘要、改写甚至逐字摘录,证明训练过程复制并存储了表达性元素。该案后来与其他作者诉讼合并,包括迈克尔·沙邦、塔-内希西·科茨和喜剧演员莎拉·西尔弗曼提起的诉讼,案名为“In re OpenAI ChatGPT Litigation”。
作者由苏斯曼·戈弗雷律师事务所代理,该所此前曾处理过备受瞩目的知识产权纠纷。诉状详细描述了OpenAI如何抓取互联网的绝大部分内容,包括书籍库和盗版文本合集,以构建训练数据集。诉状引用了OpenAI的内部文件和公开声明,表明该公司认识到未经许可使用受版权保护材料的法律风险。原告认为,OpenAI的行为并非变革性的,而是对现有作品的商业利用,因为模型在市场上与原始书籍竞争。
法律主张与论点
核心法律主张是根据美国版权法(具体为17 U.S.C. § 501)提出的直接版权侵权。原告声称OpenAI侵犯了其复制、创作衍生作品和分发副本的专有权。他们还提出了间接侵权和不正当得利的主张,认为OpenAI从其创意劳动未经授权的使用中获利。诉状寻求每件作品最高15万美元的法定赔偿,考虑到据称被侵权的作品数量,这可能高达数十亿美元。
OpenAI的辩护主要依据合理使用例外,该例外编纂于17 U.S.C. § 107。该公司辩称,训练模型是一种变革性使用,因为模型并不复制原始文本,而是学习统计模式和语言结构。OpenAI主张,训练的目的是创建一种通用工具,而非取代作者的作品,并且模型的输出很少与源材料相似。该公司还指出,它已实施过滤器以防止生成逐字受版权保护的文本,但原告对这些措施的有效性提出异议。
一个关键的法律问题是训练期间对受版权保护作品的中间复制是否构成侵权。原告类比了具有里程碑意义的“Authors Guild v. Google”案,该案中法院认为谷歌为搜索索引而数字化书籍属于合理使用。然而,作者认为谷歌的使用仅限于使文本可搜索,而OpenAI的使用涉及创建一种竞争性产品,能够以原作者风格生成新文本。“搜索”与“生成”之间的区别成为争论的焦点。
证据开示与技术证据
在证据开示阶段,原告寻求访问OpenAI的训练数据和模型权重,认为这些证据对于证明受版权保护的作品确实被复制是必要的。OpenAI以商业秘密保护和生成此类数据所需的巨大计算资源为由予以抵制。然而,法院下令进行有限的证据开示,允许原告检查显示训练语料中包含哪些来源的元数据和日志。这导致披露OpenAI使用了诸如Books3之类的数据集,这是来自影子图书馆Bibliotik的盗版书籍合集,包含数千本受版权保护的书目。
技术证据集中于Neural network的架构和Deep learning的性质。原告的专家作证称,大型语言模型(包括基于Transformer (architecture)架构的模型)存储了训练示例的压缩表示。他们认为,这些表示使模型能够复制的文本不仅仅是统计巧合,而是对原始文本的直接衍生。OpenAI的专家反驳称,模型是随机的,任何与特定文本的相似性都是模型泛化能力的结果,而非记忆。关于“记忆”与“泛化”的争论成为该案反复出现的主题。
司法裁决与动议
2024年2月,法官阿拉塞利·马丁内斯-奥尔金驳回了OpenAI的驳回动议,允许版权主张继续审理。法官裁定,原告已合理指控OpenAI的训练过程涉及复制受保护的表达,且合理使用抗辩无法在诉答阶段解决。这一裁决意义重大,因为它驳回了OpenAI关于案件受诉讼时效限制或原告缺乏诉讼资格的主张。裁决还指出,即使输出并非逐字复制,原告也已充分指控训练数据与模型输出之间存在联系。
2024年5月的一项后续裁决缩小了案件范围,驳回了原告的部分主张(包括与州法律和不正当得利相关的主张),但保留了核心版权主张。法院还驳回了OpenAI强制仲裁的动议,认为原告未同意任何仲裁条款。这些裁决为可能的审判奠定了基础,尽管双方均表示愿意和解。该案被分配给负责监督其他人工智能版权案件的同一法官,包括针对Anthropic和Google DeepMind的案件,这表明法院可能以协调方式处理共同的法律问题。
行业与政策影响
这起诉讼对Artificial intelligence行业产生了深远影响。它促使其他人工智能公司(包括Anthropic和Google DeepMind)审查其训练实践,并与出版商和作者谈判许可协议。2023年底,OpenAI宣布与多家媒体公司(包括阿克塞尔·施普林格和美联社)建立合作伙伴关系,以许可新闻内容用于训练。然而,这些协议仅覆盖了训练所用书籍和文章的一小部分,许多作者仍未获得补偿。
该案还影响了立法努力。在美国国会,议员提出了诸如《AI基础模型透明度法案》之类的法案,要求公司披露其训练数据来源。欧盟的《人工智能法案》(于2024年定稿)包含条款,要求通用人工智能模型的开发者记录其训练数据并遵守版权法。作者的集体诉讼成为检验现有版权法能否有效监管人工智能训练,或是否需要新立法的试金石。
创意界的反应
这起诉讼激励了作者和其他创作者,他们视其为对其生计的捍卫。诸如美国作家协会之类的组织提交了支持原告的法庭之友意见书,认为人工智能模型威胁到贬低人类写作的价值并削弱创意工作的经济激励。然而,一些作者表示支持人工智能作为灵感和合作的工具,甚至有少数人将其作品许可给人工智能公司。这种分歧反映了关于自动化在创意领域作用的更广泛社会辩论。
加入诉讼的知名作者包括乔纳森·弗兰岑、朱迪·皮考特和乔治·R·R·马丁,尽管一些人后来退出或表达了保留意见。该案还引起了学者的关注,他们争论在受版权保护的文本上训练是否类似于人类学习。诸如Melanie Mitchell和Brendan Lake之类的学者认为,机器并非以人类意义上的方式“阅读”,但法律体系必须决定复制和转换数据的机械过程是否构成侵权。
和解与后续
截至2025年,该案仍未解决,双方正在进行和解谈判。报道表明,OpenAI已提出向作者集体支付许可费,但原告要求更高的金额和持续的版税。法院已安排2025年末的现状会议,观察人士推测,鉴于诉讼的高成本和不利裁决的可能性,和解很可能达成。和解将为人工智能公司如何补偿创作者树立先例,尽管它不一定对其他被告具有约束力。
该案还引发了相关诉讼。2024年,一群非虚构类作者对OpenAI提起了单独的集体诉讼,声称该公司未经许可使用了其作品。《纽约时报》对OpenAI和微软提起了自己的诉讼,该诉讼在同一法院待决。这些案件连同作者的集体诉讼,创造了一个复杂的法律格局,将塑造人工智能发展的未来。作者案件的结局被广泛预期不仅会影响美国,还会影响正在应对类似问题的世界其他司法管辖区。
更广泛的背景与未来展望
作者对OpenAI的集体诉讼是要求人工智能公司对其训练数据负责的更大运动的一部分。它凸显了技术创新与知识产权之间的紧张关系,并迫使公众正视人工智能系统建立在无数作家、艺术家和记者无偿劳动之上的事实。该案还强调了人工智能开发透明度的必要性,因为原告的证据开示请求揭示了训练数据收集的不透明性质。
展望未来,该案确立的法律原则可能产生持久影响。如果法院裁定未经许可在受版权保护的作品上训练构成侵权,人工智能公司将需要彻底改革其数据获取策略,可能依赖公有领域作品或许可内容。如果法院裁定支持合理使用,这将赋予人工智能开发者广泛使用现有文本的余地,但也可能促使立法行动创建强制许可计划。无论哪种方式,该案都代表了Machine learning历史和Generative AI商业化进程中的一个关键时刻。
作者的集体诉讼还提出了关于作者身份本身性质的问题。随着人工智能模型能够生成与人类写作相媲美的文本,原创创作与衍生作品之间的界限变得模糊。该案迫使法院考虑,一个“阅读”了数百万本书的机器是否与一个受相同书籍影响的人类作者根本不同。虽然法律体系尚未提供明确答案,但该案确保这个问题将在未来几年内持续被讨论。