Authors Guild v. OpenAI(2023)是一项集体诉讼,于2023年9月20日在美国纽约南区联邦地区法院提起。原告为美国作家协会(Authors Guild)及一群知名作家,包括约翰·格里森姆(John Grisham)、朱迪·皮考特(Jodi Picoult)和乔治·R·R·马丁(George R.R. Martin),他们指控OpenAI未经授权使用其书籍训练大型语言模型,侵犯了其版权。该诉讼寻求法定损害赔偿、禁令救济及利润返还,使其成为Generative AI与版权法交叉领域的一个标志性案件。
诉状的核心围绕OpenAI训练GPT-3和GPT-4等模型的过程,这些模型基于Transformer (architecture)架构。原告认为,OpenAI将其作品大规模复制到训练数据集中,使模型能够生成与原书竞争并具有衍生性质的文本。该案是针对AI公司的一系列更广泛诉讼浪潮的一部分,其中包括《纽约时报》和其他作者提出的类似诉讼,但其文学界集体代表的身份尤为引人注目。
背景与法律背景
该诉讼是在Artificial intelligence和Machine learning快速发展的背景下出现的,特别是基于海量文本语料库训练的Deep learning模型的兴起。OpenAI成立于2015年,已经开发出一些最广泛使用的大型语言模型,包括GPT-3(2020年发布)和GPT-4(2023年3月发布)。这些模型基于从互联网抓取的数十亿个单词进行训练,其中包括书籍、文章和其他受版权保护的材料,通常未经明确许可。
美国版权法赋予作者对其原创作品的复制、分发和创作衍生作品的专有权利。原告认为,在受版权保护的书籍上训练AI模型构成了未经授权的复制,即使模型并不直接输出这些文本。他们还声称,模型生成摘要、改述或风格相似内容的能力违反了衍生作品权。
OpenAI以其合理使用原则进行辩护,该原则允许出于批评、评论、新闻报道、教学或研究等目的有限使用受版权保护的材料。该公司还辩称,训练数据具有变革性,因为模型不会重新生主动作品,而是学习统计模式。然而,原告认为,这种复制规模涉及数千本书,远远超出了任何合理的合理使用范围。
涉及方
主要原告包括几位畅销书作家:约翰·格里沙姆,以法律惊悚小说如《公司》(1991年)而闻名;朱迪·皮考特,著有《姐姐的守护者》(2004年);以及乔治·R·R·马丁,作为《冰与火之歌》系列的创作者。其他具名原告包括戴维·巴达奇、西尔维娅·戴和乔纳森·弗兰森。The Authors Guild成立于1912年,是一专业组织,代表数万名作家,一直积极倡导数字化时代作家的权益。
被告是OpenAI,一家总部位于美国加利福尼亚州旧金山的公司。OpenAI的领导层包括CEO Sam Altman和CTO Mira Murati,尽管该诉讼并未点将个别高管。该公司已从微软和其他科技巨头那里获得大量投资,其模型通过Azure和ChatGPT等平台部署。
核心主张与指控
该起诉书指控OpenAI取通过直接获取数据或使用包括盗版副本的数据集,完整地复制了原告的书籍。具体来说,原告指出Books3数据集,一个包含超过19万本书的集合,在训练某些模型时被使用,其中包括具名作者的作品。该诉讼声称这种复制是故意的,因为OpenAI知道数据集中包含受版权保护的素材。
有趣的是,作者们还辩称,模型能够生成其作品的"总结、概述或其他衍生形式",从而产生未经授权的衍生作品。他们举例说明ChatGPT可以生成详尽的剧情摘要或模仿作者的风格,这些功能他们认为削弱了原书的市场。该诉讼还指控OpenAI未提供署名或补偿,违反了某些国际协定下作者的精神权利,尽管美国法律并未明文承认精神权利。
原告要求对故意侵权最高每部作品15万美元的法定损害赔偿,考虑到涉及的作品数量,这可能达到数十亿美元。他们还会要求禁令,防止OpenAI在未来的训练中使用他们的作品,以及销毁任何侵权副本或基于这些数据训练出的模型。
诉讼进程
该案被分配给纽约南区法院法官西德尼·H·斯坦。2023年10月,OpenAI提出驳回动议,辩称原告未能陈述诉讼请求,因为他们未指明具体侵权副本或输出内容。该公司还重申合理使用辩护,强调AI训练的变革性质。
原告于2024年1月提交了修改后的诉状,增加了更详细的事项和额外原告。他们还提交了集体诉讼认证,要求代表所有未经许可使用其作品的作者。截至2025年初,法院尚未对驳回动议作出裁定,证据调查仍在继续。
该案是几起备受关注的AI版权诉讼之一。2023年10月17日,《纽约时报》对OpenAI和微软提起了另一起诉讼,指控类似侵权。其他作者,包括莎拉·西尔弗曼和克里斯托弗·戈尔登,已在其他辖区提起集体诉讼。这些案件的结果可能为版权法如何应用于AI训练设立先例。
OpenAI的辩护
OpenAI的辩护主要基于合理使用。公司辩称,在受版权保护的文本上训练模型类似于人类阅读书籍并从中学习,并不构成侵权。他们认为,模型并不存储原始作品副本,而是学习抽象模式和关系,使这种使用具有变革性。
OpenAI还强调AI技术的公共效益,认为限制训练数据会扼杀创新,并损害医学、教育、科学等领域中有益应用的发展。该公司已为作者提供了选择退出机制,该机制规定了创意者之人的负担已被批评为不充分。
在驳回动议中,OpenAI辩称原告缺乏法定资格,因为他们未指控具体损害。该公司声称,这些模型不会以与原告作品竞争的方式复制这些作品,任何输出都具有变革性。然而,他们即将识别语境的影响,并指出Books3数据集是公开可用的,且OpenAI在收到请求后已采取措施移除某些受版权保护的作品。
更广泛的的影响
该案对Artificial intelligence行业具有重大影响。如果对原告有利的裁决,可能要求AI公司为所有受版权保护的训练数据获得许可,这将提高成本且研发速度可能放缓。同时,它也可能催生类似于音乐或在线照片库的许可市场,为作者支付作品使用费。
相反,如果OpenAI胜诉,将确立AI训练为合理使用,为继续不经授权抓取数据提供绿灯。然而,这也可能加剧与内容创造者的紧张关系,并被行为调整。包括欧盟在内的一些国家已经考虑提出法规,要求训练数据透明度并对表现的权利进行补偿。
该案还涉及创意和创作者身份的本质问题。如果AI模型能够生成模仿人类作者的文本,那么原创作品的价值何在?一些学者认为AI生成的内容本质上具有衍生性,而另一些则视其为应受保护的新表达形式。
相关案件与进展
除作者集体诉讼外,已起诉AI公司案件。2023年7月,作者莎拉·西尔弗曼、理查德·卡德雷和克里斯托弗·戈尔登在北加州地区法院起诉了Meta,称他们的书籍未经许进行了使用。该案于2023年11月部分被驳回,但允许原告修改诉状。
《纽约时报》于2023年12月提起的诉讼被认为是最重要的诉讼之一,因为其涉及重大媒体机构并具备大量法律资源。时报指控OpenAI和微软使用其数百万篇文章来训练模型,且模型能够逐字复制时代的内容。该案正在与作者诉讼进行诉讼的同一法院审理。
其他人工智能公司,包括Anthropic和Google DeepMind,也因其训练实践受到审查。2024年,美国版权局宣布就AI与版权问题征询各方意见。该局已发布了指导,指出如果AI生成的作品缺乏人类创作性,则可能不受版权保护,但训练数据的权利归属性仍未解决。
可能的结果与时间线
法律专家预计,由于争邻点的复杂性以及可能的上诉,该案将需数年时间才能解决。简易判决可能于2025年提出,审判则可能在2026年或以后进行。最高法院最终可能需在合理使用问题上出下裁决,就像在2021年的Google v. Oracle案中所做的那样,该案涉及代码复制。
如果原告获胜,他们可获得高额赔偿,但更重要的是,裁决可能迫使OpenAI改变其训练实践。该公司已开始从某些出版商获得内容许可,例如于2023年12月与Axel Springer达成协议,但法院命令将更具约束力。
如果OpenAI获胜,将认可目前AI培训方式,并可能鼓励更激进的收集数据行为。这可能引发创作者的强烈反对,并促进新的立法。一些评论者认为,更好的解决方案可能是强制性许可制度,而非诉讼。
结论
Authors Guild v. OpenAI(2023)二十月二十五日是XeroxV,在版权框架可否适应大规模数据训练这一新实践的关键要考核。此案的结果不仅影响诉讼各,也对AI技术的发展及全球创作者的权利产生影响。随着诉讼的推进,将可能在未来数年内塑造行业规范和法律标准。