Authors Guild诉OpenAI案是一起于2023年9月19日在美国纽约南区联邦地区法院提起的集体诉讼。原告是由Authors Guild代表的知名作家群体,他们指控OpenAI(GPT这一大型语言模型的创造者)未经授权使用其书籍训练AI系统,侵犯了他们的版权。此案是针对生成式人工智能中使用受版权保护材料的几起高调法律挑战之一,对AI开发和版权法的未来具有重大影响。
该诉讼由作家专业组织Authors Guild以及包括约翰·格里森姆、朱迪·皮考特、乔治·R·R·马丁和大卫·巴尔达奇在内的个人作者发起。原告声称,OpenAI的模型(包括GPT-3和GPT-4)是在包含受版权保护书籍(通常从盗版网站获取)的庞大数据集上训练的,未经许可或补偿。他们认为这构成故意侵犯版权,且OpenAI从他们的作品中获得了商业利益。该案寻求法定赔偿和禁令救济,潜在金额可达数十亿美元。
背景:AI训练与版权
争议的核心在于OpenAI如何构建其大型语言模型。这些模型在包含书籍、文章和网页的海量文本语料库上进行训练。原告认为,OpenAI的训练过程涉及复制受版权保护书籍的文本以创作衍生作品,这侵犯了版权所有者的专有权。OpenAI则辩称,其对受版权保护材料的使用属于合理使用原则,该原则允许为批评、评论、新闻报道、教学、学术或研究等目的对受版权保护作品进行有限使用。此案的关键可能在于AI训练的变革性是否构成合理使用。
原告及其主张
本案具名原告包括小说和非小说类作家等多元群体。其中包括朱迪·皮考特和乔治·R·R·马丁等小说家,以及大卫·巴尔达奇等非小说类作家。拥有超过2万名成员的Authors Guild作为原告加入,以代表其成员的利益。诉状指控OpenAI的模型能够逐字复制受版权保护书籍的摘录,证明训练数据包含这些作品。原告还声称,尽管OpenAI有资源获取许可,但并未寻求授权或获得作者许可。
OpenAI的回应与法律策略
OpenAI于2024年2月提交动议,要求驳回此案。该公司辩称,原告缺乏诉讼资格,因为他们未在起诉前向美国版权局注册其版权,这是美国法律的要求。OpenAI还声称其对受版权保护材料的使用具有变革性,因此属于合理使用,并引用了Google Books案等先例。该公司强调,其模型旨在生成新内容,而非复制现有作品,任何相似之处都是巧合或语言本质所致。OpenAI还指出其努力为作者提供退出机制,但原告认为这些机制不足。
相关诉讼与行业影响
Authors Guild诉OpenAI案是针对AI公司的更广泛版权诉讼浪潮的一部分。2023年,包括莎拉·西尔弗曼和克里斯托弗·戈尔登在内的其他作者,就类似指控对OpenAI和Anthropic提起了单独的集体诉讼。此外,视觉艺术家也对Stability AI和Midjourney等AI图像生成器提起了诉讼。这些案件受到科技行业的密切关注,因为其结果可能为AI公司如何使用受版权保护数据树立先例。一些公司,如Google DeepMind和Microsoft(OpenAI的主要投资者),已开始与出版商和内容创作者达成许可协议以避免诉讼。例如,OpenAI已与美联社和Axel Springer等新闻机构签署了协议。
程序进展与时间线
在2023年9月初步提交后,此案与纽约南区针对OpenAI的其他类似诉讼合并审理。2023年11月,法院为原告指定了首席律师。OpenAI的驳回动议于2024年2月提交,原告于2024年3月提交了反对意见。截至2024年年中,法院尚未对该动议作出裁决。此案处于早期阶段,预计证据开示将充满争议,尤其是涉及OpenAI的训练数据和内部通信。审判日期尚未确定,但法律专家预计此案可能需要数年才能解决,甚至可能上诉至最高法院。
合理使用论点
OpenAI的合理使用抗辩是其案件的核心。该公司辩称,训练AI模型类似于人类阅读书籍并从中学习,这不构成版权侵权。它还指出输出的变革性,即生成新文本而非复制现有作品。OpenAI引用了最高法院在Andy Warhol Foundation诉Goldsmith案中的裁决,该裁决澄清了变革性使用是合理使用分析的关键因素。然而,原告反驳称,AI训练中复制的规模是前所未有的,且OpenAI运营的商业性质不利于合理使用认定。他们还指出,OpenAI的模型能生成近乎逐字的摘录,这削弱了变革性的主张。
原告论点
原告认为,OpenAI对其作品的使用不属于合理使用,因为其具有商业性质并损害了其书籍的市场。他们声称,AI生成的内容可能替代人类创作的作品,减少对作者劳动的需求。他们还强调,OpenAI未寻求许可或提供补偿,尽管作者依赖版税维持生计。诉状详细列举了GPT-3和GPT-4生成书籍段落的实例,证明训练数据包含原告的作品。原告寻求每部作品最高15万美元的法定赔偿,若胜诉,潜在责任可达数十亿美元。
对AI与版权法的更广泛影响
此案的结果可能对人工智能行业产生深远影响。如果法院裁定OpenAI败诉,AI公司可能需为所有受版权保护的训练数据获得许可,这可能成本高昂并减缓创新。相反,若裁定OpenAI胜诉,可能使AI训练中使用受版权保护材料合法化,从而引发其他内容创作者的更多诉讼。此案还提出了是否需要新立法来解决AI与版权问题的疑问,因为现有法律并非为机器学习而设计。一些学者提议建立强制性许可制度,而另一些则主张为训练数据设立公共领域例外。
当前状态与未来展望
截至2024年底,此案仍在审理中。法院尚未对OpenAI的驳回动议作出裁决,双方正在进行初步动议。与此同时,OpenAI推出了一款工具,允许作者选择退出其书籍被用于训练,但原告认为这不足,因为将负担转嫁给了作者。此案可能受到类似案件裁决的影响,例如Silverman案中部分指控被驳回。法律分析人士认为,最高法院最终可能需要澄清合理使用在AI训练中的应用。Authors Guild对其立场表示信心,而OpenAI则誓言捍卫其做法。此案的解决将成为版权法与机器学习交汇处的里程碑时刻。