作者协会诉OpenAI案

译自英文

作者协会诉OpenAI案是2023年由作者协会及知名作家对OpenAI提起的集体诉讼,指控其在未经许可的情况下,使用其作品训练大型语言模型,构成版权侵权。

Authors Guild诉OpenAI案是一项集体诉讼,于2023年9月20日在美国纽约南区联邦地区法院提起。该诉讼由Authors Guild及一群知名小说和非小说类作家提起,指控OpenAI(ChatGPT背后大型语言模型的开发者)未经授权使用其书籍训练生成式AI系统,侵犯了他们的版权。此案是针对AI公司数据实践的多起高调法律挑战之一,引发了关于合理使用、作者身份以及机器学习时代创造性劳动经济学的根本性问题。

原告包括美国最大的作家专业组织Authors Guild,以及约翰·格里森姆、乔治·R·R·马丁、朱迪·皮考特和大卫·巴达奇等个人作者。他们的诉状声称,OpenAI将其作品整体复制到模型训练数据集中,随后模型生成的文本能够模仿或总结这些作品,在市场上与原作竞争。该诉讼寻求法定赔偿、禁令救济,并声明OpenAI未经同意或补偿使用受版权保护的材料违反了1976年《版权法》。

背景:大型语言模型的兴起

OpenAI成立于2015年,最初是一家非营利研究组织,于2019年转为利润上限结构,以获取大规模计算资源的资金。其旗舰产品ChatGPT于2022年11月向公众发布,成为历史上增长最快的消费应用之一,两个月内月活跃用户超过1亿。底层技术基于Transformer架构,该架构在2017年由谷歌研究人员发表的一篇论文中提出,使得在大量文本数据上进行高效训练成为可能。

训练大型语言模型需要向其输入来自各种来源的数十亿词汇,包括书籍、文章、网站和其他书面材料。OpenAI尚未公开其训练数据集的完整内容,但该公司已承认在其早期模型(如GPT-2和GPT-3)中使用了包括书籍在内的互联网公开文本。规模巨大:2020年发布的GPT-3使用了数千亿个token进行训练,token是文本单位,大致相当于一个词或词的一部分。

原告认为,书籍是独特的宝贵训练数据,因为它们包含高质量的长篇散文,有助于模型学习语法、推理和叙事结构。然而,他们声称未经许可使用受版权保护的书籍并非变革性合理使用,而是对作者劳动的商业剥削。因此,此案处于版权法与机器学习技术的交汇点,后者通过深度学习神经网络等技术迅速发展。

法律主张与论点

诉状主张多项诉讼原因,包括直接版权侵权、间接侵权和不当得利。原告声称,OpenAI的训练过程必然涉及未经授权复制其作品,既在训练数据集的创建中,也在模型生成与原文高度相似的文本的能力中。他们还声称,OpenAI对其作品的使用削弱了书籍的市场,因为读者现在可以免费获得AI生成的摘要或模仿内容。

OpenAI可能的辩护重点在于合理使用原则,该原则允许在批评、评论、新闻报道、教学和研究等目的下有限使用受版权保护的材料。该公司在其他场合辩称,在公开文本上训练AI模型是一种变革性使用,不会替代原作。然而,原告反驳称,OpenAI的使用是商业性的、非变革性的,并对其作品市场造成损害,指出该公司估值在2024年初超过800亿美元。

此案由法官Sidney H. Stein审理,他还主持了2023年12月《纽约时报》对OpenAI和微软提起的相关诉讼。Authors Guild案已与其他类似诉讼部分合并,包括作家莎拉·西尔弗曼、理查德·卡德雷和克里斯托弗·戈尔登提起的诉讼,但合并是部分且程序性的。一个关键的早期裁决出现在2023年11月,当时Stein法官以缺乏诉讼资格为由驳回了西尔弗曼案中的部分主张,但允许其他主张继续审理,表明法院愿意处理实质性版权问题。

更广泛的诉讼格局

Authors Guild诉OpenAI案是针对AI公司的诉讼浪潮的一部分。除了《纽约时报》案(指控OpenAI及其合作伙伴微软使用数百万篇受版权保护的文章训练模型)外,其他作者也对Anthropic(Claude模型的制造商)和Google DeepMind提起了诉讼。这些案件受到科技行业、出版界和法律学者的密切关注,因为其结果可能为AI公司如何获取和使用训练数据设定先例。

一个值得注意的进展发生在2024年7月,美国版权局发布了一份关于版权和AI的报告,建议国会考虑新立法以解决AI训练中使用受版权保护作品的问题。该报告未对合理使用采取明确立场,但强调需要明确性,并建议现有法律可能无法充分保护作者。这种监管不确定性促使一些AI公司与内容提供商达成许可协议,例如OpenAI与阿克塞尔·斯普林格和美联社等新闻机构的协议,但这些协议并未覆盖绝大多数作者。

Authors Guild还积极倡导集体许可机制,类似于音乐出版商和词曲作者使用的机制。2024年,该公会提出一个框架,AI公司需支付订阅费以使用受版权保护的作品,收入根据使用情况分配给作者。该提案在政策圈获得一定关注,但截至2025年初尚未被任何主要AI公司采纳。

关键程序里程碑

初次提交后,案件经历了多个程序阶段。2023年10月,OpenAI提出驳回动议,辩称原告未充分主张直接侵权,因为训练过程涉及不向公众分发的中介副本。该公司还声称,原告缺乏诉讼资格,因为他们未在美国版权局注册所有作品,这是提起侵权诉讼的前提条件。

Stein法官于2024年2月部分裁定该动议,允许大多数主张继续审理,但以技术理由驳回部分主张。他认为,原告合理主张了OpenAI的训练过程涉及复制,而合理使用辩护更适合在即决判决或审判阶段处理,而非驳回动议。这一裁决被视为作者的胜利,因为它保留了核心主张。

2024年6月,双方进入证据开示阶段,原告要求获取OpenAI训练数据集的详细信息,而该公司以商业秘密为由拒绝。一名治安法官命令OpenAI提供某些文件,但开示范围仍存在争议。案件定于2025年3月举行审前会议,潜在审判日期可能在2025年底或2026年,尽管此类时间表在复杂诉讼中经常延长。

对作者和AI发展的影响

Authors Guild诉OpenAI案的结果可能对文学界和AI行业产生深远影响。如果原告胜诉,OpenAI和其他AI公司可能被要求为训练中使用的每部受版权保护作品获得许可,这一过程在后勤上可能具有挑战性且财务负担沉重。这可能会减缓大型语言模型的发展,特别是对缺乏与数千名权利人谈判资源的小型公司和研究机构而言。

相反,支持OpenAI的裁决将确认合理使用原则适用于AI训练,可能允许公司继续无偿使用受版权保护的文本。这样的决定可能鼓励更积极的数据收集,并可能导致AI行业进一步整合,因为只有最大的参与者才能负担诉讼和和解费用。

对作者而言,此案不仅仅是金钱问题。它提出了在机器能生成模仿人类创造力的文本时代,作者身份的本质问题。一些作家将AI视为工具,而另一些则视其为对其生计的生存威胁。Authors Guild将诉讼定位为对职业的捍卫,认为作家应因其作品对AI系统的贡献而获得补偿。

此案还与关于OpenAI商业实践及其与创意社区关系的更广泛辩论相交。2023年,OpenAI启动了一项计划,向一些作者支付其作品在训练中的使用费用,但条款被广泛批评为不足。该公司还因训练数据缺乏透明度而受到批评,这一关切是诉讼的核心。

专家意见与学术辩论

法律学者对可能的结果存在分歧。一些人,如加州大学伯克利分校的Pamela Samuelson教授,认为在受版权保护作品上训练AI应被视为合理使用,类比搜索引擎和其他为变革性目的复制文本的技术。其他人,如康奈尔大学的James Grimmelmann教授,则认为AI训练的规模和商业性质可能使天平倾向于作者,特别是如果模型能生成与原作竞争的输出。

此案也引起了经济学家的关注,他们指出训练数据的价值巨大。2023年一项研究估计,一本高质量书籍用于AI训练的市场价值可能达数千美元,因为多样化、文笔良好的文本对提升模型性能至关重要。这导致一些人认为,作者实际上在补贴AI行业,却未分享利润。

结论与展望

截至2025年初,Authors Guild诉OpenAI案仍处于证据开示阶段,尚未对案情作出最终裁决。此案可能需要数年才能解决,无论结果如何,向美国第二巡回上诉法院上诉的可能性很大。最高法院最终可能介入,正如其在涉及新技术的其他版权案件中所做的那样,例如2021年谷歌诉甲骨文案的裁决,该案认定谷歌使用Java代码属于合理使用。

与此同时,此案已产生影响。它促使其他作者和出版商提起自己的诉讼,并加速了自愿许可框架的制定。它还促进了关于AI伦理、创作者权利以及数字时代知识产权未来的更广泛公共讨论。无论最终判决如何,Authors Guild诉OpenAI案很可能被视为人工智能和版权法历史上的里程碑案件。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:copyright-law·artificial-intelligence·class-action·openai
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史