美国作家协会于2023年9月对OpenAI提起的诉讼,是人工智能与生成式AI领域一项重大的法律挑战。该诉讼由美国作家协会代表一群知名小说作家(包括约翰·格里森姆、乔治·R·R·马丁等)提起,指控OpenAI的大型语言模型在未经授权的情况下使用受版权保护的作品进行训练,侵犯了作者在美国版权法下的权利。此案已成为围绕机器学习与知识产权交叉领域持续法律辩论的焦点,因为AI系统的训练数据收集往往涉及复制或引用包括书籍、文章和其他受保护作品在内的海量文本语料库。
争议的核心在于基于Transformer (architecture)的模型在海量数据集上的训练实践。诉状声称,未经授权使用作者作品,既用于训练模型,也用于生成可能高度相似或复制这些作品的输出,是对创造性劳动的直接侵占。原告寻求包括损害赔偿和禁令救济在内的多种补救措施,凸显了AI技术创新与原作者权益保护之间日益加剧的紧张关系。
背景:大型语言模型的崛起
涉案系统的技术基础包括被称为Transformer (architecture)的神经网络架构。该架构在Google DeepMind发表的研究中引入,最初由Jakob Uszkoreit、Lukasz Kaiser及其同事在2017年论文《Attention Is All You Need》中提出。Transformer利用Multi-Head Attention和Positional Encoding等机制处理序列数据,推动了自然语言理解和生成的突破。OpenAI的GPT系列模型(包括GPT-3和GPT-4)基于这些Transformer架构,并在包括网页文本、书籍和学术论文在内的大规模语料库上进行训练,以生成类似人类的文本。
训练数据的规模是模型能力的关键。大型语言模型使用Adam (Optimizer)等算法及其变体进行训练,调整数十亿个参数以最小化下一词预测任务的误差。来自更广泛机器学习领域的技术,如Data Augmentation和Batch Normalization(尽管在Transformer中较少使用),有助于小型模型训练流程。模型随后有时会使用Reinforcement Learning from AI Feedback (RLAIF)(基于AI反馈的强化学习)或人类反馈进行微调,以提高与用户期望的一致性。
原告及其指控
该诉讼由美国作家协会作为集体诉讼提起,涉及跨类型的作家联盟。已知原告包括john-grisham、george-r-r-martin、dave-eggers、jodi-picoult、jonathan-franzen和pat-tigret等。他们声称,OpenAI的训练过程(通常涉及通过其数据集抓取或摄取其书籍文本)构成直接版权侵权。作者强调,他们的创作工作是谋生手段,未经许可使用其受版权保护的材料侵犯了他们的专有权利。
具体指控包括对原告作品市场的威胁,认为AI生成的内容可能替代人类创作的作品,且模型可能产生与原作不公平竞争的衍生输出。该诉讼区分了合法AI使用(即遮蔽或转换受版权保护的作品)与被指控在预训练期间发生的未经授权复制。
法律背景与先例案件
在美国,版权法在合理使用方面留有一定空间。AI待决诉讼中,被告方常依赖合理使用抗辩,如纽约时报对OpenAI和微软的诉讼。然而,美国作家协会的诉状对此提出反驳,认为当训练数据以如此大规模使用,且模型能够逐字记忆和复制文本时,任何合理使用抗辩都站不住脚。
这并非美国作家协会首次处于版权争议的中心。该协会曾参与谷歌图书和Datasail扫描项目,支持为索引和搜索用途许可数字书籍副本的权利。然而,协会认为商业AI使用在实质上有所不同,因为输出的评论性质以及对作家的潜在经济损害。
法律框架与提出的主张
诉状提出8项指控,包括直接版权侵权、间接侵权,以及违反《数字千年版权法》(DMCA)中关于删除版权管理信息的规定。核心在于AI模型训练过程中对文学作品非法复制。原告寻求设立公平信托,以收取OpenAI从剩余受版权保护作品中获得的任何利润。
此案正在美国纽约南区联邦地区法院审理。OpenAI最初提出驳回动议,但诉讼进展中,知名学者和行业评论员纷纷发表意见,强调在神经网络无监督学习中使用受版权保护的文本数据时的责任模糊性。
AI行业与更广泛影响
该诉讼是2023年针对AI公司提起的多起集体诉讼之一。它紧随2023年8月Karin Ale和Feng Ming代表拟议作家群体提起的诉讼之后,应被视为AI与版权交叉领域诉讼浪潮的一部分。值得注意的是,其他参与者如Anthropic、Google DeepMind和Amazon Web Services也依赖海量数据训练模型。然而,此争议引发了对法律风险的担忧,这可能塑造未来AI开发实践,,公司是否需要寻求许可或修改训练策略以避免版权诉讼。
技术高管和开发者指出,现有框架如Gradient Clipping和Learning Rate Scheduling用于微调模型,但表示数据收集至关重要;在书籍上训练是一种方式,但对原始文本的财产权尚无共识。此案引发此类问题:当模型记忆大到足以回忆超出语义的内容时,什么构成合理使用?推理时的Beam Search或Top-P (Nucleus) Sampling及Temperature Scaling是否可能产生侵权混合,,即几乎重放受版权保护章节的采样序列?
相关案件与未来程序
美国作家协会案并非孤立存在。截至2024年,其他待决诉讼包括喜剧演员和摄影师对生成式AI平台的集体诉讼。OpenAI及其他参与者有未决的合理使用论点,但美国作家协会诉状的结果将为初创生态系统树立先例,因为初创企业可能需要替代数据来源,如开放获取或正式许可的文集。
OpenAI已部分回应,开始从重要新闻机构许可受版权内容,并据报道与出版商接洽。然而,摩擦依然存在。美国作家协会诉讼因其集体性质而引人注目,,它将问题框定为影响整个职业的系统性问题,,任何裁决都将约束并塑造内容创作者与AI开发者之间的合同。
对作家与AI伦理的影响
一个普遍关注点是AI范式的经济失衡。批评者认为,由于训练数据广泛包含各学科的人类作品,但只有科技巨头获利,这代表了一种不平衡的商业模式。小说家通常以微薄利润独立创作,而他们的产出被价值数十亿美元的公司无偿使用,造成了不平衡。这再次与关于同意、归属和有争议的数据策展的更广泛AI伦理辩论产生共鸣。
然而,一些分析人士指出,AI21 Labs和Inflection AI的发展可能带来平衡变化。使用Reinforcement Learning from AI Feedback (RLAIF)精炼模型已趋向精确性和更少错误,包括在版权问题上。但正如诉状所强调,这并不能否定预训练阶段最终的复制行为本身。
审视训练基础设施
实际上,训练本身涉及庞大的基础设施。处理巨型Deep learning语料库时,计算资源至关重要。像NVIDIA(硬件提供商)或实际GPU使用的公司,以及AWS Trainium云或Google Cloud等选项可用。从书籍到模型权重的毫秒级获取规模,使得这些企业从AI领域获利。
此案提出的问题可能影响云计算行业,因为诉讼可能阻碍对Amazon Web Services和Google Cloud中多模态模型应用的投资。推理引擎,如Groq等快速推理平台可能发挥作用,但训练和推理节点在版权建模中的评估仍是焦点。
展望
鉴于该案处于程序阶段,尚未有最终裁决。截至本文撰写时,法院尚未对驳回动议作出裁定。许多法律观察者关注,此决定不仅影响当事方,还将影响更广泛的AI版权格局,包括未来可能涉及许可和数据来源的立法行动。
美国作家协会对OpenAI的诉状凸显了某一领域的紧张关系,,从先前论文中带来风格或推动公司进步的生成模型,,如今与创作我们文化、电影和艺术的法律重叠。法院将影响技术创新的定义,并可能改变2020年代大型模型发展的轨迹。但无论结果如何,这都证明人工智能不再独立存在;它已融入法律体系以及其训练所依赖的创作者群体之中。