Getty Images(英国)于2023年1月在英格兰和威尔士高等法院对Stability AI提起法律诉讼,指控该公司的Stable Diffusion模型在未经授权的情况下使用了数百万张受版权保护的照片进行训练。该案件正式名称为Getty Images(英国)有限公司等诉Stability AI有限公司案,成为英国首批检验版权法如何适用于生成式人工智能系统的重大诉讼之一。Getty寻求损害赔偿和禁令,以阻止其图像被进一步用于训练数据,并主张Stability AI对其网站和数据库的抓取行为侵犯了英国法律规定的版权和数据库权利。
该争议源于Stability AI开发的Stable Diffusion,这是一种根据文本提示生成图像的深度学习模型。Stability AI成立于2020年,总部位于伦敦,于2022年8月发布了Stable Diffusion。该模型基于一个名为LAION-5B的大型数据集进行训练,该数据集包含从互联网抓取的数十亿个图像-文本对,其中包括许多托管在Getty平台上的图像。Getty认为,这种抓取及后续使用构成了对其受保护作品的未经授权复制和向公众传播。Stability AI辩称,训练过程涉及变革性使用,且模型并未直接存储或复制单个图像,而是学习了统计模式。
该高等法院案件在2023年和2024年经历了多个程序阶段。2023年7月,法院驳回了Stability AI关于驳回Getty部分索赔的申请,允许案件进入全面审理。法院认为,Getty就版权侵权提出了可论证的索赔,特别是关于训练期间图像的复制以及模型可能输出与源图像几乎相同副本的问题。2024年初的一次案件管理会议将审理日期定在2025年底,双方均参与了大量技术文件和训练数据日志的披露。
法律主张与抗辩
Getty的主要主张基于1988年《版权、外观设计和专利法》下的复制权。该公司认为,Stability AI的训练过程必然涉及将图像复制到模型参数中,即使这些副本无法直接访问。Getty还援引了英国的数据库权利,该权利保护在汇编数据方面的实质性投资。Stability AI反驳称,LAION数据集是公开可用的,训练过程类似于人类观看图像以学习艺术风格。该公司进一步辩称,任何侵权行为都是短暂和附带的,属于临时复制例外。
2023年7月由Birss法官作出的裁决处理了若干初步问题。Birss认为,Getty的索赔并非明显注定失败,并指出训练是否构成侵权的问题应由全面审理决定。他还允许Getty修改其索赔,加入关于模型能够生成与特定照片高度相似图像的指控,这一点可能加强侵权案件。Stability AI关于模型是基于从第三方合法获取的数据进行训练的抗辩被认为不足以在早期阶段解决该索赔。
案件的技术层面
该案件要求法院理解Stable Diffusion等神经网络模型的运作方式。Stability AI的技术专家解释说,训练涉及将数百万张图像输入U-Net架构,该架构学习将随机噪声去噪为连贯图像。模型存储的是权重(数值),这些数值编码统计关系,而非逐像素的副本。然而,Getty的专家认为,该模型可以记忆并再现特定的训练图像,尤其是在某些文本提示下。这种记忆现象在关于大型语言模型和图像生成器的学术研究中已有记录,成为核心事实争议。
LAION-5B数据集由非营利组织LAION创建,通过爬取网页并提取图像URL和替代文本而汇编而成。Stability AI使用该数据集的过滤子集来训练Stable Diffusion。Getty的图像出现在数据集中,因为许多网站未经授权嵌入了Getty的照片。该案件提出了Stability AI是否有义务核实数据集中图像的版权状态,还是可以依赖数据集的公开可用性的问题。法院听取了关于抓取规模的证据,Getty估计其超过1200万张图像被包含在训练数据中。
程序历史与关键裁决
在2023年7月的驳回申请失败后,案件进入披露阶段。2023年11月,法院命令Stability AI提供详细的训练数据日志,包括使用的具体图像和抓取日期。Stability AI最初以商业机密为由拒绝,但法院裁定,透明度对于Getty评估其索赔是必要的。2024年2月,另一次听证会处理了关于AI模型行为专家证据的可采性问题。法院允许双方提交来自计算机科学家的专家报告,包括机器学习和版权法专家。
2024年4月出现了一个重大进展,法院允许Getty增加对Stability AI用户的间接侵权索赔。该索赔指控使用Stable Diffusion生成图像的个人通过创作衍生作品侵犯了版权。Stability AI辩称,其用户不承担责任,因为模型并未复制受保护的表达。然而,法院认为这是一个可审理的问题,特别是考虑到有证据表明一些用户生成了与著名照片高度相似的图像。该案件与针对Stability AI母公司(在英国注册的Stability AI有限公司)的相关索赔合并审理。
行业与政策背景
该诉讼是在全球范围内关于AI训练数据诉讼的背景下展开的。在美国,Getty于2023年2月在特拉华州地区法院对Stability AI提起了单独的诉讼,该案后来被转移到加利福尼亚北区。英国案件被视为对欧洲版权法的检验,因为英国尚未采纳欧盟2019年《数字单一市场版权指令》,该指令包含文本和数据挖掘例外。英国政府曾考虑引入类似例外,但在2023年因创意产业的压力而搁置了相关计划。Getty案件的结果可能影响英国是否采取更宽松或更严格的AI训练方法。
该案件还引起了人们对生成式人工智能公司更广泛生态系统的关注。Stability AI是包括OpenAI和Anthropic在内的多家因训练数据而面临诉讼的公司之一。在英国,该案件受到出版商、摄影师和技术公司的密切关注。人工智能行业认为,过于严格的版权规则将扼杀创新,而创意专业人士则认为AI公司正在从未经许可使用其作品中获利。法院的最终裁决可能为英国法院如何在AI背景下解释版权树立先例,可能影响未来涉及Google DeepMind或其他英国AI开发者的案件。
专家证人与技术证据
定于2025年底进行的审理预计将有顶尖计算机科学家的证词。Getty计划召集计算机视觉和深度学习专家,以证明Stable Diffusion的架构如何能够记忆训练图像。Stability AI则打算依赖专家论证模型的输出是新颖创作而非副本。法院还收到了关于数据增强技术和模型剪枝在减少记忆方面有效性的证据。双方均委托进行了研究,以测试通过使用其替代文本描述提示模型,能否再现特定的Getty图像。
一个关键的技术问题是训练过程是否构成英国法律下的“向公众传播”。Getty认为,通过在线提供模型,Stability AI将其图像中嵌入的副本传播给了用户。Stability AI回应称,模型并不直接传输图像,而是基于学习到的模式生成新图像。法院对此问题的处理可能对Transformer模型在版权法下的待遇产生影响。该案件还涉及位置编码和多头注意力在模型将文本与视觉特征关联中的作用,尽管这些技术细节相对于核心法律问题而言是次要的。
可能的结果与影响
如果Getty胜诉,法院可能发出禁令,要求Stability AI从其训练数据中移除所有Getty图像,鉴于模型权重中不包含可识别的副本,这是一项技术上具有挑战性的任务。或者,法院可以根据使用的侵权图像数量判给损害赔偿,Getty估计这一数字超过1200万。在2023年和2024年面临财务困难的Stability AI可能难以支付巨额赔偿。如果Stability AI胜诉,将明确基于公开可用数据进行训练不侵犯版权,可能鼓励英国更多的AI开发。
案件结果还可能影响关于AI监管的公开讨论。英国政府最初采取了支持创新的立场,但该诉讼凸显了制定更清晰规则的必要性。2024年,英国知识产权局发布了关于AI和版权的非约束性指南,但高等法院的裁决将具有更大的分量。该案件也受到国际机构的关注,包括自2020年以来一直在讨论AI和版权的世界知识产权组织。截至2025年初,该案件仍在审理中,双方都在为庭审做准备。法院的判决无论何时作出,都可能被上诉,这意味着最终解决可能需要数年时间。
相关诉讼与全球影响
英国案件是针对Stability AI的多项法律行动之一。除了美国的诉讼外,该公司还在德国和日本面临索赔。英国诉讼被认为特别重要,因为英国是AI研究的主要中心,牛津大学和多伦多大学等机构为该领域做出了贡献。该案件还与关于OpenAI和Anthropic使用训练数据的争论相交织,尽管这些公司不是英国诉讼的当事方。法院在技术问题上的推理,例如模型权重是否构成副本,可能影响其他司法管辖区如何处理类似问题。
该案件凸显了生成式人工智能创新与知识产权之间的紧张关系。Stability AI辩称,其模型是一种创意工具,使用户能够生成新的艺术作品。Getty反驳称,该工具是建立在摄影师的未经授权劳动之上的。高等法院的角色是解释现行法律,而非制定政策,但其裁决将不可避免地塑造监管格局。随着庭审临近,双方继续完善各自的论点,法律费用估计超过1000万英镑。该案件成为英国人工智能与版权法之间不断演变关系的里程碑。