AI与版权是指由生成式人工智能系统引发的一系列法律和政策问题,这些系统基于受版权保护的文本、图像、音频和视频进行训练,并根据提示生成新内容。辩论中主导着两个独立的问题:未经许可将受版权保护的作品用作训练数据是否构成侵权,以及生成模型的输出本身能否享有版权,以及由谁享有。截至2020年代中期,这两个问题在各司法管辖区均未得到统一解决,答案正通过诉讼、立法以及AI开发者与权利持有人之间达成的自愿许可协议逐步明确。
训练数据诉讼
自2022年以来,作者、视觉艺术家、音乐唱片公司和新闻机构对AI开发者提起了多起诉讼,涉及他们在训练语料库中使用其作品的问题。Getty Images起诉了Stability AI,指控其抓取图像用于Stable Diffusion;一群视觉艺术家对Stability AI、Midjourney和DeviantArt提起了类似诉讼;喜剧演员莎拉·西尔弗曼及其他作者起诉了OpenAI和Meta AI,声称他们的书籍未经许可被使用,在某些情况下可追溯至影子图书馆数据集。由主要唱片公司根据RIAA提起的针对音乐生成初创公司Suno和Udio的诉讼,也提出了关于受版权保护录音的类似主张。最受关注的案件是2023年12月提起的《纽约时报》诉OpenAI和Microsoft (AI)案,该案主张ChatGPT几乎逐字复制《纽约时报》文章,这既侵犯了版权,也分流了原始来源的读者;该案至2025年仍在诉讼中。AI公司通常在美国将基于受版权材料进行训练辩护为合理使用,认为该过程具有变革性,但该原则尚未在大多数此类诉讼的上诉层面针对生成式AI进行专门检验,法院在较窄问题上(如使用盗版副本进行训练是否剥夺合理使用抗辩)已作出初步裁决,结果不一。
输出所有权
另一条争议线涉及AI生成输出是否完全可享有版权。美国版权局认为版权保护要求人类作者身份,并多次拒绝注册人类输入极少的作品,尤其是在完全由AI生成图像的案例中。当人类有意义地选择、安排或编辑AI辅助输出时,版权局允许部分注册,涵盖人类创作的元素。这为商业使用的文本到图像和文本到视频输出留下了大片灰色地带,生产此类内容的公司通常被建议记录所涉及的人类创造性贡献。
许可协议
在诉讼之外,几家出版商和平台已与AI开发者达成直接许可协议,而非提起诉讼。OpenAI与包括美联社、阿克塞尔·斯普林格和新闻集团在内的新闻机构,以及Shutterstock等图像库签署了内容许可协议;谷歌也与几家出版商达成了类似安排。这些协议通常支付费用以获得对许可档案进行训练或展示片段的权利,并已成为大型、资源充足的权利持有人偏好的诉讼替代方案,即使缺乏同等议价能力的小型创作者仍继续依赖法院。
展望
AI与版权问题尚未解决的状态已成为AI治理辩论中的反复出现的议题,欧盟AI法案要求对受版权保护的训练材料进行一定披露,多个国家的立法机构正在考虑为创作者制定退出机制或补偿方案。另请参阅关于AI版权诉讼的文章,以获取个别案件的更详细说明。