美国版权局关于训练数据

译自英文

美国版权局审查了版权作品在人工智能训练中的使用方式,并于2024-2025年发布了相关调查结果,这些结果为关于生成式人工智能与版权法的政策辩论提供了参考。

美国版权局(USCO)是国会图书馆的一个下属单位,已对在训练人工智能系统中使用受版权保护作品的情况进行了审查。其调查结果自2024年起以一系列报告形式发布,探讨了现有版权法是否以及如何适用于机器学习模型(包括大型语言模型和其他生成式人工智能工具)对受保护材料的摄取。该局的分析已成为立法和司法讨论中关于人工智能与知识产权的参考点。

版权局在这一领域的角色源于其更广泛的职责,即管理美国版权法并为国会提供建议。作为立法部门的一部分,它不执行版权法,但提供政策建议并登记权利主张。其关于人工智能训练数据的报告基于公众意见、专家证词和国际比较,旨在澄清法律环境,除非国会要求,否则不提出新的立法建议。

背景:版权与人工智能训练

训练人工智能模型通常涉及将大量文本、图像或其他作品的数据集输入神经网络变换器架构。这一过程称为机器学习,使模型能够识别模式并生成新输出。数据集通常包含受版权保护的书籍、文章、照片和艺术品,引发关于此类使用是否构成侵权或属于合理使用等例外情况的问题。

在USCO介入之前,法院已开始在涉及OpenAIAnthropic等公司的案件中处理这些问题,但尚未形成统一标准。版权局的报告旨在提供法律原则和实际影响的全面概述,帮助指导政策制定者和利益相关者。

2023年调查通知

2023年8月,版权局在《联邦公报》上发布了一份调查通知,征求关于版权与人工智能的公众意见,特别关注训练数据。调查询问了人工智能训练的性质、受版权保护作品的使用程度,以及支持和反对责任的法律论点。提交了超过10,000条意见,来自个人、公司、学术机构和倡导团体,反映了这一问题的高风险性。

该局还与利益相关者举行了听证会,包括创作者、技术公司和法律专家。这些会议凸显了分歧观点:一些人认为在未经许可的情况下使用受版权保护作品进行训练是变革性的合理使用,而另一些人则认为这需要许可或补偿。这些意见和会议为后续报告提供了信息。

2024年报告:版权与人工智能

2024年3月,版权局发布了其报告的第一部分,题为“版权与人工智能”,重点关注数字复制品和训练中使用受版权保护作品的问题。报告得出结论,现有版权法,特别是合理使用原则,可以适用于人工智能训练,但拒绝支持全面豁免或新的强制许可。相反,它强调逐案分析,考虑使用目的、受版权保护作品的性质、使用数量以及对市场的影响等因素。

报告指出,深度学习过程通常涉及将完整作品复制到训练数据集中,这可能不利于合理使用,但也承认人工智能输出的变革性可能支持抗辩。该局建议国会监测发展,并在必要时考虑有针对性的立法,但未提出具体的法定修改。

关于训练数据的关键发现

报告关于训练数据的关键发现包括:

  • 摄取作为复制:训练人工智能模型通常涉及制作作品副本,这涉及版权法下的复制权。
  • 合理使用并非自动适用:该局驳回了人工智能训练本质上属于合理使用的论点,强调每个案件必须根据事实进行评估。
  • 市场影响:报告考虑了人工智能训练是否损害或有利于原创作品的市场,指出这一因素经常存在争议。
  • 透明度和来源:该局鼓励自愿披露训练数据来源,但未强制要求,理由是实际挑战。

这些发现已在正在进行的诉讼中被引用,例如作者对人工智能公司提起的诉讼,以及关于人工智能政策的国会听证会。

2025年更新和持续工作

2025年初,版权局发布了一份后续报告,涉及数字复制品及其与州宣传权的交叉问题。它还宣布计划审查人工智能的其他方面,包括人工智能生成输出的可版权性。该局的工作因领导层争议而复杂化:2025年5月,总统唐纳德·特朗普声称已解雇注册官希拉·珀尔马特,但该职位是国会雇员,珀尔马特的权力已在法院得到维持。这种不确定性引发了对该局人工智能举措连续性的质疑。

尽管存在争议,该局继续发布指导并参与国际讨论,例如在世界知识产权组织的讨论。其报告仍然是理解美国版权法如何适用于人工智能训练的关键资源。

对行业和政策的启示

USCO的发现对人工智能开发者、内容创作者和政策制定者具有重大影响。对于OpenAIAnthropicGoogle DeepMind等公司,报告澄清它们不能假设合理使用保护,可能增加对许可协议或训练实践变化的需求。对于创作者,报告确认其作品受到保护,但也强调了在模糊训练过程中执行权利的困难。

在立法方面,报告为拟议法案提供了信息,例如《生成式人工智能版权披露法案》,该法案将要求人工智能公司披露其训练数据。版权局未支持这一具体法案,但支持将透明度作为政策目标的想法。

批评与辩论

版权局的方法面临双方的批评。一些技术倡导者认为报告过于谨慎,可能抑制创新,而一些创作者团体则认为它们在保护权利方面不够深入。法律学者也对合理使用的解释进行了辩论,一些人认为逐案方法对于人工智能训练的规模来说不切实际。

另一个争议点是版权局自身的角色。作为国会图书馆的一部分,它在立法部门内运作,但其咨询角色对法院没有约束力。报告具有影响力,但不具有法律效力,法院可能得出不同结论。

未来方向

展望未来,版权局预计将继续其人工智能工作,包括关于可版权性和潜在立法建议的进一步报告。领导层争议的结果可能影响该局的优先事项,但其向国会提供建议的职责保持不变。随着人工智能技术的发展,该局可能会重新审视其发现,以应对新挑战,例如合成数据的使用以及人工智能对创意产业的影响。

目前,USCO关于训练数据的报告为应对版权与人工智能的复杂交叉提供了基础框架。它们强调需要一种平衡的方法,既尊重创新又尊重创作者的权利,这一目标需要所有利益相关者之间的持续对话。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:copyright·artificial-intelligence·policy·us-copyright-office
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史