通用人工智能行为准则是一份由欧盟委员会于2025年发布的监管文件草案,旨在落实《欧盟人工智能法案》对通用人工智能(GPAI)模型提供者所规定的义务。该准则将高层级的立法要求转化为具体、可操作的措施,供开发和部署基础模型(包括大型语言模型及其他生成式人工智能系统)的公司遵循。它代表了欧盟在建立全球人工智能治理标准方面迈出的关键一步,力求在创新与基本权利保护之间取得平衡。
该准则通过一个多方利益相关者参与的过程制定,涉及行业代表、民间社会组织、学术界和独立专家。它围绕四个主要支柱展开:透明度与版权合规、风险识别与评估、内部风险管理,以及系统性风险评估与缓解。草案已发布以供公众咨询,最终版本预计将在纳入利益相关者和欧洲人工智能办公室的反馈后出台。
背景与法律依据
《欧盟人工智能法案》于2024年正式通过,引入了基于风险的人工智能系统监管框架。GPAI模型,即在大规模数据上训练并能执行广泛任务的模型,受该法案第51至56条规定的具体义务约束。这些义务包括提供技术文档、发布训练数据摘要,以及实施尊重欧盟版权法的政策。对于具有系统性风险的模型(即计算能力高或影响显著的模型),还适用额外要求,如对抗性测试和事件报告。
行为准则并非独立的法律文书,而是一份指导性文件,欧盟委员会打算将其用作合规基准。遵守该准则的提供者将被推定符合《人工智能法案》中关于GPAI的规定。这种“软法”方法旨在提供清晰性和灵活性,同时委员会通过欧洲标准化组织制定统一标准。
制定过程
2024年11月,欧洲人工智能办公室启动了起草该准则的咨询过程。成立了四个工作组,每个工作组专注于一个特定支柱。这些工作组包括来自OpenAI、Anthropic、Google DeepMind和Amazon Web Services等大型科技公司的代表,以及欧洲初创企业、Access Now等民间社会团体,和包括MIT CSAIL与Stanford AI Lab在内的学术机构。该过程由独立专家主持,包括计算机科学家Michael I. Jordan和法律学者玛丽耶特·沙克。
工作组在数月内通过线上和线下会议进行,产出了迭代草案。首份完整草案于2025年4月14日发布,随后进行了为期六周的公众评论期。共收到来自40个国家的500多份意见,反映了全球对欧盟人工智能监管的关注。最终版本计划于2025年底通过,并为提供者留出过渡期以调整其做法。
支柱一:透明度与版权
第一支柱要求GPAI提供者维护详细的技术文档,包括模型架构、训练数据来源和使用的计算资源。提供者必须按照《人工智能法案》第53条第1款(a)项的要求,发布足够详细的训练内容摘要。准则规定,该摘要应包含数据类别、语言和数据集来源的信息,同时尊重商业秘密。
版权合规是一个核心问题。准则要求提供者实施最先进的措施,以识别和尊重版权持有人表达的保留权利,例如使用机器可读的退出协议。它还要求提供者记录其遵守《欧盟数字单一市场版权指令》的政策,特别是关于文本和数据挖掘例外的部分。草案建议提供者应保留与版权相关投诉及其解决方式的记录。
支柱二:风险识别与评估
第二支柱侧重于识别和评估与GPAI模型相关风险的内部流程。提供者必须建立覆盖模型整个生命周期(从数据收集和训练到部署和上市后监测)的风险管理系统。准则建议采用基于NIST人工智能风险管理框架等现有框架的结构化方法,并根据欧盟背景进行调整。
具体风险类别包括偏见与歧视、隐私侵犯、安全故障,以及可能被滥用于虚假信息或网络攻击。提供者应进行红队演练和对抗性测试,特别是对于高能力模型。准则还要求记录风险评估方法,包括用于衡量偏见(如人口统计均等)和鲁棒性(如分布偏移下的性能)的指标。
支柱三:内部风险管理
第三支柱详述了治理和运营措施。提供者必须指定负责人工智能合规的个人或团队,并明确问责线。准则建议建立包括伦理学家和法律专家在内的多元化内部审查委员会,以监督风险决策。对员工进行人工智能安全和伦理培训也是强制要求。
技术措施包括实施Model Pruning等优化技术以减少意外行为,以及维护模型更新的版本控制和审计追踪。提供者还必须建立事件响应协议,包括在15天内向欧洲人工智能办公室报告严重事件的程序。准则强调Data Augmentation和Curriculum Learning作为提高模型鲁棒性和减少已知故障模式的方法的重要性。
支柱四:系统性风险评估与缓解
对于被认定具有系统性风险的模型(定义为每次训练运行需要超过10^25次浮点运算的模型),准则施加了额外义务。提供者必须使用标准化基准和压力测试进行全面评估,包括对网络攻击能力、化学或生物武器知识以及自主复制潜力的评估。草案引用了BAIR (Berkeley AI Research)和University of Oxford关于前沿人工智能风险评估的方法论。
缓解措施包括实施Reinforcement Learning from AI Feedback (RLAIF)(基于人工智能反馈的强化学习)和Gradient Clipping以稳定训练,以及部署Top-K Sampling和Temperature Scaling来控制生成行为。提供者还必须承诺与欧洲人工智能办公室分享安全发现,并在适当时与其他提供者分享。准则鼓励参与联合安全研究计划,如由Anthropic和Google DeepMind领导的计划。
行业反应与批评
草案准则收到了褒贬不一的反应。大型科技公司普遍欢迎其提供的清晰性,但对合规成本和过度监管的可能性表示担忧。OpenAI和Anthropic公开承诺满足准则要求,而Google Cloud和Microsoft Azure则指出需要国际协调以避免碎片化。欧洲初创企业,如AI21 Labs和Mistral AI,认为准则对文档的强调可能使资源有限的小型参与者处于不利地位。
民间社会组织赞扬了对透明度和版权的关注,但批评缺乏具有约束力的执行机制。一些学者,包括Melanie Mitchell和Aleksander Madry,质疑拟议风险评估的可行性,指出当前评估方法不足以预测涌现能力。独立咨询机构OpenPanel建议加强训练数据公开披露的规定,并进行更严格的第三方审计。
后续步骤与实施时间表
欧盟委员会计划在2025年12月前完成准则的定稿,纳入咨询反馈。一旦通过,该准则将于2026年8月2日生效,与《人工智能法案》中GPAI义务的一般适用日期一致。提供者将有六个月的过渡期来调整其做法,欧洲人工智能办公室将从2027年初开始进行合规检查。
该准则预计将影响欧盟以外的人工智能治理,加拿大和日本等司法管辖区已表示有兴趣采用类似框架。Artificial intelligence社区将密切关注其实施情况,特别是系统性风险阈值的应用方式,以及准则能否成功平衡创新与公共安全。截至2025年年中,最终文本仍可能有所变动,利益相关者继续参与规则制定过程。