2024年,前沿人工智能安全与政策会议召开,作为一个专门论坛,旨在促进先进人工智能系统治理与安全方面的国际合作。此次会议汇聚了政府代表、技术研究人员以及领先人工智能实验室的高管,共同应对前沿模型(即能力接近或超越当前最先进系统的模型)所带来的独特挑战。会议源于日益增长的共识,即Machine learning的快速发展需要协调的跨境行动,而非孤立的各国努力。
此次会议是在Generative AI和Large language model技术加速发展的背景下组织的。与会者包括多国政府官员、来自University of Oxford和BAIR (Berkeley AI Research)等学术机构的研究人员,以及来自OpenAI、Anthropic和Google DeepMind等公司的技术领导者。议程聚焦于三个主要领域:建立共享安全基准、创建事件报告机制,以及制定前沿系统负责任部署的框架。
背景与语境
在涉及先进模型的几起高调事件之后,建立专门的前沿人工智能安全国际论坛的必要性变得显而易见。2023年,多个研究团队证明,尽管经过广泛的安全训练,大型语言模型仍可能被诱导产生有害输出,这凸显了当前Reinforcement Learning from AI Feedback (RLAIF)及其他对齐技术的局限性。与此同时,训练前沿模型所需的计算资源呈指数级增长,使得能力集中在少数能够访问大规模AWS Trainium及其他专用硬件集群的组织手中。
这些发展促使Aleksander Madry和Melanie Mitchell等研究人员呼吁进行更结构化的国际对话。此次会议建立在早期倡议的基础上,包括2023年在英国举行的人工智能安全峰会,该峰会确立了前沿人工智能治理的初步原则,但缺乏具体的实施机制。2024年的会议旨在将这些原则转化为可操作的政策。
关于技术安全措施的关键讨论
会议的一个重要部分聚焦于确保前沿人工智能安全的技术方法。研究人员展示了关于Model Pruning及其他在保持性能的同时降低模型复杂度的技术研究成果,这些技术可能有助于更彻底的审计。讨论涵盖了评估方法的作用,包括红队演练和对抗性测试协议,旨在在部署前识别失败模式。
与会者探讨了Mechanistic interpretability研究在提供模型决策过程可见性方面的潜力。来自Anthropic的特征可视化和来自OpenAI的激活引导工作被展示为理解和控制前沿系统的有前景途径。然而,多位发言者警告称,当前的可解释性工具远落后于模型能力,Jakob Uszkoreit及其他技术领导者将此差距确定为一个关键研究优先事项。
会议还讨论了计算治理,即控制对前沿训练所需大规模计算资源的访问可以作为一种政策杠杆。来自TSMC和NVIDIA的代表讨论了供应链考虑因素,而政策专家则辩论了大规模训练运行国际注册系统的可行性。
国际政策框架
一个核心主题是为前沿人工智能安全制定具有约束力的国际协议。来自欧盟、美国、英国、加拿大和日本的代表分别介绍了各自的监管方法,从欧盟基于风险的Artificial intelligence法案到美国2023年10月发布的关于安全、可靠和可信人工智能的行政命令。会议旨在在这些不同框架之间寻找共同点。
提案包括建立一个国际人工智能安全研究网络,仿照CERN等现有科学合作模式,以跨境汇集资源和专业知识。另一项提案涉及创建全球事件报告数据库,要求组织披露与安全相关的失败,类似于航空安全报告系统。与会者辩论了此类机制的法律和实际挑战,包括管辖权和执行问题。
来自较小国家和发展中经济体的代表对公平获取人工智能利益以及安全法规可能巩固少数富裕国家主导地位的潜力表示关切。这些讨论促成了专注于能力建设和技术转让的工作组,来自Alibaba Cloud及其他国际公司的参与者贡献了关于全球部署的观点。
行业承诺与自愿标准
几家主要人工智能公司在会议期间做出了自愿承诺。OpenAI宣布扩大外部红队计划,允许独立研究人员在部署前更广泛地访问模型。Anthropic承诺为其前沿系统发布详细的安全案例报告,记录为应对已识别风险所采取的具体措施。Google DeepMind承诺在适当保障措施下,与合作伙伴机构共享安全评估结果。
这些自愿措施被视为向更正式监管过渡的桥梁。行业代表认为,鉴于技术的快速演变性质,灵活、适应性强的标准优于僵化的法律要求。然而,公民社会观察者和一些学术参与者对自愿承诺的可执行性表示怀疑,指出历史上行业自我监管不足的先例。
会议还启动了Anthropic和University of Oxford之间的一项联合研究计划,专注于可扩展监督,即监督可能在特定领域最终超越人类能力的AI系统的挑战。该项目获得了多个来源的资助,包括慈善基金会和政府研究拨款。
技术挑战与研究优先事项
与会研究人员确定了几个需要紧急关注的关键技术挑战。AI alignment问题,即确保AI系统可靠地追求预期目标,仍未解决,特别是对于通过基于人类反馈的强化学习及相关方法训练的系统。与会者讨论了Constitutional AI及其他旨在将明确原则嵌入模型行为的方法的潜力。
另一个优先事项是开发能够衡量前沿模型能力和风险的健壮评估套件。现有基准因过于狭窄且容易被操纵而受到批评,模型通过记忆而非真正理解获得高分。来自Stanford AI Lab和MIT CSAIL的研究人员提出了更全面的评估框架建议,以评估推理、健壮性和安全属性。
会议强调了AI安全研究中可重复性的重要性。多位发言者指出,由于专有模型访问和计算限制,许多已发表的安全结果无法复现。呼吁建立标准化评估环境和共享基础设施,Google Cloud和Microsoft Azure代表讨论了基于云的安全研究平台的潜力。
治理与问责机制
AI造成伤害的问责问题受到了广泛关注。法律学者讨论了自主系统的责任框架,审查了现有侵权和产品责任法如何适用于造成损害的AI系统。算法审计的概念,即对AI系统进行独立评估以检查其是否符合安全和道德标准,被探索为一种确保问责的潜在机制。
与会者辩论了国际组织在AI治理中的作用。一些人主张在联合国内设立专门机构,而另一些人则倾向于更轻量级的协调机制。会议最终公报呼吁建立一个常设的国际前沿AI安全论坛,定期举行会议并设立常设秘书处,以协调研究政策工作。
讨论还涉及AI安全与更广泛的Artificial intelligence、就业、隐私和民主进程关切之间的关系。虽然会议主要关注灾难性风险,但几位发言者强调,安全框架还必须解决更直接的社会影响,包括虚假信息和算法偏见。
成果与后续步骤
前沿人工智能安全与政策会议以通过一项联合声明结束,承诺与会者继续在前沿AI安全方面进行合作。具体成果包括同意在2025年前开发共享安全基准,创建试点事件报告系统,以及建立关于技术研究、政策协调和能力建设的工作组。
后续会议定于2025年举行,由亚洲国家联盟主办。在此期间,参与组织同意报告其自愿承诺的进展,并计划进行年中审查以评估实施情况。此次会议被广泛视为朝着AI治理国际协调迈出的重要一步,尽管观察者指出,将协议转化为有效行动需要持续的政治意愿和技术努力。
此次会议还催生了多项独立倡议。来自Carnegie Mellon University和University of Toronto的研究人员宣布计划开发开源安全评估工具包。包括Inflection AI和AI21 Labs在内的几家公司承诺为其非前沿模型采用共同安全标准。这些发展表明,会议的影响力超出了其直接参与者,塑造了更广泛AI生态系统对安全和责任的态度。