英国AI安全研究涵盖英国政府机构、大学和私人实验室的协调活动,旨在理解和减轻先进Artificial intelligence系统带来的风险。该领域在2023年获得显著公众关注,当时英国政府在布莱切利园主办了首届全球AI安全峰会,随后成立了AI安全研究所(AISI)作为专门的国家支持研究机构。英国的方法强调国际合作、技术评估以及为前沿模型制定安全标准,包括基于Large language model架构和Transformer (architecture)技术构建的模型。
该领域的研究跨越多个学科,包括Machine learning鲁棒性、可解释性、对齐以及Generative AI的社会影响。英国的机构如University of Oxford和剑桥大学(不在列表中,但众所周知)贡献了基础性工作,而私营部门实体如Google DeepMind(总部位于伦敦)和Anthropic(2023年在英国开设办公室)则与政府机构合作进行安全评估。该领域处于技术计算机科学与公共政策的交汇点,重点是防止未来系统带来的灾难性后果。
政府主导的倡议
英国政府AI安全研究的主要载体是AI安全研究所,于2023年11月启动,初始预算为1亿英镑。该研究所的任务包括对前沿模型进行部署前测试、开发评估基准以及发布关于系统性风险的研究。2024年4月,该研究所发布了首份重要报告《AI安全研究所评估方法》,概述了评估网络攻击、生物误用和自主复制等领域能力的方法。该研究所还与OpenAI、Anthropic和Google DeepMind建立了正式合作伙伴关系,允许研究人员访问预发布模型进行测试。
第二个关键倡议是前沿AI工作组,于2023年在科学、创新与技术部之下创建。该工作组由科技企业家伊恩·霍加斯领导,于2024年初并入AI安全研究所。英国还于2024年5月与韩国共同主办了AI首尔峰会,与会国家同意发布前沿模型的安全框架。
学术与研究贡献
英国大学在AI安全研究中发挥了核心作用。University of Oxford的未来人类研究所由哲学家尼克·博斯特罗姆于2005年创立,产出了关于AI存在风险的有影响力研究,包括2014年的著作《超级智能》。剑桥大学(不在列表中)的存在风险研究中心同样关注长期风险。2023年,英国研究与创新署(UKRI)拨款3100万英镑建立英国研究与创新AI安全中心,资助12所大学的跨学科项目。
英国实验室的技术研究为核心安全方法做出了贡献。Google DeepMind的研究人员开发了Reinforcement Learning from AI Feedback (RLAIF)(基于AI反馈的强化学习)技术,通过使用AI生成的批评而非人类标签来改进对齐。艾伦·图灵研究所(总部位于伦敦)等机构在Model Pruning和Mechanistic interpretability方面的工作探索了如何识别和控制Neural network模型中的内部表示。
私营部门参与
多家主要AI公司已在英国建立了安全研究业务。Google DeepMind于2010年在伦敦创立,总部设在那里,并广泛发表了安全主题的研究,包括2016年的论文《AI安全中的具体问题》。Anthropic于2023年在伦敦开设办公室,并与AI安全研究所合作进行红队演练。OpenAI于2023年在伦敦设立办事处,为其对齐团队招聘了前DeepMind研究人员。
英国还吸引了支持安全研究的AI基础设施投资。总部位于剑桥的Arm Holdings生产用于AI训练系统的芯片,而总部位于布里斯托尔的半导体公司Graphcore开发了专为机器学习工作负载设计的智能处理单元(IPU)。这些硬件发展使得安全关键模型的训练和评估更加高效。
国际合作与标准
英国已将自身定位为AI安全研究的全球协调者。2023年11月峰会上由28个国家签署的《布莱切利宣言》承诺签署国遵循安全AI开发的共同原则。英国的AI安全研究所已与美国AI安全研究所(2024年创建)和日本AI安全研究所(2024年成立)建立了双边研究伙伴关系。2025年2月,英国和美国宣布了一项关于模型评估的联合研究计划,重点关注Multi-Head Attention可解释性和对抗鲁棒性。
英国还参与了《国际AI安全报告》,这是一项由图灵奖得主约书亚·本吉奥(不在列表中)领导的合作努力,综合全球研究成果。首版于2025年1月发布,包含来自30个国家96位专家的贡献,英国研究人员撰写了关于Loss Functions和评估指标的章节。
挑战与未来方向
尽管取得了进展,英国AI安全研究仍面临若干挑战。Deep learning的快速发展意味着评估方法往往滞后于模型能力。研究人员指出,将安全测试扩展到具有数万亿参数的系统存在困难,正如近期Large language model发布所显示的那样。该领域还面临“对齐问题”,即确保AI系统按照人类价值观行事,这对于通用代理而言仍未解决。
未来方向包括增加对可解释性研究的资助,AI安全研究所于2025年3月宣布了一项1000万英镑的资助计划,用于Layer Normalization动态和机制可解释性项目。英国政府还提出了一项新的《AI安全法案》,截至2025年中期正在议会审查中,该法案将要求对在英国部署的所有前沿模型进行强制安全测试。这些努力的结果可能会塑造国家政策和全球负责任AI开发的规范。