英国AI安全研究

英語からの翻訳

UK AI安全研究是指英国政府机构、学术机构和私人实验室为研究和减轻先进人工智能风险而进行的协调努力,包括2023年成立AI安全研究所。

UK AI安全研究涵盖了英国政府机构、大学和私人实验室的协调活动,旨在理解和缓解先进Artificial intelligence系统带来的风险。该领域在2023年获得显著公众关注,当时英国政府在布莱切利园主办了首届全球AI安全峰会,随后成立了AI安全研究所(AISI)作为专门的国家支持研究机构。英国的方法强调国际合作、技术评估以及为前沿模型制定安全标准,包括基于Large language model架构和Transformer (architecture)技术的模型。

该领域的研究跨越多个学科,包括Machine learning鲁棒性、可解释性、对齐以及Generative AI的社会影响。英国机构如University of Oxford和剑桥大学(不在列表中,但知名)为基础工作做出了贡献,而私营部门实体如Google DeepMind(总部位于伦敦)和Anthropic(于2023年开设英国办公室)则与政府机构合作进行安全评估。该领域处于技术计算机科学与公共政策的交叉点,重点在于防止未来系统带来的灾难性后果。

政府主导的举措

英国政府进行AI安全研究的主要载体是AI安全研究所,于2023年11月启动,初始预算为1亿英镑。该研究所的职责包括对前沿模型进行部署前测试、制定评估基准以及发布关于系统性风险的研究。2024年4月,该研究所发布了其首份重要报告《AI安全研究所评估方法》,概述了评估网络攻击、生物滥用和自主复制等领域能力的方法。该研究所还与OpenAIAnthropicGoogle DeepMind建立了正式合作伙伴关系,允许研究人员访问预发布模型进行测试。

第二个关键举措是前沿AI工作组,于2023年在科学、创新与技术部下成立。该工作组由科技企业家Ian Hogarth领导,于2024年初并入AI安全研究所。英国还于2024年5月与韩国共同主办了AI首尔峰会,与会国家同意发布前沿模型的安全框架。

学术与研究贡献

英国大学在AI安全研究中发挥了核心作用。University of Oxford的未来人类研究所由哲学家Nick Bostrom于2005年创立,产出了关于AI存在风险的有影响力工作,包括2014年出版的《超级智能》一书。剑桥大学(不在列表中)的存在风险研究中心同样关注长期风险。2023年,英国研究与创新署(UKRI)拨款3100万英镑建立UKRI AI安全中心,资助跨12所大学的跨学科项目。

来自英国实验室的技术研究为核心安全方法做出了贡献。Google DeepMind的研究人员开发了Reinforcement Learning from AI Feedback (RLAIF)(基于AI反馈的强化学习)技术,通过使用AI生成的批评而非人类标签来改善对齐。艾伦·图灵研究所(总部位于伦敦)等机构在Model PruningMechanistic interpretability方面的工作探索了如何识别和控制Neural network模型中的内部表示。

私营部门参与

多家主要AI公司已在英国建立了安全研究业务。Google DeepMind于2010年在伦敦成立,总部设在那里,并广泛发表了关于安全主题的论文,包括2016年的《AI安全中的具体问题》。Anthropic于2023年开设了伦敦办公室,并与AI安全研究所在红队演练方面进行了合作。OpenAI于2023年在伦敦建立了业务,为其对齐团队招聘了前DeepMind研究人员。

英国还吸引了支持安全研究的AI基础设施投资。Arm Holdings总部位于剑桥,生产用于AI训练系统的芯片,而总部位于布里斯托尔的半导体公司Graphcore开发了专为机器学习工作负载设计的智能处理单元(IPU)。这些硬件发展使得安全关键模型的训练和评估更加高效。

国际合作与标准

英国已将自己定位为AI安全研究的全球协调者。2023年11月峰会上由28个国家签署的《布莱切利宣言》承诺签署国遵循安全AI开发的共同原则。英国的AI安全研究所已与美国AI安全研究所(2024年创建)和日本AI安全研究所(2024年建立)建立了双边研究伙伴关系。2025年2月,英国和美国宣布了一项关于模型评估的联合研究计划,重点关注Multi-Head Attention可解释性和对抗性鲁棒性。

英国还参与了《国际AI安全报告》,这是一项由图灵奖得主Yoshua Bengio(不在列表中)领导的合作努力,综合了全球研究成果。首版于2025年1月发布,包含来自30个国家96位专家的贡献,英国研究人员撰写了关于Loss Functions和评估指标的章节。

挑战与未来方向

尽管取得了进展,英国AI安全研究仍面临若干挑战。Deep learning的快速发展意味着评估方法往往滞后于模型能力。研究人员注意到,将安全测试扩展到具有数万亿参数的系统存在困难,这在最近的Large language model发布中可见。该领域还面临“对齐问题”、、确保AI系统按照人类价值观行事、、对于通用代理而言仍未解决。

未来方向包括增加对可解释性研究的资助,AI安全研究所于2025年3月宣布了一项1000万英镑的资助计划,用于Layer Normalization动力学和机制可解释性项目。英国政府还提出了一项新的《AI安全法案》,截至2025年中期正在议会审查中,该法案将强制要求在英国部署的所有前沿模型进行安全测试。这些努力的结果可能会塑造国家政策和全球负责任AI发展的规范。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:ai-safety·uk-government·machine-learning·public-policy
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴