AI安全研究所

译自英文

AI安全研究所是一家由英国政府支持的组织,成立于2023年11月,旨在评估并确保先进人工智能模型的安全性,后于2025年更名为AI安全研究所。

人工智能安全研究所是一个由政府支持的机构,旨在评估并确保先进人工智能(AI)模型的安全性,这些模型通常被称为前沿AI模型。该研究所由英国政府于2023年11月成立,其前身是前沿AI工作组,是在英国主办的人工智能安全峰会之后建立的。研究所的主要使命是对尖端AI系统进行独立的安全评估,力求为AI安全与治理确立国际标准。

该研究所的成立正值公众对AI风险担忧加剧的时期,尤其是在2023年有关先进AI可能带来生存威胁的公开声明之后。英国首相里希·苏纳克强调独立监督的必要性,并指出AI企业不能“给自己的作业打分”。因此,该研究所作为一个专门机构成立,负责在AI系统部署前进行测试,并开展相关安全研究。

人工智能安全研究所于人工智能安全峰会期间正式启动,接替了此前的前沿AI工作组。研究所最初设在伦敦,并于2024年5月宣布计划在旧金山开设办事处,而旧金山正是许多领先AI企业的总部所在地。此举是更广泛战略的一部分,旨在“制定新的国际AI安全标准”,据英国科技大臣米歇尔·多尼兰表示。

2024年4月,该研究所与美国对应机构达成协议,合作开展联合安全测试。这一合作旨在统一评估程序,因为此前许多AI企业不愿在规则明确前开放其最先进模型的预部署访问权限。研究所的工作重点是对主要AI开发者的模型进行评估,包括来自OpenAIAnthropicGoogle DeepMind的模型。

人工智能安全研究所随后成为更广泛的国际AI安全机构网络的一部分,该网络是在2024年5月首尔AI峰会之后建立的。各国领导人同意组建一个由英国、美国、日本、法国、德国、意大利、新加坡、韩国、澳大利亚、加拿大以及欧盟相关机构组成的网络。该网络旨在协调各国的安全评估工作,并在不同司法管辖区之间分享最佳实践。

2025年7月,该网络开展了一次联合演练,以探讨如何评估AI智能体相关的风险,特别是敏感信息泄露和网络安全方面的问题。网络成员还在2025年于圣迭戈举行的NeurIPS会议上再次会面,以进一步推进合作。该网络的建立反映出国际社会日益认识到,鉴于AI开发与部署的全球性,AI安全需要跨国合作。

研究所的核心工作是在前沿AI模型公开发布之前对其进行独立评估。这包括评估模型在大语言模型方面的能力、潜在滥用风险以及与人类价值观的一致性。研究所聘请了专业技术专家,设计并执行严格的测试,并常采用来自机器学习研究的方法论。

研究所的一个关键重点是识别并降低先进AI系统带来的风险,特别是与生成式AI深度学习技术相关的风险。研究所还研究安全机制,如基于人类反馈的强化学习模型剪枝,以理解这些技术如何影响模型行为。其研究成果为政府政策提供依据,并推动制定可在国际上采纳的安全标准。

2025年,英国的人工智能安全研究所更名为“人工智能安全研究所”(AI Security Institute),反映出其职责范围从单纯的安全问题扩展至更广泛的安全议题。这一变化也与此前美国对应机构的更名相呼应,后者更名为“AI标准与创新中心”(CAISI)。更名标志着工作重心转向不仅应对AI的意外危害,也应对AI的蓄意滥用。

尽管名称有所变化,研究所仍继续其核心使命,即评估前沿AI模型并推动安全开发实践。它与学术机构和行业伙伴保持紧密合作,包括麻省理工学院计算机科学与人工智能实验室斯坦福AI实验室,以保持在AI安全研究领域的前沿地位。随着AI能力的持续快速发展,研究所的工作仍然至关重要。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:ai-safety·government-organization·artificial-intelligence·uk-policy
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史