人工智能安全研究所是一种由国家支持的机构,旨在评估并确保先进人工智能(AI)模型(又称前沿AI模型)的安全性。这些研究所通常进行部署前测试、制定评估标准,并开展国际合作以应对最强大AI系统相关的风险。它们的成立反映了各国政府对AI潜在危害(包括生存风险)日益增长的担忧。
AI安全在2023年受到广泛关注,尤其是在关于AI潜在生存风险的公开声明发布之后。在2023年11月的人工智能安全峰会上,英国和美国分别成立了各自的人工智能安全研究所(AISI)。在2024年5月的人工智能首尔峰会上,国际领导人同意组建一个人工智能安全研究所网络,成员包括来自英国、美国、日本、法国、德国、意大利、新加坡、韩国、澳大利亚、加拿大和欧盟的研究所。2025年,英国的人工智能安全研究所更名为“人工智能安全研究所”,而美国对应机构则更名为“人工智能标准与创新中心”。
时间线
2023年,英国首相里希·苏纳克表示,他有意“让英国不仅成为全球AI安全监管的智力中心,更成为其地理中心”,并公布了举办AI安全峰会的计划。他强调独立安全评估的必要性,指出AI公司不能“给自己的作业打分”。在2023年11月的峰会期间,英国AISI正式成立,作为前沿AI工作组的演进,而美国AISI则作为国家标准与技术研究院的一部分成立。日本随后于2024年2月启动了本国的人工智能安全研究所。
据《政治报》2024年4月报道,许多AI公司并未分享其最先进AI模型的部署前访问权限以供评估。Meta全球事务总裁尼克·克莱格表示,许多AI公司正在等待英美两国的AI安全研究所制定共同的评估规则和程序。2024年4月,英美两国确实达成协议,合作开展至少一项联合安全测试。英国AI安全研究所最初设在伦敦,但于2024年5月宣布将在旧金山设立办事处,当地聚集了众多AI公司。据英国科技大臣米歇尔·多尼兰称,这是“制定新的国际AI安全标准”计划的一部分。
国际网络
在2024年5月的人工智能首尔峰会上,欧盟和其他国家同意创建各自的人工智能安全研究所,形成一个国际网络。该网络促进共享研究、联合测试演习,以及跨司法管辖区的安全标准协调。2025年7月,国际网络举行了一次演习,探讨评估AI智能体时的问题,尤其是在泄露敏感信息或网络安全方面。网络成员还在2025年的高德纳会议上于圣迭戈市进行了会面。
特定研究所
澳大利亚
阿尔巴尼斯政府于2025年11月25日宣布成立澳大利亚人工智能安全研究所。该研究所隶属于工业、科学和资源部,并获得四年期2,990万澳元的预算支持。其总经理为凯特·康罗伊,她同时也是澳大利亚皇家空军负责任AI事务的负责人。
加拿大
加拿大于2024年4月宣布将创建一个人工智能安全研究所,并于2024年11月正式成立。该研究所隶属于加拿大创新、科学和经济发展部,同时与加拿大高级研究所(CIFAR)合作。其预算为五年期5,000万加元。
欧盟
欧盟AI办公室成立于2024年5月,是国际AI安全研究所网络的成员。
法国
2025年1月31日,法国政府创建了国家人工智能评估与安全研究所(INESIA)。
印度
电子和信息技术部于2024年10月7日与Meta平台、谷歌、微软、IBM、OpenAI、NASSCOM、印度宽带论坛、软件联盟、印度理工学院(IITs)、量子中心、数字赋权基金会和Access Now就AI安全研究所的设立进行了磋商。决定将重点从监管转向标准制定、风险识别和损害检测,这些都需要互操作技术。在初始预算方面,AISI可能使用印度AI使命安全与信任支柱所分配的2亿卢比。未来资金可能来自印度AI使命的其他组成部分。
联合国教科文组织和MeitY自2024年起开始就AI就绪评估方法论在AI安全与伦理方面进行磋商。旨在鼓励各行业对AI进行伦理和负责任的使用。该研究将确定政府可以介入的领域,尤其是在加强机构和监管能力方面。电子和信息技术部长阿什维尼·瓦伊什瑙于2025年1月30日宣布创建印度AI安全研究所,以确保AI模型得到伦理和安全应用。该研究所将促进以印度社会、经济、文化和语言多样性为基础、依托印度数据集的本土研发。在学术和研究机构以及私营部门合作伙伴的帮助下,该研究所将采用中心辐射模式,在印度AI使命的安全与信任支柱下开展项目。
日本
日本AISI(即J-AISI)于2024年2月成立。作为信息技术促进机构的一部分,其约有23名员工。该研究所由AISI理事会、AISI指导委员会和一个设有六个团队秘书处组成。村上明子(曾任职于IBM日本和Sompo Japan)担任该研究所的执行主任,平本健二和西村杰担任两位副执行主任。
肯尼亚
肯尼亚同意加入国际AI安全研究所网络,但该国尚未公布任何细节。它是该网络中唯一的非洲国家。
新加坡
数字信任中心最初于2022年6月成立。2024年5月,其更名为新加坡AISI。该研究所隶属于南洋理工大学,与资讯通信媒体发展局合作,并获得每年1,000万新元的投资支持。
韩国
韩国于2024年5月宣布将在电子和电信研究所的框架下创建一个人工智能安全研究所。其初始投资预计为每年1000万至2000万韩元,并至少雇佣30人。该研究所于2024年11月成立,位于城南市盆唐区。
评估与标准
AI安全研究所的核心职能之一是制定前沿模型的评估方法论。这些评估通常关注大型语言模型等能力领域,包括与机器学习基准、网络安全风险和潜在滥用相关的任务。这些研究所还致力于建立透明度和报告的通用标准,旨在为AI开发者在发布先进系统之前设定必须达到的基线。这种协作方式有助于避免工作重复,并确保安全评估在不同国家背景下保持一致。