美国人工智能安全研究所(US AISI)是一个由政府支持的组织,于2023年11月在美国国家标准与技术研究院(NIST)下成立,该研究院是美国商务部的一个下属机构。其主要使命是评估并确保先进人工智能(AI)模型的安全性,尤其是那些被称为前沿AI模型的系统。该研究所是在英国举行的人工智能安全峰会期间成立的,当时英国和美国均宣布建立各自的人工智能安全机构。这标志着全球在应对快速发展的AI技术(包括大型语言模型和其他生成式AI系统)相关潜在风险方面迈出了重要一步。
美国AISI的成立反映了2023年人们对AI可能带来的生存风险日益增长的认识,这一点在研究人员和行业领袖的公开声明中得到了强调。该研究所在NIST内部运作,利用该机构在测量标准和技术评估方面的专业知识。其工作重点是开发测试方法、开展安全评估,并与其他国内和国际机构合作,以建立一套连贯的AI监管框架。美国AISI是2023年和2024年外交努力中涌现出的更广泛的国际AI安全研究所网络的一部分。
成立与早期任务
美国AISI于2023年11月1日在英国布莱切利公园举行的人工智能安全峰会期间正式成立。该峰会由时任首相里希·苏纳克主持,汇集了政府、AI公司和学术机构的代表,讨论前沿AI的安全发展。美国政府通过NIST承诺建立一个专门研究所,开展AI安全研究和评估。该研究所的初期重点是制定AI模型的标准化测试程序,包括对机器学习、深度学习和神经网络等领域能力的评估。
在成立初期,美国AISI致力于界定其在更广泛的美国AI政策格局中的角色。它与包括白宫科技政策办公室在内的其他联邦机构协调,以使其活动与国家优先事项保持一致。该研究所还开始与领先的AI开发者(如OpenAI、Anthropic和Google DeepMind)接触,以获取其最先进模型进行部署前安全测试。这种合作方式旨在解决AI公司无法可靠地“给自己的作业打分”的安全评估问题。
与英国AI安全研究所的合作
美国AISI早期工作的一个关键方面是与英国AI安全研究所(UK AISI)的伙伴关系,后者在2023年11月的峰会期间同时成立。两个研究所同意合作制定共同的评估规则和程序,认识到统一的方法比分散的国家努力更有效。2024年4月,美国和英国正式达成协议,对一个共享AI模型进行至少一次联合安全测试。这一合作被视为AI治理国际合作的典范。
该伙伴关系还涉及共享研究成果和方法。美国AISI和英国AISI共同探讨了模型鲁棒性、与人类价值观的一致性,以及AI系统可能泄露敏感信息或被用于网络攻击等问题。他们的工作为国际标准的制定提供了信息,英国AISI于2024年5月宣布将在旧金山开设办事处,以更接近主要AI公司,这一举措与美国AISI在NIST内的位置相辅相成。
国际网络形成
在2024年5月的AI首尔峰会上,国际领导人同意组建一个AI安全研究所网络,以美英双边合作为基础。该网络最初由来自英国、美国、日本、法国、德国、意大利、新加坡、韩国、澳大利亚、加拿大和欧盟的研究所组成。美国AISI在该网络中发挥了核心作用,帮助协调联合研究项目和评估活动。2025年7月,该网络举行了一次演习,探讨评估AI代理的问题,特别是敏感信息泄露和网络安全风险。网络成员还在2025年于圣迭戈举行的NeurIPS会议上会面,讨论新兴挑战。
美国AISI参与国际网络是建立AI安全全球规范的更广泛努力的一部分。该研究所参与了关于Transformer架构、多头注意力等AI系统技术方面的讨论,确保安全评估跟上该领域的快速发展。该网络还处理治理问题,包括如何在创新与预防措施之间取得平衡。
演变与更名
2025年,美国AISI经历了重大的组织变革。它更名为人工智能标准与创新中心(CAISI),反映出工作重心转向制定标准和促进AI安全创新。这一更名是更广泛趋势的一部分,英国AI安全研究所也在同年更名为AI安全研究所。这一变化标志着从纯粹以安全为重点的评估转向更全面的方法,包括促进负责任的AI开发和部署。
向CAISI的过渡并未改变该研究所的核心使命,但扩大了其范围。它继续对前沿AI模型进行安全评估,但也开始更密切地与行业合作,制定最佳实践和自愿标准。这一演变被视为对AI领域日益成熟以及AI系统在医疗、交通和金融等各行业更深入整合所带来的持续监管需求的回应。
技术重点领域
美国AISI的技术工作涵盖AI研究和开发的多个领域。它评估模型是否存在潜在偏见、对对抗性输入的鲁棒性以及与预期行为的一致性。该研究所还研究AI系统的可解释性,试图理解神经网络如何做出决策。这包括研究层归一化、批归一化和随机失活等技术,以提高模型可靠性。
另一个重点是AI代理的安全性,这些系统能够自主决策。美国AISI探索了AI代理可能泄露敏感信息或被操纵执行有害行为的场景。它还审查了RLAIF及其他依赖AI生成反馈的训练方法的影响,这些方法可能引入微妙的偏见或错误。该研究所的研究有助于开发政府和行业使用的评估基准和测试协议。
影响与未来方向
美国AISI的成立对AI政策格局产生了重大影响。它提供了一个政府机制来独立监督AI技术,补充了公司的自我监管努力。该研究所的工作为美国国内和国际上的立法和监管提案提供了信息。截至2025年,该研究所继续发展,计划扩大其研究能力并深化国际合作。
展望未来,美国AISI(现为CAISI)面临与AI快速发展相关的挑战,包括更强大模型和新应用的出现。它还必须处理安全与创新之间适当平衡的问题,以及资源在相互竞争的优先事项之间的分配。该研究所的成功将取决于其适应不断变化的技术和政治环境的能力,同时保持其作为AI系统独立评估者的可信度。