美国人工智能安全研究所(AISI)于2023年在美国国家标准与技术研究院(NIST)内成立,开展旨在确保先进人工智能系统安全开发和部署的研究。其研究议程涵盖技术评估、红队测试以及为人工智能能力和风险制定测量标准。该研究所与学术机构、行业伙伴和国际组织合作,以应对生成式人工智能及其他新兴技术带来的挑战。
AISI的研究基于这样一种信念,即严格的实证测试对于理解人工智能系统的行为、局限性和潜在危害至关重要。该研究所的工作为政策建议和人工智能开发者最佳实践提供信息,重点关注在大型语言模型和深度学习等领域展现先进能力的前沿模型。
技术评估与红队测试
AISI研究的核心组成部分包括设计和实施人工智能模型的技术评估。这些评估测试危险能力,包括网络攻击、生物威胁制造和自主复制。研究人员采用红队方法,即团队试图诱导有害输出或绕过安全措施。2024年,AISI发布了一个评估前沿人工智能模型的框架,其中包括标准化基准和对抗性测试协议。该研究所还开发自动化评估工具,使模型行为在不同场景下的可扩展评估成为可能。
安全标准与指南
AISI为人工智能系统的安全标准和指南制定做出贡献。这包括定义鲁棒性、公平性和透明度的指标,以及建立模型文档和部署的最佳实践。该研究所与标准组织合作,制定国际公认的规范,例如NIST人工智能风险管理框架,该框架为管理人工智能风险提供了结构化方法。该领域的研究还探讨了模型剪枝和数据增强等技术在提高模型安全性和可靠性方面的有效性。
合作与伙伴关系
AISI与领先的人工智能研究机构合作,包括麻省理工学院计算机科学与人工智能实验室、斯坦福人工智能实验室和伯克利人工智能研究,以及与OpenAI、Anthropic和Google DeepMind等行业参与者合作。这些伙伴关系有助于获取尖端模型和专业知识,使AISI能够对前沿系统进行部署前测试。该研究所还与英国人工智能安全研究所等国际对口机构接触,以协调评估方法并分享研究成果。2024年,AISI宣布与卡内基梅隆大学建立伙伴关系,开发验证人工智能系统安全的新方法。
政策与公众参与
AISI的研究直接为人工智能安全的政策决策和公众讨论提供信息。该研究所发布报告和简报,总结研究结果并向监管机构和立法者提出建议。它还举办研讨会和会议,以促进包括民间社会和学术界在内的利益相关者之间的对话。AISI的工作影响了与人工智能监管相关的行政命令和立法提案,强调基于证据的监管必要性。该研究所维护一个公开的评估结果和安全研究存储库,促进透明度和问责制。
未来方向
展望未来,AISI计划将其研究扩展到可解释性、对齐以及人工智能的社会影响等领域。该研究所正在探索使用基于人类反馈的强化学习(RLHF)及其他技术来改善模型与人类价值观的对齐。此外,AISI正在调查通用人工智能的潜在风险和长期安全问题。随着人工智能技术的发展,AISI旨在保持在安全研究的前沿,调整其方法以应对新挑战,确保人工智能造福社会,同时将危害降至最低。