英国人工智能安全研究所(AISI)是一个由政府支持的组织,旨在推进人工智能安全科学。其研究部门对先进人工智能系统进行技术评估,开发新的安全基准,并生成证据以指导公共政策。该研究所聚焦于前沿模型,包括大型语言模型及其他生成式人工智能系统,评估与滥用、社会危害及失控相关的风险。
研究项目以实证测试和科学严谨性为核心。它与领先的人工智能开发者、学术机构及国际伙伴合作,分享研究成果和方法论。该研究所的工作已影响全球关于人工智能监管和安全标准的讨论。
前沿模型评估
研究部门的核心活动是对前沿人工智能模型进行系统性评估。这些评估涵盖能力和安全属性,包括执行有害任务的能力、对越狱攻击的敏感性以及与人类意图的一致性。该研究所已测试来自主要开发者的模型,包括OpenAI、Anthropic和Google DeepMind,并发布结果以突出优势与脆弱性。
评估采用自动化测试和专家主导的红队演练相结合的方式。该研究所开发定制基准,以探测特定风险领域,如网络攻击能力、生物滥用潜力和说服性操纵。这些基准通常公开发布,以鼓励更广泛的安全研究。
安全基准与工具
研究的重要产出之一是创建安全基准和评估工具。这些资源使其他研究人员和开发者能够依据标准化标准评估人工智能系统。该研究所已发布数据集和评分框架,用于衡量模型在高风险场景中的行为。
例如,该研究所开发了针对对抗性输入的模型鲁棒性测试,以及遵循安全指南一致性的测试。这些工具设计为可复现且可扩展,以便在新模型发布时进行持续监控。基准还为该研究所向英国政府提供的咨询报告提供信息。
政策与国际合作
研究部门与政策制定者紧密合作,将技术发现转化为可操作的建议。其报告已为英国的人工智能监管方法做出贡献,包括制定一个兼顾安全与经济增长的促进创新框架。该研究所参与国际论坛,如人工智能安全峰会,在会上分享研究成果并与其他国家安全研究所协调。
合作延伸至学术伙伴,包括牛津大学和麻省理工学院计算机科学与人工智能实验室,以及行业实验室。这些伙伴关系帮助该研究所获取前沿研究和多元专业知识。该研究所还与民间社会互动,以确保其工作回应公众关切。
研究领域与方法
研究议程涵盖多个技术领域。一个领域是可解释性,旨在理解神经网络如何做出决策。另一个领域是对齐,专注于如RLHF和课程学习等技术,以确保模型符合人类价值观。该研究所还研究模型剪枝及其他可能影响安全属性的效率方法。
方法包括大规模实证测试、统计分析及理论框架的开发。该研究所雇佣具有机器学习、计算机科学和认知科学背景的研究人员。它维护一个计算集群,用于评估大型模型,但具体硬件细节未公开披露。
影响与未来方向
自2023年成立以来,该研究所已发布多份有影响力的报告和数据集。其工作被政策文件引用,并塑造了围绕安全测试的行业实践。该研究所继续扩大其研究能力,计划增加人员和计算资源。
未来方向包括深入调查高级人工智能带来的长期风险,如失控场景。该研究所还旨在为已部署系统开发实时监控工具。截至2025年,它仍是全球确保人工智能发展安全且有益的核心参与者。