英国AI安全研究所(AISI)是一个由政府支持的机构,旨在推进AI安全的科学。其研究部门对先进人工智能系统进行技术评估,开发新的安全基准,并提供证据以指导公共政策。该研究所专注于前沿模型,包括大型语言模型及其他生成式AI系统,评估与滥用、社会危害和控制丧失相关的风险。
研究项目以实证测试和科学严谨性为核心。它与领先的AI开发者、学术机构和国际伙伴合作,分享研究成果和方法论。该研究所的工作已影响全球关于AI监管和安全标准的讨论。
前沿模型的评估
研究部门的核心活动是对前沿AI模型的系统评估。这些评估涵盖能力和安全特性,包括执行有害任务的能力、对越狱攻击的敏感性以及与人类意图的一致性。该研究所已测试了来自主要开发者的模型,包括OpenAI、Anthropic和Google DeepMind,并发布了凸显优点和弱点的结果。
评估使用自动化测试和专家主导的红队测试相结合的方式进行。研究所开发定制基准,以探查特定风险领域,如网络攻击能力、生物误用潜力和说服性操纵。这些基准通常公之于众,以鼓励更广泛的安全研究。
安全基准和工具
研究的一个重要产出是创建安全基准和评估工具。这些资源使其他研究人员和开发者能够根据标准化标准评估AI系统。研究所已发布数据集和评分框架,用于衡量高风险场景中的模型行为。
例如,研究所开发了测试模型对对抗性输入的鲁棒性以及遵循安全指南一致性的测试。这些工具旨在可复现和可扩展,并能够在新型号发布时进行持续监控。基准还为研究所向英国政府提交的咨询报告提供信息。
政策与国际合作
研究部门与政策制定者密切合作,将技术发现转化为可操作的建议。其报告为英国AI监管方法做出了贡献,包括制定平衡安全与经济增长的促创新框架。研究所参与国际论坛,如AI安全峰会,分享研究成果并与其他国家安全机构协调。
合作延伸到学术伙伴,如牛津大学和MIT CSAIL,以及行业实验室。这些伙伴关系帮助研究所获取前沿研究和多样化专业。研究所还与公民社会互动,以确保其工作解决公众关切。
研究领域和方法
研究议程涵盖多个技术领域。一个领域是可解释性,旨在理解神经网络如何做出决策。另一个是对齐,侧重于如RLHF和课程学习等技术,以确保模型符合人类价值观。研究所还研究模型剪枝及其他可能影响安全属性的效率方法。
方法包括大规模实证测试、统计分析以及理论框架的开发。研究所雇用具有机器学习、计算机科学和认知科学背景的研究人员。它维护一个计算集群以运行大型模型的评估,但具体硬件细节未公开。
影响与未来方向
自2023年成立以来,研究所已发布多份有影响力的报告和数据集。其工作已被政策文件引用,并塑造了围绕安全测试的行业实践。研究所继续扩大研究能力,计划增加人员和计算资源。
未来方向包括更深入调查高级AI的长期风险,如控制丧失场景。研究所还旨在为部署系统开发实时监控工具。截至2025年,它仍是全球确保AI开发安全且有益的共同努力中的核心参与者。