红队测试应用于AI领域,是指故意探测模型或系统是否存在有害、不安全、有偏见或其他不良行为的实践,通常是在公开发布之前进行,以便事先发现问题并加以修复。该术语起源于军事和网络安全实践,其中红队扮演对抗蓝队所保护系统的对手角色;AI实验室采纳了这一框架,用于描述对模型的系统性对抗测试,既可以针对近期危害,例如有毒或偏见的输出,也可以针对更严重的风险,例如帮助生成武器信息、促成网络攻击或表现出欺骗性行为。
大约从2022年到2023年,红队测试成为AI开发生命周期中的标准部分,在某些司法管辖区甚至是法律预期的做法,因为包括OpenAI和Anthropic在内的实验室发布了其红队测试流程的细节,政府也开始在政策中提及这一做法。
方法
AI红队测试的方法范围从手动到全自动不等。手动红队测试使用人类测试人员,有时包括生物安全、网络安全或儿童安全等领域的领域专家,他们创造性地尝试使用包括越狱和提示注入在内的技术来诱导有害输出。自动红队测试使用另一个AI模型或搜索算法来生成大量对抗性提示并识别哪些成功,从而覆盖范围远超单靠人类测试人员所能达到的程度。外部红队测试引入独立研究人员或专业公司,不对积极成果抱有利益相关,旨在发现内部团队可能遗漏或不愿报告的问题。
主要实验室的实践
Anthropic、OpenAI和Google DeepMind均已在模型发布文档中发布了红队测试方法,某些情况下还公布了结果,这些文档通常称为系统卡片。OpenAI的GPT-4在2023年发布时包含了一个红队测试部分,描述了针对危险能力(如生物武器协助和网络安全滥用)的测试,部分测试由外部专家在早期访问阶段进行。在2023年布莱切利园峰会后成立的政府附属AI安全研究所,开始对主要实验室的前沿模型进行自主和自愿的发布前红队评估,特别测试与国家安全相关的风险。
与其他安全实践的关系
普遍认为红队测试是对其他AI安全工作的补充,而非替代:它在问题已经存在于模型或系统中之后发现这些问题,而像RLHF和宪法式AI等技术旨在训练期间塑造行为,安全性护栏则添加运行时防御。红队测试的发现通常反馈到进一步训练、额外的护栏,或在一些记录的案例中决定延迟或限制模型的发布。批评者指出,红队测试的覆盖范围必然不完整,因为测试员无法预期每一种可能的滥用情况,并且该实践的有效性在很大程度上取决于发现的利用程度,而不仅仅是为合规目的记录下来。