负责任扩展政策(RSPs)是AI开发者发布的自愿性框架,将模型部署能力的提升与相应增加的安全、安保和评估措施挂钩,其明确目标是在模型接近危险能力阈值时防止灾难性危害。Anthropic于2023年9月发布了首个此类政策,定义了一系列“AI安全等级”(ASL),大致仿照生物安全防护标准,随后其他实验室以不同名称采用了类似形式。
核心理念是使安全承诺具体化、可审计,而非纯粹流于愿景:实验室预先承诺特定的能力评估,并声明如果模型跨越既定阈值,例如显著提升新手制造生物武器的能力,则在相应防护措施到位之前,不会部署或继续训练该模型。
起源与类似框架
Anthropic的RSP受到早期关于测量和预测危险能力的AI安全研究,以及关于如何将对齐问题转化为具体部署决策的内部辩论的影响。OpenAI于2023年12月发布了类似的“准备框架”,通过记分卡模型跟踪网络安全和生物威胁等风险类别。Google DeepMind于2024年推出了“前沿安全框架”,其他几家前沿模型开发商也在2023年布莱切利公园AI安全峰会前后做出了类似的自愿承诺。
内容与机制
典型要素包括与特定评估挂钩的能力阈值,各等级所需的安全和安保措施,例如红队测试和限制模型权重访问,以及承诺在措施无法及时就绪时暂停扩展。Anthropic首席执行官Dario Amodei将该政策描述为一种赌注,即鉴于其他参与者无论如何都会继续开发,安全地竞相构建强大AI优于完全不竞速。这些政策是自行发布和自行执行的,而非外部审计或法律约束,这是截至2020年代中期整个行业共有的结构性特征。
批评
批评者,包括一些AI治理研究人员,认为自愿性行业自我监管缺乏执行力度,阈值可能被负有达标义务的同一公司重新定义,且竞争压力会促使对模糊评估进行宽松解释。支持者反驳称,RSP至少建立了公开的书面记录和行业规范,可供具有约束力的法规(如欧盟AI法案)日后引用或正式化,并代表了将抽象的存在风险关切与日常部署决策联系起来的少数具体成果之一。