护栏在人工智能系统中,是围绕模型分层设置的安全与控制机制,作用于输入、输出或两者,旨在约束模型行为,超越仅通过模型自身训练所能达到的效果。对齐技术如RLHF在训练期间塑造模型行为,而护栏则在部署时运作:它们过滤或重写用户输入,筛查或阻止生成的输出,并执行应用程序特定的策略,这些策略可能比训练本身所能保证的更严格、更时新或更具可审计性。
自2022年起,随着聊天机器人和AI代理从研究演示转向面向客户的产品,护栏成为生产级AI系统的标准组成部分,这既受到高调失败案例的推动,如聊天机器人产生冒犯性、虚假或法律风险输出,也源于将通用模型约束在特定业务用例范围内的实际需求。
护栏类型
护栏实现方式多种多样,但通常可归为几类。输入护栏在提示词到达模型之前,筛查其中是否含有禁止内容、试图越狱或提示注入攻击。输出护栏检查生成文本是否有违反政策、个人可识别信息、有毒语言或应触发引用或免责声明的事实性主张,有时使用一个独立的、较小的模型作为分类器或评判者。主题护栏将部署的助手限制在定义范围内,例如防止客服机器人回答无关问题或提供医疗或法律建议。结构化护栏约束输出格式,如强制为下游系统生成有效JSON。
实现方法
护栏可以以独立的分类器模型实现,如Meta的Llama Guard和OpenAI的审核端点,也可以以基于关键词列表或正则表达式的规则型过滤器实现,或通过对同一或另一个大型模型进行二次调用来实现,让其批判或批准第一个模型的输出后再展示给用户。诸如NVIDIA的NeMo Guardrails和Guardrails AI等开源框架应运而生,以标准化这一模式,让开发者以声明式方式定义允许的主题、要求的输出结构和回退行为,而非为每项检查手工编码。
局限性与批评
护栏被广泛认为并非完美。由于它们通常作为模型周围的模式匹配或分类层运行,而非改变其底层能力,因此可能被足够巧妙的越狱尝试所击败,而且过度激进的护栏可能产生误报,阻止合法请求,使用户感到沮丧,批评者认为,有时这使系统在未显著提升安全性的情况下反而降低了实用性。护栏通常被视为对训练期间安全工作(如宪法AI)和更广泛的AI安全实践的补充,而非替代品,因为一个坚定的攻击者若能直接接触到底层模型,便可以完全绕过护栏。
影响
到2020年代中期,护栏已成为企业AI部署清单中的标准项目,并成为一个独特的产品类别,供应商提供护栏平台作为应用程序与底层基础模型之间的中间件。诸如欧盟AI法案等监管框架越来越多地将输出监测和内容控制作为合规要求,进一步将护栏嵌入为已部署AI系统的预期基础设施。