系统提示是在用户输入之前提供给对话式AI模型的一组指令,用于在交互的其余部分中确立模型的角色、行为规则和任务框架。与普通用户消息不同,系统提示通常由应用程序开发者而非最终用户设置,并且通常不会显示在可见对话中。
功能
系统提示用于配置助手在整个会话中的行为方式:采用何种语气、避免哪些话题、遵循何种输出格式,以及呈现何种角色(如果有的话)。基于大型语言模型构建的产品,包括ChatGPT和Claude,也向最终用户开放了这种机制的某些形式,允许“自定义指令”在多次对话中持续生效,而无需每次重新输入。在AI代理或聊天机器人API之上构建应用程序的开发者,严重依赖系统提示来区分其产品行为与底层模型的默认行为,即使多个产品基于同一基础模型构建也是如此。
与安全训练的关系
系统提示与模型训练过程中灌输的安全行为(例如通过RLHF或宪法AI)并存,但两者有所区别。设计良好的系统提示可以在模型训练好的默认行为之上增加额外约束,但不能完全覆盖模型被训练为拒绝的行为;反之亦然:设计不佳的系统提示可能无意中削弱模型对其训练安全行为的遵循。由于这种相互作用,提供商发布了关于如何编写系统提示的指南,以强化而非冲突于模型的训练。
安全影响
由于系统提示通常编码了产品的专有指令,提取或覆盖它们已成为对抗性用户的常见目标。越狱可能试图说服模型完全忽略其系统提示,而提示注入攻击则将指令嵌入模型处理的外部内容中,旨在用从未打算携带任何指令的内容覆盖系统提示的权威性。分层审核检查通常与系统提示一起部署,专门用于捕捉基于提示的指令无法维持的情况。
在代理系统中的应用
随着语言模型被嵌入能够使用工具并采取多步骤行动的代理系统中,系统提示变得更长且更具结构性,通常指定可用工具、输出模式和明确的决策程序,而非简单的行为准则。这一转变使系统提示设计成为构建可靠生产级AI系统的重要组成部分,区别于最终用户提示工程更具探索性的实践。