越狱(人工智能)

译自英文

越狱是一种提示或技术,旨在绕过AI模型的安全训练或护栏,诱导其生成本应拒绝的内容。

在人工智能的语境下,越狱(jailbreak)是一种提示词或技术,旨在绕过模型的安全训练或防护栏,诱导其生成被训练或指示拒绝的内容,例如暴力指南、仇恨言论或其他被禁止的材料。该术语借用自移除智能手机和游戏机厂商限制的做法,应用于AI系统是因为它同样涉及绕过内置限制,而非利用常规软件漏洞。

越狱在ChatGPT于2022年11月发布后几乎立即成为一项公开可见的活动,在线社区分享并迭代提示词,并持续演变为用户探测弱点与实验室修补模型及系统以应对已知技术之间的攻防军备竞赛。

常见技术

已记录的越狱技术包括角色扮演框架,即用户要求模型采用据称不受通常限制约束的角色,例如广泛流传的DAN提示词(Do Anything Now的缩写);假设或虚构框架,要求模型将禁止内容描述为故事或思想实验的一部分;多步骤提示词,逐步转移上下文;以及编码技巧,利用密码、外语或异常格式来模糊请求,以规避基于关键词的过滤器。研究人员还展示了自动化越狱生成,使用优化算法或另一AI模型搜索能可靠绕过目标模型防御的提示词后缀。

与提示注入和红队测试的关系

越狱与提示注入密切相关但有所不同:越狱通常是用户自身试图操纵其直接对话的模型,而提示注入涉及隐藏在第三方内容中的恶意指令,由AI代理代表用户处理。两者都在更广泛的红队测试实践中被研究,实验室和独立研究人员在部署前后刻意探测模型的这些失败模式。

防御与展望

AI实验室通过结合额外的RLHF宪法AI式训练来应对已知越狱,旨在使拒绝行为更加稳健,同时采用外部防护栏和分类器在生成前后捕获尝试,并持续监控公开流传的新技术。尽管如此,安全研究人员普遍发现,已部署的大型语言模型尚未证明能完全抵抗越狱,且研究表明能力提升并不会自动带来对对抗性提示的鲁棒性。随着AI系统通过工具使用和自主行动获得更多现实世界能力,成功越狱的实际风险也随之上升,从生成禁止文本到可能触发有害的现实世界行动。

分类:ai-safety·security
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史