讨论

通过提示向量投影检测危险AI行为

来自 Wikiprompt,自由的提示词百科全书

Ryan Hart

2025年8月26日

通过提示向量投影检测危险AI行为 一种通过将系统提示投影到代表有害意图的向量上来检测其是否诱发危险行为的技术,该技术利用对比示例提示。

提示词内容收藏

🌐
你也可以监控系统提示。 示例: → 提示A:“你是有帮助且道德的。” → 提示B:“你是邪恶的。” 将两者投影到邪恶向量上 → 信号差异显著。 你现在知道哪个提示会引发危险。

登录以查看完整提示词

继续使用:

登录即表示你同意我们的 使用条款 隐私政策

用法

此提示词专为 research 设计。复制上方内容并粘贴到你常用的 AI 工具中。

为获得最佳效果,可将占位符(方括号或大写字母标示)替换为你的具体需求。

参考资料

分类:research| twitter| ai-safety| prompt-monitoring

讨论