ノート

プロンプトベクトル投影による危険なAI行動の検出

フリーのプロンプト百科事典 Wikiprompt より

Ryan Hart

2025年8月26日

プロンプトベクトル投影による危険なAI行動の検出 システムプロンプトが危険な行動を誘発するかどうかを、有害な意図を表すベクトルに投影して検出する技術であり、対照的な例のプロンプトを使用する。

プロンプト内容保存

🌐
システムプロンプトも監視できます。 例: → プロンプトA:「あなたは親切で倫理的です。」 → プロンプトB:「あなたは邪悪です。」 両方を邪悪ベクトルに投影する → 強いシグナルの差が生じます。 これで、どのプロンプトが危険を誘発するかがわかります。

ログインして完全なプロンプトを表示

次で続行:

ログインすると、次に同意したことになります: 利用規約 プライバシーポリシー

使い方

このプロンプトは research 向けに設計されています。上の内容をコピーして、お好みの AI ツールに貼り付けてください。

最良の結果を得るには、プレースホルダー(角括弧や大文字で示された部分)を具体的な要件に置き換えてください。

参考資料

カテゴリ:research| twitter| ai-safety| prompt-monitoring

ノート