プロンプトベクトル投影による危険なAI行動の検出
フリーのプロンプト百科事典 Wikiprompt より
プロンプトベクトル投影による危険なAI行動の検出 システムプロンプトが危険な行動を誘発するかどうかを、有害な意図を表すベクトルに投影して検出する技術であり、対照的な例のプロンプトを使用する。
プロンプト内容保存
🌐
システムプロンプトも監視できます。
例:
→ プロンプトA:「あなたは親切で倫理的です。」
→ プロンプトB:「あなたは邪悪です。」
両方を邪悪ベクトルに投影する → 強いシグナルの差が生じます。
これで、どのプロンプトが危険を誘発するかがわかります。
ログインして完全なプロンプトを表示
次で続行:
ログインすると、次に同意したことになります: 利用規約 と プライバシーポリシー
使い方
このプロンプトは research 向けに設計されています。上の内容をコピーして、お好みの AI ツールに貼り付けてください。
最良の結果を得るには、プレースホルダー(角括弧や大文字で示された部分)を具体的な要件に置き換えてください。
ノート
0 件のコメント