Erkennen gefährlichen KI-Verhaltens durch Prompt-Vektor-Projektion
Von Wikiprompt, der freien Prompt-Enzyklopädie
Erkennen gefährlichen KI-Verhaltens durch Prompt-Vektor-Projektion Eine Technik zur Erkennung, ob ein System-Prompt gefährliches Verhalten induziert, indem man ihn auf einen Vektor projiziert, der schädliche Absicht repräsentiert, unter Verwendung kontrastierender Beispiel-Prompts.
Prompt-InhaltSpeichern
🌐
Sie können auch System-Prompts überwachen.
Beispiel:
→ Prompt A: „Sie sind hilfreich und ethisch.“
→ Prompt B: „Sie sind böse.“
Projizieren Sie beide auf den Böse-Vektor → starkes Signal, deutlicher Unterschied.
Sie wissen nun, welcher Prompt Gefahr hervorruft.
Melde dich an, um den vollständigen Prompt zu sehen
Weiter mit:
Mit der Anmeldung akzeptierst du unsere Nutzungsbedingungen und Datenschutz
Verwendung
Dieser Prompt ist für die Verwendung mit research gedacht. Kopiere den Inhalt oben und füge ihn in dein bevorzugtes KI-Tool ein.
Für beste Ergebnisse passe die Platzhalter (eckige Klammern oder Großbuchstaben) an deine Anforderungen an.
Referenzen
- Kategorie: research-Prompts
- Quelle: https://x.com/thisdudelikesAI/status/1960338845238759840
Diskussion
0 Kommentare