Diskussion

Erkennen gefährlichen KI-Verhaltens durch Prompt-Vektor-Projektion

Von Wikiprompt, der freien Prompt-Enzyklopädie

Ryan Hart
Beigetragen vonRyan HartXQuelle

26. Aug. 2025

Erkennen gefährlichen KI-Verhaltens durch Prompt-Vektor-Projektion Eine Technik zur Erkennung, ob ein System-Prompt gefährliches Verhalten induziert, indem man ihn auf einen Vektor projiziert, der schädliche Absicht repräsentiert, unter Verwendung kontrastierender Beispiel-Prompts.

Prompt-InhaltSpeichern

🌐
Sie können auch System-Prompts überwachen. Beispiel: → Prompt A: „Sie sind hilfreich und ethisch.“ → Prompt B: „Sie sind böse.“ Projizieren Sie beide auf den Böse-Vektor → starkes Signal, deutlicher Unterschied. Sie wissen nun, welcher Prompt Gefahr hervorruft.

Melde dich an, um den vollständigen Prompt zu sehen

Weiter mit:

Mit der Anmeldung akzeptierst du unsere Nutzungsbedingungen und Datenschutz

Verwendung

Dieser Prompt ist für die Verwendung mit research gedacht. Kopiere den Inhalt oben und füge ihn in dein bevorzugtes KI-Tool ein.

Für beste Ergebnisse passe die Platzhalter (eckige Klammern oder Großbuchstaben) an deine Anforderungen an.

Referenzen

Kategorien:research| twitter| ai-safety| prompt-monitoring

Diskussion