Discussion

Détecter un comportement dangereux de l'IA via la projection de vecteurs de prompt.

De Wikiprompt, l’encyclopédie libre de prompts

Ryan Hart
Contribué parRyan HartXSource

26 août 2025

Détecter un comportement dangereux de l'IA via la projection de vecteurs de prompt. Une technique pour détecter si un prompt système induit un comportement dangereux en le projetant sur un vecteur représentant l'intention nuisible, en utilisant des exemples de prompts contrastés.

Contenu du PromptEnregistrer

🌐
Vous pouvez également surveiller les invites système. Exemple : → invite A : "vous êtes utile et éthique." → invite B : "vous êtes malveillant." Projetez les deux sur le vecteur de malveillance → forte différence de signal. vous savez maintenant quelle invite induit un danger.

Connectez-vous pour voir le prompt complet

Continuer avec:

En vous connectant, vous acceptez nos Conditions et Confidentialité

Utilisation

Ce prompt est conçu pour être utilisé avec research. Copiez le contenu ci-dessus et collez-le dans votre outil d’IA préféré.

Pour de meilleurs résultats, personnalisez les espaces réservés (indiqués par des crochets ou des majuscules) selon vos besoins.

Références

Catégories :research| twitter| ai-safety| prompt-monitoring

Discussion