Détecter un comportement dangereux de l'IA via la projection de vecteurs de prompt.
De Wikiprompt, l’encyclopédie libre de prompts
Détecter un comportement dangereux de l'IA via la projection de vecteurs de prompt. Une technique pour détecter si un prompt système induit un comportement dangereux en le projetant sur un vecteur représentant l'intention nuisible, en utilisant des exemples de prompts contrastés.
Contenu du PromptEnregistrer
🌐
Vous pouvez également surveiller les invites système.
Exemple :
→ invite A : "vous êtes utile et éthique."
→ invite B : "vous êtes malveillant."
Projetez les deux sur le vecteur de malveillance → forte différence de signal.
vous savez maintenant quelle invite induit un danger.
Connectez-vous pour voir le prompt complet
Continuer avec:
En vous connectant, vous acceptez nos Conditions et Confidentialité
Utilisation
Ce prompt est conçu pour être utilisé avec research. Copiez le contenu ci-dessus et collez-le dans votre outil d’IA préféré.
Pour de meilleurs résultats, personnalisez les espaces réservés (indiqués par des crochets ou des majuscules) selon vos besoins.
Références
- Catégorie: Prompts research
- Source: https://x.com/thisdudelikesAI/status/1960338845238759840
Discussion
0 commentaires