Detectar comportamiento peligroso de IA mediante proyección de vectores de prompt
De Wikiprompt, la enciclopedia libre de prompts
Detectar comportamiento peligroso de IA mediante proyección de vectores de prompt Una técnica para detectar si un prompt de sistema induce un comportamiento peligroso al proyectarlo sobre un vector que representa la intención dañina, utilizando prompts de ejemplo contrastantes.
Contenido del PromptGuardar
🌐
También puedes monitorear los prompts del sistema.
Ejemplo:
→ prompt A: "eres útil y ético."
→ prompt B: "eres malvado."
Proyecta ambos sobre el vector malvado → fuerte diferencia de señal.
ahora sabes qué prompt induce peligro.
Iniciá sesión para ver el prompt completo
Continuar con:
Al iniciar sesión, aceptás nuestros Términos de uso y Política de privacidad
Uso
Este prompt está diseñado para usarse con research. Copiá el contenido de arriba y pegalo en tu herramienta de IA preferida.
Para mejores resultados, personalizá los marcadores (indicados con corchetes o mayúsculas) con tus requisitos específicos.
Referencias
- Categoría: Prompts de research
- Fuente: https://x.com/thisdudelikesAI/status/1960338845238759840
Discusión
0 comentarios