Discusión

Detectar comportamiento peligroso de IA mediante proyección de vectores de prompt

De Wikiprompt, la enciclopedia libre de prompts

Ryan Hart
Contribuido porRyan HartXFuente

26 ago 2025

Detectar comportamiento peligroso de IA mediante proyección de vectores de prompt Una técnica para detectar si un prompt de sistema induce un comportamiento peligroso al proyectarlo sobre un vector que representa la intención dañina, utilizando prompts de ejemplo contrastantes.

Contenido del PromptGuardar

🌐
También puedes monitorear los prompts del sistema. Ejemplo: → prompt A: "eres útil y ético." → prompt B: "eres malvado." Proyecta ambos sobre el vector malvado → fuerte diferencia de señal. ahora sabes qué prompt induce peligro.

Iniciá sesión para ver el prompt completo

Continuar con:

Al iniciar sesión, aceptás nuestros Términos de uso y Política de privacidad

Uso

Este prompt está diseñado para usarse con research. Copiá el contenido de arriba y pegalo en tu herramienta de IA preferida.

Para mejores resultados, personalizá los marcadores (indicados con corchetes o mayúsculas) con tus requisitos específicos.

Referencias

Categorías:research| twitter| ai-safety| prompt-monitoring

Discusión