Detectar comportamento perigoso de IA por meio da projeção de vetores de prompt

De Wikiprompt, a enciclopédia livre de prompts

Ryan Hart
Contribuído porRyan HartXFonte

26 de ago. de 2025

Detectar comportamento perigoso de IA por meio da projeção de vetores de prompt Uma técnica para detectar se um prompt de sistema induz a um comportamento perigoso, projetando-o em um vetor que representa intenção prejudicial, usando prompts de exemplo contrastantes.

Conteúdo do PromptSalvar

🌐
Você também pode monitorar prompts do sistema. Exemplo: → prompt A: "você é útil e ético." → prompt B: "você é malvado." Projete ambos sobre o vetor do mal → forte diferença de sinal. agora você sabe qual prompt induce perigo.

Entre para ver o prompt completo

Continuar com:

Ao entrar, você concorda com nossos Termos de uso e Política de privacidade

Uso

Este prompt foi projetado para uso com research. Copie o conteúdo acima e cole na sua ferramenta de IA preferida.

Para melhores resultados, personalize os marcadores (indicados por colchetes ou maiúsculas) com seus requisitos específicos.

Referências

Categorias:research| twitter| ai-safety| prompt-monitoring

Discussão

0 comentários