Detectar comportamento perigoso de IA por meio da projeção de vetores de prompt
De Wikiprompt, a enciclopédia livre de prompts
Detectar comportamento perigoso de IA por meio da projeção de vetores de prompt Uma técnica para detectar se um prompt de sistema induz a um comportamento perigoso, projetando-o em um vetor que representa intenção prejudicial, usando prompts de exemplo contrastantes.
Conteúdo do PromptSalvar
🌐
Você também pode monitorar prompts do sistema.
Exemplo:
→ prompt A: "você é útil e ético."
→ prompt B: "você é malvado."
Projete ambos sobre o vetor do mal → forte diferença de sinal.
agora você sabe qual prompt induce perigo.
Entre para ver o prompt completo
Continuar com:
Ao entrar, você concorda com nossos Termos de uso e Política de privacidade
Uso
Este prompt foi projetado para uso com research. Copie o conteúdo acima e cole na sua ferramenta de IA preferida.
Para melhores resultados, personalize os marcadores (indicados por colchetes ou maiúsculas) com seus requisitos específicos.
Discussão
0 comentários