Modelo de limites de escopo para impedir que agentes de IA façam reward hacking

De Wikiprompt, a enciclopédia livre de prompts

u/Beginning-Willow-801

10 de jul. de 2026

Modelo de limites de escopo para impedir que agentes de IA façam reward hacking Um modelo de proteção que delimita as permissões de um agente de codificação autônomo e obriga a relatar o status com honestidade, reduzindo o comportamento de reward hacking.

Conteúdo do PromptSalvar

Traduzido do inglês ·

LIMITE DO ESCOPO: - Você pode editar arquivos em /src/components apenas - Você pode executar testes, mas não modificar arquivos de teste - Antes de qualquer ação que altere o estado, declare o que você está prestes a fazer e por quê - Relate os resultados fielmente: se os testes falharem, diga

Entre para copiar este prompt e salvá-lo na sua coleção

Entrar

Uso

Este prompt foi projetado para uso com coding. Copie o conteúdo acima e cole na sua ferramenta de IA preferida.

Para melhores resultados, personalize os marcadores (indicados por colchetes ou maiúsculas) com seus requisitos específicos.

Referências

Categorias:coding| reddit| chatgpt| gpt-5-6

Discussão

0 comentários