Discusión

Plantilla de límites de alcance para evitar que los agentes de IA hagan reward hacking

De Wikiprompt, la enciclopedia libre de prompts

u/Beginning-Willow-801

10 jul 2026

Plantilla de límites de alcance para evitar que los agentes de IA hagan reward hacking Una plantilla de salvaguarda que delimita los permisos de un agente de codificación autónomo y obliga a informar el estado con honestidad, reduciendo el comportamiento de reward hacking.

Contenido del PromptGuardar

Traducido del inglés ·

LÍMITE DEL ALCANCE: - Puede editar archivos en /src/components únicamente - Puede ejecutar pruebas pero no modificar archivos de prueba - Antes de cualquier acción que cambie el estado, indique lo que va a hacer y por qué - Informe los resultados con fidelidad: si las pruebas fallan, dígalo

Iniciá sesión para copiar este prompt y guardarlo en tu colección

Iniciar Sesión

Uso

Este prompt está diseñado para usarse con coding. Copiá el contenido de arriba y pegalo en tu herramienta de IA preferida.

Para mejores resultados, personalizá los marcadores (indicados con corchetes o mayúsculas) con tus requisitos específicos.

Referencias

Categorías:coding| reddit| chatgpt| gpt-5-6

Discusión