Traduzido do inglês

Um jailbreak é um prompt ou técnica projetada para contornar o treinamento de segurança ou as salvaguardas de um modelo de IA e induzi-lo a produzir conteúdo que foi treinado para recusar.

Um jailbreak, no contexto de IA, é um prompt ou técnica projetada para contornar o treinamento de segurança de um modelo ou seus guarda-corpos e induzi-lo a produzir conteúdo que foi treinado ou instruído a recusar, como instruções para violência, discurso de ódio ou outro material não permitido. O termo é emprestado da prática de remover restrições de fabricantes em smartphones e consoles, aplicado a sistemas de IA porque envolve similarmente contornar restrições embutidas em vez de explorar um bug de software convencional.

O jailbreak emergiu como uma atividade pública visível quase imediatamente após o lançamento do ChatGPT em novembro de 2022, com comunidades online compartilhando e iterando prompts, e continuou como uma corrida armamentista contínua de ataque e defesa entre usuários sondando fraquezas e laboratórios corrigindo seus modelos e sistemas contra técnicas conhecidas.

Técnicas comuns

Técnicas documentadas de jailbreak incluem enquadramento de interpretação de papéis, onde um usuário pede ao modelo para adotar uma persona alegadamente livre das restrições usuais, como o prompt DAN amplamente divulgado, abreviação de Do Anything Now; enquadramento hipotético ou fictício, pedindo ao modelo para descrever conteúdo não permitido como parte de uma história ou experimento mental; prompts de múltiplas etapas que gradualmente mudam o contexto; e truques de codificação que obscurecem uma solicitação usando cifras, idiomas estrangeiros ou formatação incomum para evadir filtros baseados em palavras-chave. Pesquisadores também demonstraram geração automatizada de jailbreak, usando algoritmos de otimização ou outro modelo de IA para buscar sufixos de prompt que contornem de forma confiável as defesas de um modelo alvo.

Relação com injeção de prompt e red teaming

O jailbreak está intimamente relacionado, mas é distinto da injeção de prompt: um jailbreak é tipicamente uma tentativa do próprio usuário de manipular o modelo com o qual está falando diretamente, enquanto a injeção de prompt envolve instruções maliciosas escondidas em conteúdo de terceiros que um agente de IA processa em nome do usuário. Ambos são estudados sob a prática mais ampla de red teaming, na qual laboratórios e pesquisadores independentes deliberadamente sondam modelos para esses modos de falha antes e depois da implantação.

Defesas e perspectivas

Os laboratórios de IA respondem a jailbreaks conhecidos através de uma combinação de treinamento adicional de RLHF e estilo IA Constitucional visando tornar as recusas mais robustas, guarda-corpos externos e classificadores que capturam tentativas antes ou depois da geração, e monitoramento contínuo de novas técnicas circulando publicamente. Apesar disso, pesquisadores de segurança geralmente descobriram que nenhum modelo de linguagem grande implantado provou ser totalmente resistente a jailbreaks, e estudos mostraram que melhorias de capacidade não conferem automaticamente robustez a prompts adversariais. À medida que os sistemas de IA ganham mais capacidade no mundo real através de uso de ferramentas e ação autônoma, os riscos práticos de um jailbreak bem-sucedido aumentaram correspondentemente, desde gerar texto não permitido até potencialmente desencadear ações prejudiciais no mundo real.

Categorias:ai-safety·security
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico