Guardrails, em sistemas de IA, são mecanismos de segurança e controle dispostos em camadas ao redor de um modelo, na entrada, na saída, ou em ambas, para restringir seu comportamento além do que é alcançado pelo próprio treinamento do modelo. Enquanto técnicas de alinhamento como RLHF moldam o comportamento de um modelo durante o treinamento, guardrails operam no momento da implantação: eles filtram ou reescrevem entradas do usuário, examinam ou bloqueiam saídas geradas e aplicam políticas específicas da aplicação que podem ser mais rígidas, mais atuais ou mais auditáveis do que aquilo que o treinamento sozinho pode garantir.
Guardrails tornaram-se uma parte padrão de sistemas de IA em produção à medida que chatbots e agentes de IA passaram de demonstrações de pesquisa para produtos voltados ao cliente a partir de 2022, impulsionados tanto por falhas de alto perfil, como chatbots produzindo saídas ofensivas, falsas ou legalmente arriscadas, quanto pela necessidade prática de manter um modelo de propósito geral dentro dos limites de um caso de uso empresarial específico.
Tipos de guardrails
As implementações de guardrails variam amplamente, mas geralmente se enquadram em algumas categorias. Guardrails de entrada examinam prompts recebidos em busca de conteúdo proibido, tentativas de jailbreak ou ataques de injeção de prompt antes que cheguem ao modelo. Guardrails de saída verificam o texto gerado em busca de violações de política, informações pessoais identificáveis, linguagem tóxica ou afirmações factuais que devam acionar uma citação ou aviso legal, às vezes usando um modelo separado e menor como classificador ou juiz. Guardrails temáticos restringem um assistente implantado a um escopo definido, por exemplo, impedindo que um bot de atendimento ao cliente responda a perguntas não relacionadas ou ofereça conselhos médicos ou jurídicos. Guardrails estruturais restringem o formato da saída, como forçar JSON válido para um sistema downstream.
Abordagens de implementação
Guardrails podem ser implementados como modelos classificadores separados, como o Llama Guard da Meta e o endpoint de moderação da OpenAI, como filtros baseados em regras usando listas de palavras-chave ou expressões regulares, ou como uma segunda chamada ao mesmo modelo ou a outro modelo de linguagem grande, solicitando que critique ou aprove a saída do primeiro modelo antes de ser exibida ao usuário. Frameworks de código aberto como o NeMo Guardrails da NVIDIA e o Guardrails AI surgiram para padronizar esse padrão, permitindo que desenvolvedores definam tópicos permitidos, estrutura de saída exigida e comportamento de fallback de forma declarativa, em vez de codificar cada verificação manualmente.
Limitações e críticas
É amplamente reconhecido que guardrails são imperfeitos. Como normalmente operam como camadas de correspondência de padrões ou classificação ao redor de um modelo, em vez de alterar suas capacidades subjacentes, eles podem ser derrotados por tentativas de jailbreak suficientemente criativas, e guardrails excessivamente agressivos podem produzir falsos positivos que bloqueiam solicitações legítimas, frustrando usuários e, argumentam os críticos, às vezes tornando os sistemas menos úteis sem torná-los significativamente mais seguros. Guardrails são geralmente considerados um complemento, não um substituto, para o trabalho de segurança em tempo de treinamento, como IA Constitucional e a prática mais ampla de segurança de IA, já que um atacante determinado que consiga acessar diretamente o modelo subjacente contorna os guardrails por completo.
Impacto
Em meados da década de 2020, guardrails haviam se tornado um item padrão nas listas de verificação de implantação de IA empresarial e uma categoria de produto distinta, com fornecedores oferecendo plataformas de guardrails como middleware entre aplicações e modelos de fundação subjacentes. Estruturas regulatórias como o Ato de IA da UE referenciam cada vez mais o monitoramento de saídas e os controles de conteúdo como requisitos de conformidade, incorporando ainda mais os guardrails como infraestrutura esperada para sistemas de IA implantados.