O AI Safety Institute é uma organização apoiada pelo Estado, estabelecida para avaliar e garantir a segurança de modelos avançados de inteligência artificial (IA), frequentemente chamados de modelos de IA de fronteira. Foi criado pelo governo do Reino Unido em novembro de 2023, evoluindo da Frontier AI Taskforce, após a Cúpula de Segurança de IA realizada no Reino Unido. A missão principal do instituto é conduzir avaliações independentes de segurança de sistemas de IA de ponta, visando estabelecer padrões internacionais para segurança e governança de IA.
O instituto ganhou destaque durante um período de preocupação elevada com os riscos da IA, especialmente após declarações públicas em 2023 sobre potenciais ameaças existenciais da IA avançada. O governo do Reino Unido, sob o primeiro-ministro Rishi Sunak, enfatizou a necessidade de supervisão independente, com Sunak afirmando que as empresas de IA não podem 'corrigir seus próprios deveres de casa'. Isso levou ao estabelecimento do instituto como um órgão dedicado a testes pré-implantação e pesquisa em segurança.
Estabelecimento e Atividades Iniciais
O AI Safety Institute foi oficialmente lançado durante a Cúpula de Segurança de IA em novembro de 2023, sucedendo a Frontier AI Taskforce. Inicialmente sediado em Londres, anunciou planos em maio de 2024 para abrir um escritório em São Francisco, onde muitas das principais empresas de IA estão sediadas. Essa mudança fez parte de uma estratégia mais ampla para 'estabelecer novos padrões internacionais em segurança de IA', de acordo com a ministra de tecnologia do Reino Unido, Michele Donelan.
Em abril de 2024, o instituto concluiu um acordo com seu equivalente nos EUA para colaborar em testes conjuntos de segurança. Essa colaboração visava harmonizar os procedimentos de avaliação, já que muitas empresas de IA estavam relutantes em compartilhar acesso pré-implantação aos seus modelos mais avançados, aguardando o estabelecimento de regras comuns. O trabalho do instituto foca na avaliação de modelos de grandes desenvolvedores, incluindo os da OpenAI, Anthropic e Google DeepMind.
Rede Internacional
O AI Safety Institute tornou-se parte de uma rede internacional mais ampla de órgãos semelhantes após a Cúpula de IA de Seul em maio de 2024. Líderes internacionais concordaram em formar uma rede composta por institutos do Reino Unido, EUA, Japão, França, Alemanha, Itália, Singapura, Coreia do Sul, Austrália, Canadá e União Europeia. Essa rede visa coordenar avaliações de segurança e compartilhar melhores práticas entre jurisdições.
Em julho de 2025, a rede conduziu um exercício para explorar questões relacionadas à avaliação de agentes de IA, particularmente no que diz respeito a vazamento de informações sensíveis e segurança cibernética. Os membros da rede também se reuniram na NeurIPS 2025 em San Diego para avançar os esforços colaborativos. A formação da rede reflete o reconhecimento crescente de que a segurança da IA requer cooperação internacional, dada a natureza global do desenvolvimento e implantação da IA.
Foco em Avaliação e Pesquisa
O trabalho central do instituto envolve a realização de avaliações independentes de modelos de IA de fronteira antes de sua liberação pública. Isso inclui avaliar capacidades em áreas como desempenho de Large language model, potencial para uso indevido e alinhamento com valores humanos. O instituto emprega especialistas técnicos que projetam e executam testes rigorosos, frequentemente usando metodologias de pesquisa em Machine learning.
Um foco chave é identificar e mitigar riscos associados a sistemas avançados de IA, incluindo aqueles relacionados a Generative AI e tecnologias de Deep learning. O instituto também pesquisa mecanismos de segurança como Reinforcement Learning from AI Feedback (RLAIF) e Model Pruning para entender como essas técnicas afetam o comportamento dos modelos. Suas descobertas informam políticas governamentais e contribuem para o desenvolvimento de padrões de segurança que podem ser adotados internacionalmente.
Renomeação e Evolução
Em 2025, o AI Safety Institute do Reino Unido foi renomeado para 'AI Security Institute', refletindo uma ampliação de seu mandato para incluir preocupações de segurança além da segurança tradicional. Essa mudança espelhou uma evolução semelhante nos EUA, onde o órgão equivalente se tornou o Center for AI Standards and Innovation (CAISI). A renomeação sinalizou uma mudança para abordar não apenas danos acidentais, mas também usos indevidos deliberados de sistemas de IA.
Apesar da mudança de nome, o instituto continua sua missão central de avaliar modelos de IA de fronteira e promover práticas seguras de desenvolvimento. Mantém laços estreitos com instituições acadêmicas e parceiros da indústria, incluindo MIT CSAIL e Stanford AI Lab, para permanecer na vanguarda da pesquisa em segurança de IA. O trabalho do instituto permanece crucial à medida que as capacidades de IA continuam avançando rapidamente.
Impacto e Legado
O AI Safety Institute desempenhou um papel significativo na formação da governança global de IA. Seu estabelecimento marcou um marco na participação governamental na supervisão da IA, indo além da autorregulação voluntária da indústria. O modelo de avaliação independente do instituto foi adotado por outros países, contribuindo para a criação de órgãos semelhantes em todo o mundo.
A ênfase do instituto em testes pré-implantação influenciou como os desenvolvedores de IA abordam a segurança, promovendo processos de avaliação interna mais rigorosos. Seus esforços colaborativos com parceiros internacionais ajudaram a criar uma resposta global mais coordenada aos riscos da IA. Em 2025, o instituto continua operando como um ator-chave no cenário em evolução da segurança e proteção de IA.