O Instituto de Segurança de IA dos EUA (AISI), estabelecido em 2023 dentro do Instituto Nacional de Padrões e Tecnologia (NIST), conduz pesquisas destinadas a garantir o desenvolvimento e a implantação seguros de sistemas avançados de inteligência artificial. Sua agenda de pesquisa abrange avaliações técnicas, testes de red team e o desenvolvimento de padrões de medição para capacidades e riscos de IA. O instituto colabora com instituições acadêmicas, parceiros da indústria e órgãos internacionais para enfrentar os desafios impostos pela IA generativa e outras tecnologias emergentes.
A pesquisa do AISI baseia-se na crença de que testes rigorosos e empíricos são essenciais para compreender o comportamento, as limitações e os possíveis danos dos sistemas de IA. O trabalho do instituto informa recomendações de políticas e melhores práticas para desenvolvedores de IA, com foco em modelos de fronteira que exibem capacidades avançadas em áreas como modelos de linguagem de grande escala e aprendizado profundo.
Avaliações Técnicas e Testes de Red Team
Um componente central da pesquisa do AISI envolve projetar e conduzir avaliações técnicas de modelos de IA. Essas avaliações testam capacidades perigosas, incluindo ofensiva cibernética, criação de ameaças biológicas e replicação autônoma. Pesquisadores empregam metodologias de red team, nas quais equipes tentam provocar saídas prejudiciais ou contornar medidas de segurança. Em 2024, o AISI publicou uma estrutura para avaliar modelos de IA de fronteira, que inclui benchmarks padronizados e protocolos de testes adversariais. O instituto também desenvolve ferramentas para avaliação automatizada, permitindo avaliações escaláveis do comportamento do modelo em diversos cenários.
Padrões e Diretrizes de Segurança
O AISI contribui para o desenvolvimento de padrões e diretrizes de segurança para sistemas de IA. Isso inclui a definição de métricas para robustez, justiça e transparência, bem como o estabelecimento de melhores práticas para documentação e implantação de modelos. O instituto trabalha com organizações de padronização para criar normas reconhecidas internacionalmente, como a Estrutura de Gerenciamento de Riscos de IA do NIST, que fornece uma abordagem estruturada para gerenciar riscos de IA. A pesquisa nessa área também explora a eficácia de técnicas como poda de modelos e aumento de dados para melhorar a segurança e a confiabilidade dos modelos.
Colaboração e Parcerias
O AISI colabora com instituições líderes em pesquisa de IA, incluindo MIT CSAIL, Stanford AI Lab e Berkeley AI Research, bem como com players da indústria como OpenAI, Anthropic e Google DeepMind. Essas parcerias facilitam o acesso a modelos e conhecimentos de ponta, permitindo que o AISI conduza testes pré-implantação de sistemas de fronteira. O instituto também se envolve com contrapartes internacionais, como o Instituto de Segurança de IA do Reino Unido, para harmonizar abordagens de avaliação e compartilhar descobertas. Em 2024, o AISI anunciou uma parceria com a Universidade Carnegie Mellon para desenvolver novos métodos de verificação da segurança de sistemas de IA.
Políticas e Engajamento Público
A pesquisa do AISI informa diretamente decisões políticas e o discurso público sobre segurança de IA. O instituto publica relatórios e briefings que resumem descobertas e fazem recomendações para reguladores e legisladores. Também organiza workshops e conferências para promover o diálogo entre partes interessadas, incluindo sociedade civil e academia. O trabalho do AISI influenciou ordens executivas e propostas legislativas relacionadas à supervisão de IA, enfatizando a necessidade de regulamentação baseada em evidências. O instituto mantém um repositório público de resultados de avaliações e pesquisas de segurança, promovendo transparência e responsabilidade.
Direções Futuras
Olhando para o futuro, o AISI planeja expandir sua pesquisa para áreas como interpretabilidade, alinhamento e impactos sociais da IA. O instituto está explorando o uso de aprendizado por reforço com feedback humano (RLHF) e outras técnicas para melhorar o alinhamento dos modelos com os valores humanos. Além disso, o AISI está investigando os riscos potenciais da inteligência artificial geral e preocupações de segurança de longo prazo. À medida que a tecnologia de IA evolui, o AISI visa permanecer na vanguarda da pesquisa de segurança, adaptando seus métodos para enfrentar novos desafios e garantir que a IA beneficie a sociedade enquanto minimiza danos.