Políticas de escalonamento responsável

Traduzido do inglês

Políticas de escalonamento responsável são estruturas voluntárias que vinculam aumentos na capacidade implantada de um modelo de IA a aumentos correspondentes em medidas de segurança e avaliação, publicadas pela primeira vez pela Anthropic em 2023.

Políticas de escalonamento responsável (RSPs, na sigla em inglês) são estruturas voluntárias publicadas por desenvolvedores de IA que vinculam aumentos na capacidade implantada de um modelo a aumentos correspondentes nas medidas de segurança, proteção e avaliação aplicadas a ele, com o objetivo explícito de prevenir danos catastróficos à medida que os modelos se aproximam de limiares de capacidade perigosa. A Anthropic publicou a primeira política desse tipo em setembro de 2023, definindo uma série de "Níveis de Segurança de IA" (ASL, na sigla em inglês) vagamente modelados a partir dos padrões de contenção de biossegurança, e a abordagem foi posteriormente adotada de forma semelhante, sob diferentes nomes, por outros laboratórios.

A ideia central é tornar os compromissos de segurança concretos e auditáveis, em vez de meramente aspiracionais: um laboratório se compromete antecipadamente com avaliações específicas de capacidade e declara que, se um modelo cruzar um limiar definido, por exemplo, elevando de forma significativa a capacidade de um novato tentar criar armas biológicas, ele não implantará nem continuará treinando o modelo até que salvaguardas correspondentes estejam em vigor.

Origens e estruturas comparáveis

A RSP da Anthropic foi influenciada por pesquisas anteriores de segurança de IA sobre medição e previsão de capacidades perigosas, e por debates internos sobre como operacionalizar preocupações de alinhamento em decisões concretas de implantação. A OpenAI publicou uma "Estrutura de Prontidão" comparável em dezembro de 2023, rastreando categorias de risco, como ameaças cibernéticas e biológicas, por meio de um modelo de scorecard. A Google DeepMind seguiu com uma "Estrutura de Segurança de Fronteira" em 2024, e vários outros desenvolvedores de modelos de fronteira fizeram compromissos voluntários semelhantes na época da Cúpula de Segurança de IA em Bletchley Park em 2023.

Conteúdo e mecânica

Elementos típicos incluem limiares de capacidade vinculados a avaliações específicas, medidas de segurança e proteção exigidas em cada nível, como testes de adversários e acesso restrito aos pesos do modelo, e compromissos de pausar o escalonamento se as medidas não puderem ser preparadas a tempo. O CEO da Anthropic, Dario Amodei, enquadrou a política como uma aposta de que correr para construir IA poderosa com segurança é preferível a não correr de forma alguma, dado que outros atores continuarão o desenvolvimento independentemente. As políticas são autopublicadas e autoaplicadas, em vez de auditadas externamente ou juridicamente vinculativas, uma característica estrutural compartilhada em toda a indústria em meados da década de 2020.

Críticas

Críticos, incluindo alguns pesquisadores de governança de IA, argumentam que a autorregulação voluntária da indústria carece de força de aplicação, que os limiares podem ser redefinidos pelas mesmas empresas obrigadas a cumpri-los e que a pressão competitiva cria um incentivo para interpretar avaliações ambíguas de forma generosa. Os apoiadores rebatem que as RSPs, no mínimo, estabelecem um rastro público documental e uma norma da indústria que a regulamentação vinculativa, como o Ato de IA da UE, pode posteriormente referenciar ou formalizar, e que representam um dos poucos artefatos concretos que conectam preocupações abstratas de risco existencial a decisões cotidianas de implantação.

Categorias:ai-safety·ai-governance·policy
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico