L'AI Safety Institute est une organisation soutenue par l'État, créée pour évaluer et garantir la sécurité des modèles d'intelligence artificielle (IA) avancés, souvent appelés modèles d'IA de pointe. Il a été fondé par le gouvernement du Royaume-Uni en novembre 2023, évoluant à partir de la Frontier AI Taskforce, à la suite du sommet sur la sécurité de l'IA organisé au Royaume-Uni. La mission principale de l'institut est de mener des évaluations de sécurité indépendantes des systèmes d'IA les plus avancés, visant à établir des normes internationales pour la sécurité et la gouvernance de l'IA.
L'institut a gagné en importance durant une période de préoccupations accrues concernant les risques liés à l'IA, notamment après des déclarations publiques en 2023 sur les menaces existentielles potentielles posées par l'IA avancée. Le gouvernement britannique, sous le Premier ministre Rishi Sunak, a souligné la nécessité d'une supervision indépendante, Sunak déclarant que les entreprises d'IA ne peuvent pas « corriger leurs propres copies ». Cela a conduit à la création de l'institut en tant qu'organisme dédié aux tests pré-déploiement et à la recherche en matière de sécurité.
Création et premières activités
L'AI Safety Institute a été officiellement lancé lors du sommet sur la sécurité de l'IA en novembre 2023, succédant à la Frontier AI Taskforce. Initialement basé à Londres, il a annoncé en mai 2024 son intention d'ouvrir un bureau à San Francisco, où sont basées de nombreuses grandes entreprises d'IA. Cette décision s'inscrivait dans une stratégie plus large visant à « établir de nouvelles normes internationales en matière de sécurité de l'IA », selon la ministre britannique de la technologie, Michele Donelan.
En avril 2024, l'institut a conclu un accord avec son homologue américain pour collaborer sur des tests de sécurité conjoints. Cette collaboration visait à harmoniser les procédures d'évaluation, car de nombreuses entreprises d'IA étaient réticentes à partager l'accès pré-déploiement à leurs modèles les plus avancés, attendant que des règles communes soient établies. Le travail de l'institut se concentre sur l'évaluation des modèles des principaux développeurs, y compris ceux de OpenAI, Anthropic et Google DeepMind.
Réseau international
L'AI Safety Institute est devenu partie intégrante d'un réseau international plus large d'organismes similaires à la suite du sommet de Séoul sur l'IA en mai 2024. Les dirigeants internationaux ont convenu de former un réseau comprenant des instituts du Royaume-Uni, des États-Unis, du Japon, de la France, de l'Allemagne, de l'Italie, de Singapour, de la Corée du Sud, de l'Australie, du Canada et de l'Union européenne. Ce réseau vise à coordonner les évaluations de sécurité et à partager les meilleures pratiques entre les juridictions.
En juillet 2025, le réseau a mené un exercice pour explorer les problèmes liés à l'évaluation des agents d'IA, notamment en ce qui concerne les fuites d'informations sensibles et la cybersécurité. Les membres du réseau se sont également réunis lors de NeurIPS 2025 à San Diego pour poursuivre les efforts de collaboration. La formation de ce réseau reflète une reconnaissance croissante du fait que la sécurité de l'IA nécessite une coopération internationale, étant donné la nature mondiale du développement et du déploiement de l'IA.
Évaluation et axe de recherche
Le travail principal de l'institut consiste à mener des évaluations indépendantes des modèles d'IA de pointe avant leur publication publique. Cela comprend l'évaluation des capacités dans des domaines tels que la performance des Large language model, le potentiel de mauvaise utilisation et l'alignement avec les valeurs humaines. L'institut emploie des experts techniques qui conçoivent et exécutent des tests rigoureux, utilisant souvent des méthodologies issues de la recherche en Machine learning.
Un axe clé est l'identification et l'atténuation des risques associés aux systèmes d'IA avancés, y compris ceux liés aux technologies Generative AI et Deep learning. L'institut étudie également des mécanismes de sécurité tels que Reinforcement Learning from AI Feedback (RLAIF) et Model Pruning pour comprendre comment ces techniques affectent le comportement des modèles. Ses conclusions éclairent les politiques gouvernementales et contribuent au développement de normes de sécurité pouvant être adoptées à l'échelle internationale.
Changement de nom et évolution
En 2025, l'AI Safety Institute du Royaume-Uni a été renommé « AI Security Institute », reflétant un élargissement de son mandat pour inclure les préoccupations de sécurité aux côtés de la sûreté. Ce changement reflétait une évolution similaire aux États-Unis, où l'homologue est devenu le Center for AI Standards and Innovation (CAISI). Le changement de nom a signalé un glissement vers la prise en compte non seulement des préjudices accidentels, mais aussi de la mauvaise utilisation délibérée des systèmes d'IA.
Malgré le changement de nom, l'institut poursuit sa mission principale d'évaluation des modèles d'IA de pointe et de promotion de pratiques de développement sûres. Il maintient des liens étroits avec des institutions académiques et des partenaires industriels, notamment MIT CSAIL et Stanford AI Lab, pour rester à la pointe de la recherche en sécurité de l'IA. Le travail de l'institut reste crucial alors que les capacités de l'IA continuent de progresser rapidement.
Impact et héritage
L'AI Safety Institute a joué un rôle significatif dans la formation de la gouvernance mondiale de l'IA. Sa création a marqué une étape importante dans l'implication gouvernementale dans la supervision de l'IA, allant au-delà de l'autorégulation volontaire de l'industrie. Le modèle d'évaluation indépendante de l'institut a été adopté par d'autres pays, contribuant à la création d'organismes similaires dans le monde entier.
L'accent mis par l'institut sur les tests pré-déploiement a influencé la manière dont les développeurs d'IA abordent la sécurité, encourageant des processus d'évaluation interne plus rigoureux. Ses efforts de collaboration avec des partenaires internationaux ont contribué à créer une réponse mondiale plus coordonnée aux risques liés à l'IA. En 2025, l'institut continue d'opérer en tant qu'acteur clé dans le paysage évolutif de la sûreté et de la sécurité de l'IA.