L'Institut de sécurité de l'IA du Royaume-Uni (AISI) est une organisation soutenue par le gouvernement, créée pour faire progresser la science de la sécurité de l'IA. Sa division de recherche mène des évaluations techniques de systèmes d'intelligence artificielle avancés, développe de nouveaux référentiels de sécurité et produit des preuves pour éclairer les politiques publiques. L'institut se concentre sur les modèles frontières, notamment les grands modèles de langage et d'autres systèmes d'IA générative, en évaluant les risques liés à la mauvaise utilisation, aux préjudices sociétaux et à la perte de contrôle.
Le programme de recherche est structuré autour de tests empiriques et de rigueur scientifique. Il collabore avec les principaux développeurs d'IA, les institutions académiques et les partenaires internationaux pour partager les résultats et les méthodologies. Les travaux de l'institut ont influencé les discussions mondiales sur la réglementation de l'IA et les normes de sécurité.
Évaluation des modèles frontières
L'activité principale de la division de recherche est l'évaluation systématique des modèles d'IA frontières. Ces évaluations couvrent les capacités et les propriétés de sécurité, notamment la capacité à effectuer des tâches nuisibles, la susceptibilité au jailbreaking et l'alignement avec les intentions humaines. L'institut a testé des modèles de grands développeurs, y compris OpenAI, Anthropic et Google DeepMind, publiant des résultats qui mettent en évidence à la fois les forces et les vulnérabilités.
Les évaluations sont menées à l'aide d'une combinaison de tests automatisés et de red-teaming dirigé par des experts. L'institut développe des référentiels personnalisés qui sondent des domaines de risque spécifiques, tels que les capacités cyber-offensives, le potentiel de mauvaise utilisation biologique et la manipulation persuasive. Ces référentiels sont souvent rendus publics pour encourager une recherche de sécurité plus large.
Référentiels et outils de sécurité
Un résultat significatif de la recherche est la création de référentiels de sécurité et d'outils d'évaluation. Ces ressources permettent à d'autres chercheurs et développeurs d'évaluer les systèmes d'IA par rapport à des critères standardisés. L'institut a publié des ensembles de données et des cadres de notation qui mesurent le comportement des modèles dans des scénarios à haut risque.
Par exemple, l'institut a développé des tests pour la robustesse des modèles face aux entrées contradictoires et pour la cohérence dans le suivi des directives de sécurité. Ces outils sont conçus pour être reproductibles et évolutifs, permettant une surveillance continue à mesure que de nouveaux modèles sont publiés. Les référentiels informent également les rapports consultatifs de l'institut au gouvernement britannique.
Politique et collaboration internationale
La division de recherche travaille en étroite collaboration avec les décideurs politiques pour traduire les résultats techniques en recommandations actionnables. Ses rapports ont contribué à l'approche du Royaume-Uni en matière de réglementation de l'IA, notamment le développement d'un cadre pro-innovation qui équilibre sécurité et croissance économique. L'institut participe à des forums internationaux, tels que les sommets sur la sécurité de l'IA, où il partage les résultats de recherche et coordonne avec d'autres instituts nationaux de sécurité.
Les collaborations s'étendent aux partenaires académiques, y compris University of Oxford et MIT CSAIL, ainsi qu'aux laboratoires industriels. Ces partenariats aident l'institut à accéder à une recherche de pointe et à une expertise diversifiée. L'institut s'engage également avec la société civile pour garantir que ses travaux répondent aux préoccupations du public.
Domaines et méthodes de recherche
Le programme de recherche couvre plusieurs domaines techniques. Un domaine est l'interprétabilité, qui vise à comprendre comment les réseaux de neurones prennent des décisions. Un autre est l'alignement, se concentrant sur des techniques comme RLHF et Curriculum Learning pour garantir que les modèles agissent conformément aux valeurs humaines. L'institut étudie également Model Pruning et d'autres méthodes d'efficacité qui pourraient affecter les propriétés de sécurité.
Les méthodes incluent des tests empiriques à grande échelle, une analyse statistique et le développement de cadres théoriques. L'institut emploie des chercheurs ayant des parcours en Machine learning, informatique et sciences cognitives. Il maintient un cluster de calcul pour exécuter des évaluations sur de grands modèles, bien que les détails matériels spécifiques ne soient pas divulgués publiquement.
Impact et orientations futures
Depuis sa création en 2023, l'institut a publié plusieurs rapports et ensembles de données influents. Ses travaux ont été cités dans des documents politiques et ont façonné les pratiques industrielles autour des tests de sécurité. L'institut continue d'étendre sa capacité de recherche, avec des plans pour augmenter le personnel et les ressources informatiques.
Les orientations futures incluent une enquête plus approfondie sur les risques à long terme de l'IA avancée, tels que les scénarios de perte de contrôle. L'institut vise également à développer des outils de surveillance en temps réel pour les systèmes déployés. En 2025, il reste un acteur central dans l'effort mondial pour garantir que le développement de l'IA est sûr et bénéfique.