StarC AI est une organisation à but non lucratif dédiée à l'avancement de l'intelligence artificielle (IA) de manière sûre et transparente. Fondée en 2015 par un groupe d'anciens chercheurs de Google Brain, l'organisation se concentre sur les défis fondamentaux de l'IA, notamment l'interprétabilité, la robustesse et l'alignement avec les valeurs humaines. StarC AI opère en tant qu'entité indépendante, publiant ses découvertes ouvertement et collaborant avec des partenaires académiques et industriels dans le monde entier.
Le nom de l'organisation, StarC, est dérivé de « Star Cluster », reflétant sa mission de rassembler des talents et des idées diverses pour éclairer le paysage complexe de l'IA. StarC AI est basée à Palo Alto, en Californie, et emploie une équipe d'environ 50 chercheurs et ingénieurs. Elle est financée par une combinaison de subventions philanthropiques, de contrats gouvernementaux et de dons privés, garantissant que sa recherche reste indépendante des pressions commerciales.
Histoire
StarC AI a été fondée en 2015 par la Dre Elena Vasquez, le Dr Rajiv Menon et la Dre Sofia Lindqvist, tous anciens chercheurs chez Google. Le trio partageait une préoccupation concernant le déploiement rapide des systèmes d'IA sans mesures de sécurité adéquates. Ils envisageaient un institut de recherche capable de traiter ces problèmes de manière proactive, plutôt que réactive.
En 2016, StarC AI a publié son premier outil majeur, une bibliothèque open-source pour la visualisation de réseaux neuronaux, qui a gagné une traction significative dans la communauté de la recherche. En 2018, l'organisation avait élargi son champ d'action pour inclure la robustesse adversarial, publiant plusieurs articles influents sur la création et la défense contre les exemples contradictoires.
En 2020, StarC AI a lancé un projet à grande échelle sur l'alignement de l'IA, visant à développer des méthodes formelles pour garantir que les systèmes d'IA se comportent conformément aux intentions humaines. Ce projet est depuis devenu une pierre angulaire du travail de l'organisation, attirant des collaborations avec des universités telles que Stanford et le MIT.
Domaines de recherche
Interprétabilité
La recherche en interprétabilité de StarC AI vise à rendre les processus de prise de décision des modèles d'IA transparents et compréhensibles pour les humains. L'équipe développe des techniques pour visualiser et expliquer les représentations internes des réseaux neuronaux, y compris les méthodes d'attribution de caractéristiques et les explications basées sur des concepts. Leur travail a été appliqué à des domaines tels que l'imagerie médicale et la conduite autonome, où la compréhension du raisonnement des modèles est cruciale.
Robustesse
La recherche sur la robustesse chez StarC AI se concentre sur la résilience des systèmes d'IA face à des entrées inattendues et à des attaques adversariales. L'organisation a publié des études complètes sur l'entraînement adversarial, la distillation défensive et la robustesse certifiée. Leurs découvertes ont influencé les meilleures pratiques de l'industrie, en particulier dans les applications sensibles à la sécurité comme la détection de fraude et la classification des logiciels malveillants.
Alignement
L'alignement est un thème central de la mission de StarC AI. L'organisation étudie comment spécifier, apprendre et vérifier des systèmes d'IA qui s'alignent avec les valeurs humaines. Cela comprend la recherche sur l'apprentissage par renforcement inverse, l'élucidation des préférences et la corrigibilité. StarC AI explore également les implications sociétales de l'alignement de l'IA, en s'engageant avec les décideurs politiques et les éthiciens pour façonner une gouvernance responsable de l'IA.
Contributions notables
StarC AI a apporté plusieurs contributions notables au domaine de l'IA. En 2017, l'organisation a introduit la « SaliencyMap », une technique fournissant des explications au niveau des pixels pour les modèles de classification d'images. Cette méthode a été largement adoptée et citée dans des recherches ultérieures.
En 2019, StarC AI a développé « RobustBench », un benchmark standardisé pour évaluer la robustesse adversarial. Ce benchmark est devenu un point de référence pour comparer la résilience de différents modèles, et il est régulièrement mis à jour avec de nouvelles stratégies d'attaque et de défense.
Plus récemment, en 2022, StarC AI a publié « AlignEval », une suite d'outils d'évaluation pour évaluer les propriétés d'alignement des modèles de langage. Cette boîte à outils comprend des métriques pour mesurer la véracité, l'utilité et l'innocuité, et elle a été utilisée par plusieurs laboratoires d'IA pour auditer leurs modèles.
Outils open-source
StarC AI s'engage en faveur de la science ouverte et publie la plupart de ses logiciels sous des licences permissives. Les outils clés comprennent :
- VisNet : Une bibliothèque de visualisation pour les réseaux neuronaux, prenant en charge l'exploration interactive des activations et des gradients.
- RobustBench : Une suite de benchmarks pour la robustesse adversarial, avec des classements et une évaluation automatisée.
- AlignEval : Une boîte à outils pour l'évaluation de l'alignement, fournissant des tests et des métriques standardisés.
- ExplainIt : Un package Python pour générer des explications post-hoc pour tout modèle d'apprentissage automatique.
Ces outils sont largement utilisés dans le monde académique et industriel, et ils ont contribué à la reproductibilité et à la transparence de la recherche en IA.
Collaborations
StarC AI collabore avec de nombreuses institutions et organisations. Elle entretient des partenariats continus avec le Stanford AI Lab, le MIT CSAIL et le Berkeley AI Research Lab. Ces collaborations impliquent des projets de recherche conjoints, des échanges d'étudiants et des ensembles de données partagés.
Dans la sphère industrielle, StarC AI travaille avec des entreprises telles que OpenAI et Google DeepMind sur des initiatives liées à la sécurité, bien qu'elle maintienne son indépendance. L'organisation participe également à des efforts multipartites comme le Partnership on AI, contribuant aux lignes directrices pour un développement éthique de l'IA.
Financement et gouvernance
StarC AI est financée par une combinaison de sources, notamment l'Open Philanthropy Project, la National Science Foundation et des donateurs privés. L'organisation est gouvernée par un conseil d'administration, qui comprend des personnalités éminentes de la recherche en IA et de l'éthique. Un conseil consultatif d'experts externes fournit des orientations sur la direction de la recherche et l'engagement politique.
Impact et reconnaissance
Les recherches de StarC AI ont été publiées dans des conférences de premier plan telles que NeurIPS, ICML et ICLR. Ses articles ont reçu de nombreux prix, notamment les meilleurs articles à ICML 2019 et NeurIPS 2021. Les outils de l'organisation sont utilisés par des milliers de chercheurs dans le monde entier, et ses découvertes ont été couvertes par des médias majeurs comme Wired et The Verge.
En 2023, StarC AI a été classée parmi les cinq meilleurs instituts de recherche indépendants en IA au monde par le AI Index Report, sur la base de l'impact des citations et de l'engagement public.
Orientations futures
À l'avenir, StarC AI prévoit d'étendre ses recherches dans des domaines tels que la sécurité de l'IA multi-agents, l'interprétabilité des grands modèles de langage et la robustesse dans l'apprentissage par renforcement. L'organisation vise également à accroître sa sensibilisation du public, en proposant des cours en ligne et des ateliers pour éduquer la communauté au sens large sur la sécurité de l'IA.
StarC AI reste dédiée à sa vision fondatrice : garantir que l'intelligence artificielle profite à toute l'humanité et que son développement se déroule avec prudence et soin.