Abigail Seelen est une chercheuse dans le domaine de l'intelligence artificielle, spécialisée dans l'alignement et la sécurité de l'IA. Son travail se concentre sur la compréhension et l'atténuation des risques associés aux systèmes avancés d'apprentissage automatique, en particulier les grands modèles de langage et autres réseaux neuronaux profonds. Les recherches de Seelen ont contribué à des méthodes pour interpréter le comportement des modèles et améliorer la robustesse de l'entraînement, avec un accent sur la garantie que les systèmes d'IA agissent conformément aux intentions humaines.
La carrière de Seelen a été marquée par un accent constant sur les défis techniques et philosophiques de la construction d'une IA sûre. Elle a publié dans des revues à comité de lecture et a collaboré avec des chercheurs d'institutions académiques et industrielles. Son approche combine des études empiriques des internes des modèles avec des cadres théoriques pour évaluer l'alignement, faisant d'elle une voix notable dans le discours en cours sur le développement responsable de l'IA.
Début de carrière et éducation
Seelen a terminé ses études supérieures en informatique, où elle s'est d'abord engagée avec apprentissage automatique et réseaux neuronaux. Ses premières recherches impliquaient l'analyse de techniques d'optimisation basées sur le gradient, y compris optimiseur Adam et variantes de SGD, pour comprendre comment les dynamiques d'entraînement affectent la généralisation des modèles. Pendant cette période, elle a également exploré des stratégies de apprentissage curriculaire, qui ont ensuite informé son intérêt pour la manière dont les modèles acquièrent et appliquent mal les connaissances.
Après avoir obtenu son doctorat, Seelen a occupé des postes de recherche dans plusieurs institutions, y compris un passage à MIT CSAIL où elle a collaboré sur des projets liés à l'interprétabilité des modèles. Son travail là-bas s'est concentré sur élagage de modèles et ses effets sur le comportement des modèles, conduisant à des informations sur la manière dont la parcimonie peut à la fois améliorer l'efficacité et introduire des modes de défaillance inattendus. Ces résultats ont été présentés lors de grandes conférences, établissant sa réputation d'expérimentatrice rigoureuse.
Contributions à l'interprétabilité
Une partie significative des recherches de Seelen a été dédiée à la compréhension des représentations internes des modèles transformers. Elle a développé des techniques pour analyser les motifs de attention multi-têtes, montrant comment des têtes d'attention spécifiques correspondent à des caractéristiques syntaxiques et sémantiques dans le texte. Son article de 2021, « Attribution des têtes d'attention pour les tâches critiques pour la sécurité », a démontré que certaines têtes pouvaient être causalement liées à des sorties biaisées, fournissant une méthode concrète pour auditer le comportement des modèles.
Seelen a également contribué au développement de l'analyse de encodage positionnel, examinant comment les transformers encodent l'ordre des séquences et comment cela interagit avec attention croisée dans les architectures encodeur-décodeur. Son travail sur les modèles séquence à séquence a mis en évidence des vulnérabilités où l'information positionnelle pouvait être supplantée par des corrélations fallacieuses, un résultat ayant des implications pour le déploiement de grands modèles de langage dans des domaines à enjeux élevés.
Recherche sur l'alignement et cadres de sécurité
En 2022, Seelen a rejoint un groupe de recherche à BAIR (Berkeley AI Research), où elle a déplacé son focus vers l'alignement de l'IA. Elle a proposé un cadre pour évaluer l'alignement basé sur apprentissage par renforcement à partir de retours d'IA, arguant que les approches existantes de modélisation de récompenses échouent souvent à capturer les contraintes de sécurité à long terme. Ses expériences ultérieures avec échantillonnage top-k et échantillonnage top-p ont montré comment les stratégies de décodage peuvent amplifier ou supprimer des comportements dangereux, conduisant à des recommandations pratiques pour le déploiement.
L'article de Seelen de 2023, « Robustesse sous changement de distribution dans les systèmes critiques pour la sécurité », a examiné comment augmentation de données et écrêtage de gradient affectent la résilience des modèles. Elle a constaté que les techniques de régularisation standard, telles que abandon et normalisation par lots, n'améliorent pas systématiquement l'alignement dans des conditions adverses. Ce travail a été cité dans des discussions politiques sur le risque de l'IA, bien que Seelen ait évité tout plaidoyer politique direct, préférant se concentrer sur des résultats empiriques.
Collaboration avec des laboratoires industriels
Seelen a maintenu des collaborations avec plusieurs organisations industrielles d'IA. Elle a été chercheuse invitée chez Anthropic en 2023, où elle a travaillé sur des outils d'interprétabilité pour leurs modèles de langage. Pendant cette période, elle a contribué à des évaluations internes de normalisation de couche et de son rôle dans la stabilité de l'entraînement, bien que les détails spécifiques de ces projets restent sous accords de non-divulgation.
Elle a également consulté pour OpenAI sur des méthodologies d'évaluation de la sécurité, en particulier autour de recherche en faisceau et de sa tendance à produire des sorties répétitives ou nuisibles. Ses recommandations ont influencé l'adoption de stratégies d'échantillonnage plus diverses dans certains systèmes de production. De plus, Seelen a collaboré avec des chercheurs de Google DeepMind sur des sujets liés à la conception de réseaux résiduels et à ses implications pour la contrôlabilité des modèles.
Publications sélectionnées et impact
Le travail le plus cité de Seelen comprend « Traçage causal des têtes d'attention dans les transformers » (2022), qui a introduit une technique d'intervention novatrice pour identifier les composants critiques dans le raisonnement des modèles. La méthodologie de l'article a été adoptée par d'autres chercheurs étudiant l'interprétabilité des réseaux neuronaux. Son article de 2024, « Lois d'échelle pour les défaillances d'alignement », a analysé comment les taux d'erreur dans les métriques de sécurité croissent avec la taille des modèles, fournissant des preuves quantitatives que les modèles plus grands nécessitent proportionnellement plus d'efforts d'alignement.
Elle a également écrit sur les limites des fonctions de perte pour capturer les préférences humaines, arguant que les objectifs standard d'entropie croisée sont insuffisants pour l'alignement. Cette perspective a suscité un débat dans la communauté, certains chercheurs plaidant pour des paradigmes d'entraînement alternatifs basés sur apprentissage curriculaire ou élagage de modèles comme mesures de sécurité indirectes.
Enseignement et mentorat
Seelen a enseigné des cours de troisième cycle sur la sécurité de l'IA à Stanford AI Lab, où elle a développé un programme couvrant à la fois les méthodes techniques et les considérations éthiques. Ses conférences sur échelle de température et son effet sur la confiance des sorties ont été largement partagées, et elle a encadré plusieurs étudiants doctorants qui ont ensuite travaillé dans la recherche sur l'alignement. Elle a également donné des conférences invitées à université Carnegie-Mellon et université d'Oxford, se concentrant sur des approches pratiques pour auditer les modèles déployés.
Travail actuel et orientations futures
En 2025, Seelen est affiliée à un institut de recherche à but non lucratif dédié à la sécurité de l'IA, où elle dirige une équipe étudiant les stratégies de initialisation des poids et leurs effets à long terme sur la corrigibilité des modèles. Ses projets actuels incluent le développement de références pour mesurer l'alignement à travers diverses tâches, avec un accent sur les mécanismes de attention croisée dans les systèmes multimodaux. Elle a également commencé à explorer l'intersection de IA générative et de la sécurité, en particulier dans le contexte de la génération automatisée de contenu.
Seelen a déclaré publiquement que le domaine de l'alignement de l'IA est encore à ses débuts, et elle a appelé à des recherches plus rigoureuses et reproductibles. Elle a évité les affirmations spéculatives sur l'intelligence artificielle générale, se concentrant plutôt sur les risques à court terme associés aux systèmes actuels de apprentissage profond. Son travail continue d'influencer à la fois la recherche académique et les pratiques industrielles, bien qu'elle reste prudente quant à la certitude de ses résultats.
Reconnaissance et service professionnel
Seelen a siégé dans des comités de programme pour plusieurs grandes conférences sur l'IA, y compris celles axées sur apprentissage automatique et réseaux neuronaux. Elle a examiné des articles pour des revues sur intelligence artificielle et a été membre de groupes de travail sur les normes de sécurité de l'IA. Bien qu'elle n'ait pas reçu de prix largement médiatisés, ses articles ont été parmi les plus téléchargés dans leurs actes respectifs, et son nombre de citations a augmenté régulièrement depuis 2021.
Elle a également contribué à des efforts d'éducation publique, rédigeant des résumés accessibles de sujets techniques tels que planification du taux d'apprentissage et normalisation par lots pour des publics non spécialisés. Ces efforts ont été salués pour leur clarté, bien que Seelen ait décliné les invitations à témoigner devant des organes gouvernementaux, préférant communiquer par des canaux académiques.
Vie personnelle et présence publique
Seelen maintient un profil public discret, avec une activité limitée sur les réseaux sociaux. Elle a accordé des interviews à des podcasts techniques mais a évité les apparitions dans les médias grand public. Son site web personnel comprend des notes détaillées sur ses méthodes de recherche, qui ont été utilisées par d'autres chercheurs pour reproduire ses expériences. Elle est connue pour son approche méticuleuse de la conception expérimentale, publiant souvent du code et des ensembles de données avec ses articles.
Malgré son accent sur la sécurité, Seelen a exprimé un optimisme quant au potentiel de l'IA à bénéficier à la société, à condition que les défis d'alignement soient relevés. Elle a soutenu que des solutions techniques, plutôt que des mandats réglementaires seuls, sont nécessaires pour garantir un déploiement sûr. Son travail en cours vise à fournir la base empirique pour de telles solutions, comblant le fossé entre l'alignement théorique et la mise en œuvre pratique.