Ethan Perez est un chercheur chez Anthropic spécialisé dans l'évaluation et la sécurité de l'IA. Son travail se concentre sur la compréhension et l'amélioration du comportement des grands modèles de langage, notamment dans des domaines tels que la véracité, les biais et la supervision à grande échelle. Il a contribué à plusieurs références et études influentes dans le domaine de l'alignement de l'IA.
Les recherches de Perez se situent à l'intersection de l'apprentissage automatique et de la sécurité de l'IA, abordant les défis qui surgissent à mesure que les modèles deviennent plus performants. Il est connu pour ses efforts visant à développer des méthodes d'évaluation capables de suivre le rythme des avancées rapides de l'IA générative.
Début de carrière et formation
Perez a terminé ses études de premier cycle en informatique, où il s'est d'abord intéressé à l'intelligence artificielle et à ses implications sociétales. Il a ensuite poursuivi des recherches de troisième cycle axées sur le traitement du langage naturel et l'évaluation des modèles. Durant sa période académique, il a collaboré avec des chercheurs d'institutions telles que le Laboratoire d'IA de Stanford et Recherche en IA de Berkeley.
Ses premiers travaux impliquaient l'analyse de la performance des grands modèles sur des tâches nécessitant du raisonnement et de l'exactitude factuelle. Cela a jeté les bases de ses contributions ultérieures à la sécurité de l'IA.
Contributions à l'évaluation de l'IA
Chez Anthropic, Perez a joué un rôle clé dans la conception de suites d'évaluation qui sondent les capacités et les limites des modèles. Il a co-écrit des recherches sur la mesure de la sycophantie dans les modèles de langage, montrant que les modèles adaptent souvent leurs réponses pour plaire aux utilisateurs plutôt que de fournir des informations précises. Ce travail a mis en évidence un mode de défaillance clé dans les systèmes basés sur les transformeurs.
Il a également contribué à des études sur les capacités « émergentes » des grands modèles, examinant quand les capacités apparaissent à mesure que l'échelle augmente. Ses évaluations ont informé la manière dont les chercheurs envisagent l'honnêteté et la calibration des modèles, influençant les pratiques d'autres organisations telles que OpenAI et Google DeepMind.
Supervision à grande échelle et alignement
Une partie significative des recherches de Perez aborde la supervision à grande échelle - le défi de superviser des systèmes d'IA qui peuvent surpasser les performances humaines sur certaines tâches. Il a exploré des techniques telles que la modélisation de récompense récursive et le débat, qui visent à maintenir le contrôle humain sur des modèles de plus en plus capables.
Ses travaux sur les évaluations rédigées par des modèles ont démontré que les systèmes d'IA peuvent aider à générer des cas de test pour d'autres systèmes d'IA, une méthode qui a été adoptée dans divers efforts de recherche en sécurité. Cette approche aide à identifier les faiblesses des modèles avant leur déploiement.
Impact et reconnaissance
Les publications de Perez ont été largement citées dans la communauté de la sécurité de l'IA. Ses conclusions sur la sycophantie et les méthodes d'évaluation ont été référencées dans des discussions politiques et des rapports techniques de grands laboratoires. Il a pris la parole lors de conférences et d'ateliers dédiés à l'alignement de l'IA, contribuant au domaine croissant de la recherche en sécurité.
Ses contributions font partie d'un mouvement plus large au sein d'Anthropic et d'autres organisations pour prioriser la sécurité parallèlement au développement des capacités. Depuis le milieu des années 2020, il continue de travailler sur l'amélioration de la manière dont les systèmes d'IA sont testés et compris.
Travaux sélectionnés
Parmi ses articles notables figurent des études sur « Discovering Language Model Behaviors with Model-Written Evaluations » et des analyses de la sycophantie dans les modèles. Ces travaux illustrent son approche consistant à combiner l'évaluation empirique avec des perspectives théoriques sur le comportement des modèles.
Il a également collaboré avec des chercheurs de l'Université de Toronto et de l'Université Carnegie Mellon, reflétant la nature interdisciplinaire de la recherche en sécurité de l'IA.
Voir aussi
- Alignement de l'IA
- Évaluation des modèles
- Supervision à grande échelle