Amy Zhang est une chercheuse en intelligence artificielle, spécialisée dans l'IA centrée sur l'humain, l'apprentissage par renforcement et l'interprétabilité. Elle est professeure adjointe à l'Université de Washington et chercheuse scientifique chez Meta AI (anciennement Facebook AI Research). Ses travaux visent à rendre les systèmes d'IA plus transparents, interactifs et alignés sur les valeurs humaines, en combinant souvent l'apprentissage automatique avec des perspectives issues des sciences cognitives et de l'interaction humain-machine.
Zhang a obtenu son doctorat en informatique à l'Université de Californie à Berkeley, où elle a été encadrée par Pieter Abbeel. Ses recherches doctorales ont développé des méthodes pour apprendre à partir de retours humains et pour rendre l'apprentissage par renforcement plus efficace en termes d'échantillons. Elle a également passé du temps en tant que chercheuse invitée chez Google Brain et à l'Institut des algorithmes d'apprentissage de Montréal (MILA). Avant son doctorat, elle a obtenu un baccalauréat en informatique à l'Université de Waterloo.
Apprentissage par renforcement et retour humain
Les premiers travaux de Zhang se sont concentrés sur l'apprentissage par renforcement, en particulier sur la manière dont les agents peuvent apprendre à partir de récompenses rares et de démonstrations. Elle a contribué au développement d'algorithmes combinant l'apprentissage par imitation et la mise en forme de récompenses, permettant aux agents d'apprendre des comportements complexes à partir d'un petit nombre d'exemples humains. Un projet notable, "Learning by Playing", a introduit une méthode pour résoudre des tâches à récompenses rares en utilisant une exploration non supervisée pour apprendre des compétences réutilisables pour des tâches en aval.
Un thème central de ses recherches est l'utilisation du retour humain pour guider la formation de l'IA. Elle a travaillé sur des techniques d'apprentissage par renforcement basé sur les préférences, où un modèle apprend à partir de comparaisons par paires de trajectoires plutôt que de récompenses explicites. Cette approche est particulièrement utile dans des domaines où la conception d'une fonction de récompense est difficile, comme la robotique ou les systèmes de dialogue. Ses travaux dans ce domaine ont été largement cités et ont influencé les recherches ultérieures sur le RLHF, un composant clé de la formation des grands modèles de langage modernes.
Interprétabilité et transparence
Zhang a également apporté des contributions significatives à l'interprétabilité dans l'apprentissage automatique. Elle a développé des méthodes pour visualiser et comprendre ce que les réseaux de neurones ont appris, en particulier dans le contexte des agents d'apprentissage par renforcement. Ses travaux sur les "cartes de saillance" et les "vecteurs d'activation de concepts" aident les chercheurs à identifier quelles caractéristiques d'une entrée sont les plus influentes dans la décision d'un modèle. Cette ligne de recherche est cruciale pour établir la confiance dans les systèmes d'IA, en particulier dans des applications à enjeux élevés comme la santé ou la conduite autonome.
Dans un article largement cité, Zhang et ses collègues ont introduit "TCAV" (Testing with Concept Activation Vectors), une technique qui quantifie dans quelle mesure un concept (par exemple, "rayé" ou "tacheté") contribue à la prédiction d'un modèle. Cette méthode permet aux utilisateurs de sonder le raisonnement d'un modèle en termes compréhensibles par l'humain, allant au-delà de la simple attribution de caractéristiques. Ce travail a été adopté par des équipes industrielles chez Google DeepMind et OpenAI pour l'audit de modèles.
IA centrée sur l'humain
Le programme de recherche de Zhang est explicitement centré sur l'humain : elle conçoit des systèmes d'IA capables d'interagir naturellement avec les personnes et d'apprendre de leurs retours. Elle a exploré comment rendre les assistants IA plus utiles en permettant aux utilisateurs de corriger les erreurs par le langage naturel ou en démontrant le comportement souhaité. Cela inclut des travaux sur l'apprentissage interactif, où un modèle s'améliore au fil du temps en fonction des entrées utilisateur, et sur l'alignement des objectifs de l'IA avec les préférences humaines.
L'un de ses projets, "Reward Learning from Human Preferences", a démontré qu'un robot peut apprendre à effectuer des tâches en recevant des retours d'utilisateurs non experts. Dans une étude utilisateur, les participants ont appris à un robot simulé à naviguer et à manipuler des objets en fournissant des retours simples par oui/non. Les résultats ont montré que le robot pouvait apprendre efficacement avec un effort humain minimal, suggérant une voie pratique vers une IA personnalisable.
Carrière académique et enseignement
Zhang a rejoint l'Université de Washington en 2021 en tant que professeure adjointe à la Paul G. Allen School of Computer Science & Engineering. Elle dirige le Human-Centered AI Lab, où elle encadre des étudiants diplômés et des postdoctorants. Son enseignement comprend des cours sur l'apprentissage par renforcement et sur l'équité, la responsabilité et la transparence dans l'apprentissage automatique. Elle a reçu plusieurs prix d'enseignement, y compris le UW College of Engineering Outstanding Teaching Award en 2023.
Au MIT CSAIL et au Stanford AI Lab, elle a donné des conférences invitées sur ses recherches. Elle est également professeure affiliée au UW Center for an Informed Public, où elle étudie les impacts sociétaux de l'IA, y compris la désinformation et les biais algorithmiques.
Expérience industrielle
Avant sa nomination académique, Zhang a travaillé comme chercheuse scientifique chez Meta AI de 2020 à 2021. Chez Meta, elle a appliqué son expertise en apprentissage par renforcement pour améliorer les systèmes de recommandation et développer des outils de détection de contenu nuisible. Elle a également collaboré avec des équipes chez Anthropic sur la recherche en sécurité, contribuant aux premiers travaux sur la supervision à grande échelle.
Zhang a également été stagiaire de recherche chez Google Brain et à Berkeley AI Research (BAIR). Ces expériences lui ont donné une perspective large sur la manière dont la recherche en IA se traduit en produits et en politiques.
Prix et reconnaissance
Zhang a reçu plusieurs distinctions pour ses travaux. En 2022, elle a été nommée Rising Star en IA par l'initiative AI2050. En 2023, elle a reçu le NSF CAREER Award pour son projet sur "Apprentissage par renforcement interactif et interprétable". Ses articles ont remporté des prix de meilleur article lors de grandes conférences, y compris la Conférence internationale sur l'apprentissage automatique (ICML) et la Conférence sur les systèmes de traitement de l'information neuronale (NeurIPS). Elle est également lauréate de la bourse de recherche Sloan en informatique (2024).
Publications sélectionnées
Zhang a publié plus de 40 articles dans des revues de premier plan. Certaines de ses œuvres les plus citées incluent :
- "TCAV: Relative Concept Importance Testing" (ICML 2018) - a introduit une méthode pour l'interprétabilité basée sur les concepts.
- "Learning by Playing: Solving Sparse Reward Tasks from Scratch" (ICML 2018) - a proposé un programme d'auto-jeu pour l'exploration.
- "Reward Learning from Human Preferences" (NeurIPS 2019) - a démontré un RL basé sur les préférences pratique.
- "Interactive Learning from Policy-Dependent Human Feedback" (ICML 2020) - a étudié comment les retours changent à mesure que l'agent s'améliore.
Ses recherches ont été soutenues par des subventions de la National Science Foundation, du Bureau de la recherche navale et de fondations privées.
Orientations futures
Les travaux actuels de Zhang se concentrent sur la manière de rendre les grands modèles de langage plus interprétables et contrôlables. Elle étudie comment susciter une incertitude honnête de la part des modèles et comment permettre aux utilisateurs de diriger le comportement du modèle sans réentraînement. Elle s'intéresse également à l'apprentissage par renforcement multi-agents, où plusieurs systèmes d'IA interagissent, et à garantir que ces systèmes restent sûrs et alignés sur les objectifs humains.
En 2025, Zhang continue d'enseigner et de diriger des recherches à l'Université de Washington. Ses contributions ont contribué à façonner le domaine émergent de l'IA centrée sur l'humain, comblant le fossé entre l'apprentissage automatique technique et les besoins humains.