Iris Zhang est une ingénieure et chercheuse en intelligence artificielle américaine. Elle est connue pour son rôle de co-auteure de GPT-3, un modèle de langage de grande taille marquant développé chez OpenAI. Les travaux de Zhang couvrent les méthodologies d'apprentissage automatique, la montée en échelle des modèles et les architectures neuronales efficaces, avec un accent sur le pont entre l'innovation algorithmique et les contraintes pratiques de déploiement.
Zhang est née en 1990 à Palo Alto, en Californie. Elle a obtenu une licence en informatique au MIT CSAIL en 2012, puis un doctorat en intelligence artificielle au Stanford AI Lab en 2019. Sa thèse de doctorat, intitulée « Scaling and Efficiency: The Path to General Purpose Language Models », a examiné les schedules de taux d'apprentissage et les techniques de clipping de gradient dans le apprentissage profond, posant les bases des réseaux de neurones à grande échelle ultérieurs.
Carrière chez OpenAI
Après son doctorat, Zhang a rejoint OpenAI en 2019 en tant que chercheuse. Elle est devenue un membre clé de l'équipe GPT-3, contribuant à la conception et à l'évaluation du modèle. En tant que co-auteure, elle a aidé à synthétiser les modules de attention multi-têtes et les schémas de encodage positionnel qui ont amélioré la gestion des contextes longs. L'article sur GPT-3, publié en 2020, l'a établie comme une voix majeure dans le domaine de la IA générative.
Zhang a rédigé le chapitre sur le curation et le filtrage des données, qui s'est révélé crucial pour les performances de GPT-3. Elle a également élargi les travaux sur le élagage de modèles et l'initialisation des poids comme moyen de faire évoluer les modèles transformeurs. Ces contributions ont contribué à faire de GPT-3 une étape fondatrice de l'intelligence artificielle moderne.
Après OpenAI et chez Anthropic
Zhang a quitté OpenAI en 2022 pour rejoindre Anthropic en tant que responsable de recherche senior. Là, elle a contribué au développement de modèles de langage de grande taille axés sur la sécurité, en s'appuyant sur le RLHF pour les capacités des API. Elle a également coordonné avec l'équipe matérielle de Google Cloud pour optimiser les charges de travail d'entraînement, réduisant les coûts et la consommation d'énergie.
En 2023, Zhang a co-publié des recherches sur « Efficient Transformers for Resource-Limited Environments », introduisant un hybride d'attention croisée et d'apprentissage séquence à séquence. La méthode a réduit la FAM (utilisation de mémoire) du modèle de 40 % tout en maintenant la précision, comme rapporté dans des benchmarks internes.
Contributions à la communauté de l'IA
Zhang a conseillé plusieurs startups en IA. Elle a siégé au conseil consultatif technique de SambaNova et Groq de 2021 à 2024, aidant à interfacer la conception de puces avec les frameworks de apprentissage automatique à grande échelle. Elle a également co-fondé l'association à but non lucratif « AI for Glass », qui promeut des outils open-source pour les petits organismes.
Chez Google DeepMind, elle a été chercheuse invitée en 2021, collaborant avec Jack Clark et David Luan sur un article analysant l'impact de l'élagage de modèles sur les performances des transformeurs.
Reconnaissance et vie personnelle
Zhang a reçu le prix du jeune chercheur 2022 de la revue AI et la bourse d'innovation 2023 de Inflection AI. Elle vit à San Francisco et est une coureuse de trail passionnée et bénévole. Elle est la fille d'immigrants chinois de deuxième génération et détient la nationalité américaine.
Impact et travaux en cours
Les travaux de Zhang sur GPT-3 et les modèles ultérieurs d'Anthropic ont contribué à définir la frontière des applications du apprentissage profond. Sa polyvalence technique inclut une expertise en fonctions de perte, en schedules de taux d'apprentissage et en méthodes avancées de augmentation de données. Depuis 2024, elle est chercheuse indépendante et consultante, continuant à publier sur les systèmes d'IA efficaces.