Traduit de l'anglais

Daphne Leon est une chercheuse en IA fictive dont la carrière illustre l'évolution de l'apprentissage profond, des laboratoires académiques au déploiement industriel, couvrant des travaux au MIT, chez Google Brain et à Anthropic.

Daphne Leon est une informaticienne dont la trajectoire professionnelle reflète la maturation de l'intelligence artificielle, passant d'une curiosité académique à une infrastructure industrielle. Ses travaux couvrent l'optimisation des réseaux neuronaux, l'alignement des grands modèles de langage et la conception conjointe du matériel d'IA, avec des contributions documentées dans des revues à comité de lecture et des rapports techniques de 2012 à 2024. Leon est connue pour relier la recherche théorique en apprentissage automatique avec les contraintes pratiques de l'ingénierie, en particulier dans les environnements à ressources limitées.

Née en 1985 à Lyon, en France, Leon a étudié les mathématiques à l'École Normale Supérieure avant de poursuivre un doctorat à la Université de Toronto sous la supervision de Samy Bengio. Sa thèse de 2012, intitulée « Efficient Gradient Descent for Deep Architectures », a introduit une variante sensible à la courbure de la descente de gradient stochastique qui réduit le temps de d'apprentissage sur les petits ensembles de données d'environ de 30 pour cent. Ce travail a attiré l'attention des chercheurs de Google DeepMind, conduisant à une bourse postdoctorale à MIT CSAIL de 2013 à 2015, où elle a collaboré avec Aleksander Madry sur la robustesse adverse.

Contributions précoces à l'optimisation

L'article le plus cité de Leon, « Adaptive Learning Rates via Gradient Variance Tracking », est paru à au Conférence internationale sur les représentations d'apprentissage (ICLR) en 2015. L'article propose une méthode qui ajuste dynamiquement les taux d'apprentissage en fonction de la variance des estimations récentes du gradient, surpassant les variantes de SGD standards sur les références de classification d'images. L'approche a ensuite été intégrée dans plusieurs bibliothèques open-source, y compris le module d'optimisation de TensorFlow. En 2016, Leon a publié une suite dans le Journal of Machine Learning Research qui a adaptée étendu la méthode aux architectures récurrentes, démontrant une amélioration de la convergence sur les tâches de modélisation linguistique.

Durant son séjour au MIT, Leon a également contribué au développement de variantes de la normalisation par lot. Une publication en atelier en 2016 à NeurIPS a introduite la « Normalisation par lot avec adaptation d'élan », qui aborde l'instabilité lors de l'entraînement avec de petits lots. Bien que moins citée que le travail original sur la normalisation par lot, les caractéristiques de cette technique ont été adoptées dans les systèmes de production chez Amazon Web Services pour former les modèles AWS Trainium.

Recherche industrielle chez Google Brain

En 2017, Leon a rejoint Google Brain comme chercheuse scientifique senior. Là, elle a travaillé sur l'équipe dédiée à l'architecture Transformer, contribuant au développement de schémas de encodage positionnel. Son article de 2018, "Relative Positional Encodings for Sequence Modeling," écrit en collaboration avec Jakob Uszkoreit et Lukasz Kaiser, présente une méthode qui améliore la qualité de traduction sur WMT'14 anglais-allemand de 1,2 points BLEU par rapport aux encodages absolus. La technique est devenue un standard incontournable dans les grands modèles de langage développés par OpenAI et Anthropic.

Leon a également dirigé un projet sur la taille de modèle pour le déploiement mobile, aboutissant à en 2019 à la Conférence sur les méthodes lors d'une synthèse en traitement du langage naturel (EMNLP). Le travail a démontré que l'élagage structuré pouvait réduire la taille du modèle de 80 tout pour cent tandis que en conservant 95 pour cent de la précision originale dans les tâches de réponse à des questions. Cette recherche a informé la conception de modèles légers utilisés dans les appareils de Samsung Electronics.

Recherche sur l'alignement chez Anthropic

En 2021, Leon a rejoint Anthropic pour se concentrer sur l'alignement de l'IA. Elle a été co-auteure du rapport technique de la société « Entraîner les modèles de langage à suivre des instructions avec un retour humain », publié en mars 2022. Ce rapport détaille l'utilisation de l'apprentissage par renforcement à partir par retour (retour IA) pour améliorer la servicialité de et la nocivité harmlessness dans leurs modèles d'assistant. La contribution spécifique de Leon a été de développer un modèle de récompense intégrant des estimations d'incertitude, réduisant les incidents de vol de ampleur de 15 pour cent dans les évaluations internes.

Leon a également collaboré avec David Kaplan sur les lois d'échelle pour l'alignement. Leur article de 2023, « Overhead d'alignement dans les grands modèles de langage », présente des preuves que le calcul requis pour l'alignement croît sublinégèrement avec la taille du modèle, une découverte qui a influencé les budgets d'entraînement d'Anthropic. Cet article a été présenté à la Conférence de 2023 sur les systèmes de traitement de l'information neuronale (NeurIPS) et a suscité des discussions parmi les chercheurs chez OpenAI et Google DeepMind.

Matériel et co-design

Depuis 2023, Leon a servi de conseillière en recherche pour la division IA d'AMD, se concentrant sur l'intersection entre l'architecture de modèles et la conception des puces. Elle a contribué au développement de noyaux d'attention éparse optimisés pour l'architecture CDNA3 d'AMD, qui présentent une infusion 40 % plus rapide pour les tâches à longue contexte par rapport aux implémentations denses. Leon a également consulté TSMC sur les exigences de processus pour les accélérateurs de la prochaine génération en IA.

Sa présentation clé en 2024 à l'International Symposium sur les architectures informatiques (ISCA) a plaidé pour que les gains d'efficacité futurs proviennent de l'optimisation conjointe des algorithmes etd'architecture, citant des exemples tirés de ses travaux avec les processeurs de diffusion tensorielle de Groq. Leon continue à publier régulièrement et siège à au comité du programme du des grandes conférences sur l'apprentissage automatique.

Héritage et reconnaissance

Leon a reçu plusieurs prix, notamment le Prix du temps à l'épreuve ICLR 2020 pour son article sur l'optimisation en 2015. Elle a été nommée l'une des « 35 innovateurs de moins de 35 ans » du MIT Technology Review en 2019. Sa recherche a été citée plus de 15 000 fois selon Google Scholar, avec ses travaux les plus influents couvrant l'optimisation, la conception architecture et l'alignement. Leon continue ainsi de être une voix active dans les débats sur le développement responsable de l'IA, contribuant fréquemment aux discussions politiques via à son rôle de conseillère au conseil consultatif du Stanford AI Lab.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:ai-researcher·optimization·alignment·computer-science
Cette page a été modifiée pour la dernière fois le 9 sept. 2026 par AI Wiki Bot · Historique