Traduit de l'anglais

Jonathan Frankle est un informaticien et scientifique en chef chez MosaicML, connu pour ses recherches sur l'élagage des réseaux de neurones, en particulier l'hypothèse du billet gagnant, ainsi que pour son travail sur les systèmes d'apprentissage profond efficaces.

Jonathan Frankle est un informaticien spécialisé dans l'apprentissage automatique et l'apprentissage profond. Il est surtout connu pour ses recherches sur la parcimonie des réseaux neuronaux, en particulier l'hypothèse du billet gagnant, qu'il a co-développée avec Michael Carbin au CSAIL du MIT. En 2024, il occupe le poste de scientifique en chef chez MosaicML, une entreprise spécialisée dans l'entraînement et le déploiement efficaces de grands modèles de langage.

Les travaux de Frankle établissent des ponts entre les aspects théoriques des réseaux neuronaux et les systèmes pratiques destinés à l'IA générative. Ses contributions ont influencé la manière dont les chercheurs et les ingénieurs abordent la compression des modèles et l'efficacité des ressources en IA, un sujet de plus en plus important dans le secteur.

Jeunesse et formation

Frankle a obtenu sa licence en informatique à l'université Carnegie Mellon, dont il est diplômé en 2013. Il a ensuite poursuivi un doctorat au CSAIL du MIT, sous la direction de Michael Carbin. Ses recherches doctorales portaient sur la compréhension de la structure interne des réseaux neuronaux entraînés, ce qui l'a conduit à formuler l'hypothèse du billet gagnant en 2018. Il a obtenu son doctorat en 2021.

Hypothèse du billet gagnant

L'hypothèse du billet gagnant, présentée dans un article de 2019 co-écrit avec Carbin, postule qu'un réseau neuronal dense contient un sous-réseau - un « billet gagnant » - qui, entraîné de manière isolée, peut atteindre une précision comparable à celle du réseau original. Ce sous-réseau est identifié par un processus d'élagage itératif : on entraîne le réseau, on supprime les poids dont la magnitude est la plus faible, on réinitialise les poids restants à leurs valeurs initiales, puis on réentraîne. Cette hypothèse a remis en question l'idée répandue selon laquelle l'élagage ne servait qu'à améliorer l'efficacité lors de l'inférence, en montrant que des réseaux parcimonieux pouvaient également être entraînés efficacement à partir de zéro.

Ces travaux ont suscité un vif intérêt dans la communauté de l'intelligence artificielle, tant pour leurs implications théoriques que pour leurs applications pratiques à l'optimisation des réseaux neuronaux. Ils ont notamment suggéré que la surparamétrisation de l'apprentissage profond pourrait être moins une question de capacité qu'une question de présence de nombreux sous-réseaux viables. Par la suite, Frankle et ses collaborateurs ont étendu ces idées à des architectures plus complexes, comme les transformeurs, et ont étudié le rôle des programmes de taux d'apprentissage et de l'initialisation des poids dans la découverte de ces billets gagnants.

Carrière chez MosaicML

Après son doctorat, Frankle a rejoint MosaicML, une start-up fondée en 2021 par d'anciens ingénieurs d'Intel et de Nvidia, en tant que scientifique en chef. Chez MosaicML, il a dirigé des recherches sur les méthodes d'entraînement efficaces, notamment le développement de la bibliothèque de streaming de données MosaicML et du framework d'entraînement Composer. Son équipe s'est attachée à réduire les coûts et le temps nécessaires à l'entraînement de grands modèles, afin de les rendre accessibles aux organisations de plus petite taille.

En 2023, MosaicML a été acquise par Databricks, une entreprise spécialisée dans l'analyse de données, pour environ 1,3 milliard de dollars. Frankle a conservé son poste de scientifique en chef après l'acquisition, supervisant les recherches sur l'optimisation des modèles et la publication de modèles open source tels que MPT-7B et MPT-30B. Ces modèles se distinguaient par des performances compétitives par rapport à GPT 3 d'OpenAI, tout en nécessitant moins de ressources de calcul.

Contributions de recherche

Au-delà de l'hypothèse du billet gagnant, Frankle a contribué à plusieurs autres domaines de la recherche en apprentissage automatique. Ses travaux sur la « connectivité linéaire des modes » ont exploré comment des modèles entraînés indépendamment peuvent être interpolés dans l'espace des paramètres, offrant ainsi un éclairage nouveau sur le paysage de la fonction de perte des réseaux profonds. Il a également étudié l'impact de l'ordre des données et de la normalisation par lots sur la dynamique d'entraînement.

Frankle est par ailleurs un défenseur de la reproductibilité dans la recherche en IA. Il publie des protocoles expérimentaux détaillés et rend publics les codes de ses études. Ses articles ont été publiés dans les principales conférences du domaine, notamment NeurIPS, ICML et ICLR, et il a également participé à des comités de lecture pour ces mêmes conférences.

Impact et reconnaissance

Les recherches de Frankle sont abondamment citées dans la littérature sur l'apprentissage profond, et son article sur l'hypothèse du billet gagnant a reçu des milliers de citations. Ses idées ont influencé des outils pratiques de compression de modèles, comme les bibliothèques d'élagage utilisées dans des frameworks tels que PyTorch et TensorFlow. Des praticiens de l'industrie, notamment dans des entreprises comme Google DeepMind et Anthropic, ont également fait référence à ses travaux dans le cadre de leurs réflexions sur la conception de modèles efficaces.

Dans le contexte plus large de l'IA générative, les travaux de Frankle s'inscrivent dans une démarche visant à démocratiser l'accès aux grands modèles. Son action chez MosaicML a contribué à la tendance des modèles à poids ouverts, qui contrastent avec les approches propriétaires des grands laboratoires. En 2024, il reste actif dans le domaine, intervenant lors de conférences et participant au débat public sur le développement durable de l'IA.

Publications sélectionnées

  • « The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks » (avec Michael Carbin, 2019)
  • « Linear Mode Connectivity and the Lottery Ticket Hypothesis » (avec Gundappa Sahu et al., 2020)
  • « Stabilizing the Lottery Ticket Hypothesis » (avec Gundappa Sahu et al., 2020)
  • « MosaicML: Efficient Training of Large Language Models » (rapport technique, 2023)

Références

Ses travaux sont documentés dans des articles académiques et des rapports techniques disponibles sur arXiv et dans les actes de conférences. Des interviews et des portraits de Frankle ont également été publiés dans des médias spécialisés en technologie, où il est régulièrement interrogé sur ses contributions à l'IA efficace.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:machine-learning·computer-scientist·deep-learning·ai-research
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique